AI Can Learn Scientific Taste
Jingqi Tong, Mingzhe Li, Hangcheng Li, Yongzhuo Yang, Yurong Mou, Weijie Ma, Hongji Chen, Xiaoran Liu, Qinyuan Cheng, Ming Zhang, Qiguang Chen, Weifeng Ge, Qipeng Guo, Tianlei Ying, Tianxiang Sun, Yining Zheng, Zhiheng Xi, Xinchi Chen, Jun Zhao, Ning Ding, Xuanjing Huang, Yu-Gang Jiang, Xipeng Qiu
cs.CL
Submitted: 2026-08-19
Updated: 2026-08-20
Code: https://github.com/tongjingqi/AI-Can-Learn-Scientific-Taste
Terminology
Sources
- Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning
- WisPaper: Your AI Scholar Search Engine
- Agent Laboratory: Using LLM Agents as Research Assistants
- The AI Scientist-v2: Workshop-Level Automated Scientific Discovery via Agentic Tree Search
- Can LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100+ NLP Researchers
- The Ideation-Execution Gap: Execution Outcomes of LLM-Generated versus Human Research Ideas
- WorldPM: Scaling Human Preference Modeling
- Learning to summarize from human feedback
- RewardBench: Evaluating Reward Models for Language Modeling
- RMB: Comprehensively Benchmarking Reward Models in LLM Alignment
- Reward Reasoning Model
- Generative Reward Models
- Generative Verifiers: Reward Modeling as Next-Token Prediction
- Inference-Time Scaling for Generalist Reward Modeling
- RM-R1: Reward Modeling as Reasoning
- Unified Reward Model for Multimodal Understanding and Generation
- Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning
- The Invisible Leash: Why RLVR May or May Not Escape Its Origin
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering