Learning Query-Specific Rubrics from Human Preferences for DeepResearch Report Generation
cs.CL
Submitted: 2026-02-03
Updated: 2026-09-02
Code: https://github.com/THUDM/slime
Terminology
Sources
- CL-bench: A Benchmark for Context Learning
- DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents
- Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- GPT-4 Technical Report
- Web-Shepherd: Advancing PRMs for Reinforcing Web Agents
- IterResearch: Rethinking Long-Horizon Agents with Interaction Scaling
- Reinforcement Learning with Rubric Anchors
- CL-bench Life: Can Language Models Learn from Real-Life Context?
- Humanity's Last Exam
- DeepResearch Bench II: Diagnosing Deep Research Agents via Rubrics from Expert Reports
- HelloBench: Evaluating Long Text Generation Capabilities of Large Language Models
- WebThinker: Empowering Large Reasoning Models with Deep Research Capability
- AgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep Research
- WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines for Open-Ended Deep Research
- GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving
- DeepSeek-V3 Technical Report
- P-Check: Advancing Personalized Reward Model via Learning to Generate Dynamic Checklist
- WebExplorer: Explore and Evolve for Training Long-Horizon Web Agents
- DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering