Dr.Credit: Rubric-Grounded Process Credit Assignment for Deep Research Agents
cs.CL, cs.AI
Submitted: 2026-09-28
Updated: 2026-09-28
Terminology
Sources
- HealthBench: Evaluating Large Language Models Towards Improved Human Health
- Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning
- RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards
- WebExplorer: Explore and Evolve for Training Long-Horizon Web Agents
- ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment
- Deep Research as Rubric for Reinforcement Learning
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Rethinking Rubric Generation for Improving LLM Judge and Reward Modeling for Open-ended Tasks
- Hindsight Credit Assignment for Long-Horizon LLM Agents
- Kimi K3: Open Frontier Intelligence
- Tongyi DeepResearch Technical Report
- QUEST: Training Frontier Deep Research Agents with Fully Synthetic Tasks
- DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence
- Qwen3 Technical Report
- GLM-5: from Vibe Coding to Agentic Engineering
- DEEPRUBRIC: Evidence-Tree Rubric Supervision for Efficient Reinforcement Learning of Deep Research Agents
- LOTAPO: Leave-One-Turn Attribution for Self-Generated Process Rewards in Multi-Turn Search Reasoning
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering