When Should Agents Think? Adaptive Reasoning via Cross-Turn Estimation
cs.AI, cs.CL
Submitted: 2026-10-08
Updated: 2026-10-08
Code: https://github.com/HututuAI/RACE
Terminology
Sources
- Search More, Think Less: Rethinking Long-Horizon Agentic Search for Efficiency and Generalization
- Toward Effective Tool-Integrated Reasoning via Self-Evolved Preference Learning
- Beyond Trajectory-Level Attribution: Graph-Based Credit Assignment for Agentic Reinforcement Learning
- ChatShopBuddy: Towards Reliable Conversational Shopping Agents via Reinforcement Learning
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence
- Agentic Entropy-Balanced Policy Optimization
- Agentic Reinforced Policy Optimization
- GLM-5: from Vibe Coding to Agentic Engineering
- Branching Policy Optimization: Sandbox-Native Language Agent Reinforcement Learning
- Hierarchy-of-Groups Policy Optimization for Long-Horizon Agentic Tasks
- Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning
- Toward Generalist Autonomous Research via Hypothesis-Tree Refinement
- Kimi K3: Open Frontier Intelligence
- DART: Draft-Agreement Routing for Training-Free Adaptive Thinking Budgets in Hybrid Reasoning Models
- Can Confidence Estimates Decide When Chain-of-Thought Is Necessary for LLMs?
- OpenResearcher: A Fully Open Pipeline for Long-Horizon Deep Research Trajectory Synthesis
- AdaCoT: Pareto-Optimal Adaptive Chain-of-Thought Triggering via Reinforcement Learning
- Prolonged Reasoning Is Not All You Need: Certainty-Based Adaptive Routing for Efficient LLM/MLLM Reasoning
- Agent-Omit: Adaptive Context Omission for Efficient LLM Agents
Related papers
- MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction
- Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
- The Clinician's Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing
- MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention
- Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems
- VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection