Explore More, Drift Less: Outcome-Only Reinforcement Learning Can Suffice for Long-Horizon Interactive Agents
cs.LG, cs.AI
Submitted: 2026-09-01
Updated: 2026-09-01
Comments: 13 pages, 6 figures
Code: https://github.com/AlibabaResearch/SignalCoverageRL
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Reinforcement Learning for Long-Horizon Interactive LLM Agents
- Metis: Bridging Text and Code Memory for Self-Evolving Agents
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?
- Keep Policy Gradient in Charge: Sibling-Guided Credit Distillation for Long-Horizon Tool-Use Agents
- GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models
- Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning
- SeeUPO: Sequence-Level Agentic-RL with Convergence Guarantees
- Simulate to Generalize: Scaling Stateful Supervision for API-calling Agents using LLM World Models
- Evaluating Test-Time Scaling of General LLM Agents
- CuES: A Curiosity-driven and Environment-grounded Synthesis Framework for Agentic RL
- Towards Enterprise-Ready Computer Using Generalist Agent
- MiroThinker: Pushing the Performance Boundaries of Open-Source Research Agents via Model, Context, and Interactive Scaling
- Proximal Policy Optimization Algorithms
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism
- Learning and Reusing Policy Decompositions for Hierarchical Generalized Planning with LLM Agents
- Expanding LLM Agent Boundaries with Strategy-Guided Exploration
- SkillX: Automatically Constructing Skill Knowledge Bases for Agents
- Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks