Agent0: Unleashing Self-Evolving Agents from Zero Data via Tool-Integrated Reasoning
cs.LG
Submitted: 2025-11-20
Updated: 2026-09-21
Comments: COLM 2026
Code: https://github.com/aiming-lab/Agent0
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines
- Plan-and-Act: Improving Planning of Agents for Long-Horizon Tasks
- SeRL: Self-Play Reinforcement Learning for Large Language Models with Limited Data
- GPT-4 Technical Report
- ReTool: Reinforcement Learning for Strategic Tool Use in LLMs
- Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous RL
- Online Difficulty Filtering for Reasoning Oriented Reinforcement Learning
- WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent
- Reinforcement Learning for Tool-Integrated Interleaved Thinking towards Cross-Domain Generalization
- Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails
- FullStack Bench: Evaluating LLMs as Full Stack Coders
- MDocAgent: A Multi-Modal Multi-Agent Framework for Document Understanding
- OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems
- Training Verifiers to Solve Math Word Problems
- Measuring Massive Multitask Language Understanding
- Self-play with Execution Feedback: Improving Instruction-following Capabilities of Large Language Models
- Measuring Mathematical Problem Solving With the MATH Dataset
- R-Zero: Self-Evolving Reasoning LLM from Zero Data
- Understanding Tool-Integrated Reasoning
- Learning to Solve and Verify: A Self-Play Framework for Code and Test Generation
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks