Peak-Then-Collapse and the Four Interface Channels of Knowledge-Graph Tool Use
cs.CL
Submitted: 2026-05-25
Updated: 2026-08-30
Terminology
Sources
- FireAct: Toward Language Agent Fine-tuning
- ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- On Group Relative Policy Optimization Collapse in Agent Search: The Lazy Likelihood-Displacement
- ReTool: Reinforcement Learning for Strategic Tool Use in LLMs
- Scaling Laws for Reward Model Overoptimization
- Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning
- Knowledge Graphs are Implicit Reward Models: Path-Derived Signals Enable Compositional Reasoning
- ToRL: Scaling Tool-Integrated RL
- HyperGraphPro: Progress-Aware Reinforcement Learning for Structure-Guided Hypergraph RAG
- ToolRL: Reward is All Tool Learning Needs
- Spurious Rewards: Rethinking Training Signals in RLVR
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- HybridFlow: A Flexible and Efficient RLHF Framework
- Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models
- Plan Then Retrieve: Reinforcement Learning-Guided Complex Reasoning over Knowledge Graphs
- Qwen2.5 Technical Report
- RAGEN-2: Reasoning Collapse in Agentic RL
- RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
- StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering