StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction
cs.CL, cs.AI
Submitted: 2026-05-07
Updated: 2026-09-25
Code: https://github.com/xxyQwQ/StraTA
Terminology
Sources
- MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention
- RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- Plan-and-Act: Improving Planning of Agents for Long-Horizon Tasks
- KTO: Model Alignment as Prospect Theoretic Optimization
- Towards Efficient Online Tuning of VLM Agents via Counterfactual Soft Reinforcement Learning
- Group-in-Group Policy Optimization for LLM Agent Training
- Hierarchy-of-Groups Policy Optimization for Long-Horizon Agentic Tasks
- REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization
- CPPO: Accelerating the Training of Group Relative Policy Optimization-Based Reasoning Models
- Understanding R1-Zero-Like Training: A Critical Perspective
- The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery
- Agent Lightning: Train ANY AI Agents with Reinforcement Learning
- HiPER: Hierarchical Reinforcement Learning with Explicit Credit Assignment for Large Language Model Agents
- Maximizing Confidence Alone Improves Reasoning
- Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents
- Proximal Policy Optimization Algorithms
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering