Stochastic Teacher Intervention for Agentic On-Policy Distillation
cs.CL, cs.AI
Submitted: 2026-10-07
Updated: 2026-10-07
Terminology
Sources
- Look Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy Distillation
- DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models
- Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs
- MegaScience: Pushing the Frontiers of Post-Training Datasets for Science Reasoning
- Skywork Open Reasoner 1 Technical Report
- Entropy-Aware On-Policy Distillation of Language Models
- On-Policy Distillation with Curriculum Turn-level Guidance for Multi-turn Agents
- Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe
- Multi-Turn On-Policy Distillation with Prefix Replay
- When Privileged Guidance Misaligns: State-Matched Routing and Contextualized Self-Distillation for Multi-Turn Agents
- Trinity-RFT: A General-Purpose and Unified Framework for Reinforcement Fine-Tuning of Large Language Models
- GPQA: A Graduate-Level Google-Proof Q&A Benchmark
- Proximal Policy Optimization Algorithms
- Backtracking When It Strays: Mitigating Dual Exposure Biases in LLM Reasoning Distillation
- TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents
- DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation
- Pass the Baton: Trajectory-Relayed On-Policy Distillation
- Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement
- Qwen3 Technical Report
- DAPO: An Open-Source LLM Reinforcement Learning System at Scale
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering