TTPO: Test-Time Policy Optimization
cs.CL
Submitted: 2026-08-27
Updated: 2026-08-27
Code: https://github.com/ZJU-REAL/TTPO
Terminology
Sources
- On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes
- Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs
- Test-Time Reinforcement Learning for GUI Grounding via Region Consistency
- Consensus as Privileged Context for Label-Free Self-Distillation
- MiniLLM: On-Policy Distillation of Large Language Models
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance
- Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision
- Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing
- On-Policy Self-Distillation without Any Supervision
- Detecting and Mitigating the Correct-Answer Extinction Window in Test-Time Reinforcement Learning with Majority Voting
- STAPO: Stabilizing Reinforcement Learning for LLMs by Silencing Rare Spurious Tokens
- Self-Distilled Policy Gradient
- Decoupled Weight Decay Regularization
- Self-Distilled Agentic Reinforcement Learning
- SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- OpenAI GPT-5 System Card
- Kimi K3: Open Frontier Intelligence
- Qwen3.5-Omni Technical Report
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering