Allspark: Weak to Strong Transfer via Alternating Chain of Thought
cs.LG, cs.AI
Submitted: 2026-09-26
Updated: 2026-09-26
Terminology
Sources
- Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision
- ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems
- DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence
- Weak-to-Strong Generalization via Direct On-Policy Distillation
- Weak Critics Make Strong Learners: On-Policy Critique Distillation for Scalable Oversight
- Kimi K3: Open Frontier Intelligence
- Score Centering Stabilizes Off-policy Reinforcement Learning
- Breaking the Tokenizer Barrier: On-Policy Distillation across Model Families
- Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation
- Learning to Decode Collaboratively with Multiple Language Models
- Qwen3 Technical Report
- Weak-to-Strong Reasoning
- Weak-to-Strong On-Policy Distillation
- APRIL: Active Partial Rollouts in Reinforcement Learning to Tame Long-tail Generation
- Weak-to-Strong Search: Align Large Language Models via Searching over Small Language Models
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks