Selecting Diverse SFT Traces Improves Post-RL Generalization
cs.LG, cs.AI
Submitted: 2026-09-27
Updated: 2026-09-27
Terminology
Sources
- Phi-4-reasoning Technical Report
- Front-Loading Reasoning: The Synergy between Pretraining and Post-Training Data
- Llama-Nemotron: Efficient Reasoning Models
- Graph of Thoughts: Solving Elaborate Problems with Large Language Models
- Seed1.5-Thinking: Advancing Superb Reasoning Models with Reinforcement Learning
- Behavior Injection: Preparing Language Models for Reinforcement Learning
- Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles
- Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models
- SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training
- Process Reinforcement through Implicit Rewards
- The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- Chasing Random: Instruction Selection Strategies Fail to Generalize
- Stream of Search (SoS): Learning to Search in Language
- GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models
- rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking
- OpenThoughts: Data Recipes for Reasoning Models
- Reinforced Self-Training (ReST) for Language Modeling
- Reasoning with Language Model is Planning with World Model
- OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks