What Pretraining and Midtraining Make Learnable from Rewards?
cs.LG, cs.AI, cs.CL
Submitted: 2026-09-29
Updated: 2026-09-29
Project page: https://yuxinchen2020.github.io/publications/transfo
Terminology
Sources
- RL Post-Training Builds Compositional Reasoning Strategies
- Verify to Amplify: Improving Reasoning via Learned Chain-of-Thought Verification
- DeepCoder: Learning to Write Programs
- Titans: Learning to Memorize at Test Time
- When can transformers reason with abstract symbols?
- Unveiling Induction Heads: Provable Training Dynamics and Feature Learning in Transformers
- Training Verifiers to Solve Math Word Problems
- Frustratingly Simple Black-Box Adaptation of Language Models via Logit Bias
- Defeating Prompt Injections by Design
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- What can a Single Attention Layer Learn? A Study Through the Random Features Lens
- On the Statistical Query Complexity of Learning Semiautomata: a Random Walk Approach
- Instruction Following by Principled Boosting Attention of Large Language Models
- IH-Challenge: A Training Dataset to Improve Instruction Hierarchy on Frontier LLMs
- Transformers Provably Learn Sparse XOR with Polylogarithmic Parameters
- When Can Model-Free Reinforcement Learning be Enough for Thinking?
- A Mean-Field Analysis of Multi-Head Self-Attention under Cross-Entropy Training
- Transformers Provably Learn to Internalize Chain-of-Thought
- On the Emergence of Implicit Curriculum in RLVR Learning Dynamics
- Adam: A Method for Stochastic Optimization
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks