Finetuning with Sampling: SFT Learns Better Than You Think
cs.LG, cs.AI, cs.CL
Submitted: 2026-10-01
Updated: 2026-10-01
Terminology
Sources
- Self-Consistency via Marginal Sharpening
- Power-SMC: Low-Latency Sequence-Level Power Sampling for Training-Free LLM Reasoning
- Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting
- HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs
- SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training
- Training Verifiers to Solve Math Word Problems
- SciKnowEval: Evaluating Multi-level Scientific Knowledge of Large Language Models
- When does a predictor know its own loss?
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- Measuring Massive Multitask Language Understanding
- Measuring Mathematical Problem Solving With the MATH Dataset
- Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model
- Scalable Power Sampling: Unlocking Efficient, Training-Free Reasoning for LLMs via Distribution Sharpening
- Reasoning with Sampling: Your Base Model is Smarter Than You Think
- Unrolled denoising networks provably learn optimal Bayesian inference
- ReGuidance: A Simple Diffusion Wrapper for Boosting Sample Quality on Hard Inverse Problems
- Sequential Monte Carlo Steering of Large Language Models using Probabilistic Programs
- Blink of an eye: a simple theory for feature localization in generative models
- Competition-Level Code Generation with AlphaCode
- UFT: Unifying Supervised and Reinforcement Fine-Tuning
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks