GIFT: Reconciling Post-Training Objectives via Variational Finite-Temperature Gibbs Initialization
cs.LG, cs.AI, cs.CL
Submitted: 2026-01-14
Updated: 2026-09-07
Code: https://github.com/zzy1127/GIFT
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Training Verifiers to Solve Math Word Problems
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- DeepSeek-V3 Technical Report
- RLHF in an SFT Way: From Optimal Solution to Reward-Weighted Alignment
- Are We Done with MMLU?
- Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting
- NFT: Bridging Supervised Learning and Reinforcement Learning in Math Reasoning
- The False Promise of Imitating Proprietary LLMs
- DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning
- Step-wise Adaptive Integration of Supervised Fine-tuning and Reinforcement Learning for Task-Specific LLMs
- Measuring Mathematical Problem Solving With the MATH Dataset
- Scaling Instruction-Finetuned Language Models
- Step 3.5 Flash: Open Frontier-Level Intelligence with 11B Active Parameters
- Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge
- Rethinking Entropy Regularization in Large Reasoning Models
- Quagmires in SFT-RL Post-Training: When High SFT Scores Mislead and What to Use Instead
- Fine-Tuning can Distort Pretrained Features and Underperform Out-of-Distribution
- Direct Preference Optimization: Your Language Model is Secretly a Reward Model
- Beyond Log Likelihood: Probability-Based Objectives for Supervised Fine-Tuning across the Model Capability Continuum
- GPQA: A Graduate-Level Google-Proof Q&A Benchmark
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks