DRIFT: Data Selection for LLM Instruction Tuning via On-Policy Attribution
cs.LG, cs.AI
Submitted: 2026-06-16
Updated: 2026-09-26
Code: https://github.com/huggingface/open-r1
Terminology
Sources
- Efficient Online Data Mixing For Language Model Pre-Training
- What is Your Data Worth to GPT? LLM-Scale Data Valuation with Influence Functions
- IF-GUIDE: Influence Function-Guided Detoxification of LLMs
- Studying Large Language Model Generalization with Influence Functions
- Influence Functions for Efficient Data Selection in Reasoning
- Large-Scale Data Selection for Instruction Tuning
- LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code
- DataInf: Efficiently Estimating Data Influence in LoRA-tuned LLMs and Diffusion Models
- Do Influence Functions Work on Large Language Models?
- RegMix: Data Mixture as Regression for Language Model Pre-training
- BM25S: Orders of magnitude faster lexical search via eager sparse scoring
- Reinforcement Learning Finetunes Small Subnetworks in Large Language Models
- Olmo 3
- TRAK: Attributing Model Behavior at Scale
- GPQA: A Graduate-Level Google-Proof Q&A Benchmark
- Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism
- The Curse of Recursion: Training on Generated Data Makes Models Forget
- Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models
- Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them
- MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks