Adapting English Quality Classifiers for Multilingual LLM Pretraining Data Selection
cs.CL, cs.AI
Submitted: 2026-10-08
Updated: 2026-10-08
Code: https://github.com/huggingface/datatrove
Terminology
Sources
- Apertus: Democratizing Open and Compliant LLMs for Global Language Environments
- An Expanded Massive Multilingual Dataset for High-Performance Language Technologies (HPLT)
- MuRating: A High Quality Data Selecting Approach to Multilingual Large Language Model Pretraining
- CulturalBench: A Robust, Diverse, and Challenging Cultural Benchmark by Human-AI CulturalTeaming
- Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge
- XNLI: Evaluating Cross-lingual Sentence Representations
- Unsupervised Cross-lingual Representation Learning at Scale
- A New Massive Multilingual Dataset for High-Performance Language Technologies
- BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
- MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies
- Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations
- Bag of Tricks for Efficient Text Classification
- Okapi: Instruction-tuned Large Language Models in Multiple Languages with Reinforcement Learning from Human Feedback
- The BigScience ROOTS Corpus: A 1.6TB Composite Multilingual Dataset
- Decoupled Weight Decay Regularization
- mmBERT: A Modern Multilingual Encoder with Annealed Language Learning
- Enhancing Multilingual LLM Pretraining with Model-Based Data Selection
- Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering
- Crosslingual Generalization through Multitask Finetuning
- CulturaX: A Cleaned, Enormous, and Multilingual Dataset for Large Language Models in 167 Languages
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering