The Invisible Language Tax: Token Premiums of French and Regional Languages in 2026 LLM Tokenizers, and a French-Optimized Prototype
cs.CL, cs.AI
Submitted: 2026-09-30
Updated: 2026-09-30
Code: https://github.com/Baracoda-ai-labs/baracoda-fr
Terminology
Sources
- Language Model Tokenizers Introduce Unfairness Between Languages
- The Token Tax: Systematic Bias in Multilingual Tokenization
- Measuring the Tokenization Premium: A Cost Audit for Underserved Language Communities
- M-GATE: Multilingual Grammar, Accuracy in Translation, and Efficiency Benchmark for Large Language Models
- Lost in Compression: A Controlled Cross-Lingual Audit of Extractive Prompt Compressors
- Chinese Language Is Not More Efficient Than English in Vibe Coding: A Preliminary Study on Token Cost and Problem-Solving Rate
- CroissantLLM: A Truly Bilingual French-English Language Model
- Parity-Aware Byte-Pair Encoding: Improving Cross-lingual Fairness in Tokenization
- SuperBPE: Space Travel for Language Models
- SupraTok: Cross-Boundary Tokenization for Enhanced Language Model Performance
- FOCUS: Effective Embedding Initialization for Monolingual Specialization of Multilingual Models
- TokAlign: Efficient Vocabulary Adaptation via Token Alignment
- Gemma 3 Technical Report
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering