KBBQ: A Predictive Noise Law and the Limits of Spectrum Flattening in FP4 Quantization
cs.LG, cs.AI
Submitted: 2026-09-08
Updated: 2026-09-27
Comments: 18 pages, 8 pages main text, 2 figures
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs
- HALO: Hadamard-Assisted Lower-Precision Optimization for LLMs
- Program Synthesis with Large Language Models
- Quartet: Native FP4 Training Can Be Optimal for Large Language Models
- QuIP: 2-Bit Quantization of Large Language Models With Guarantees
- WUSH: Near-Optimal Adaptive Transforms for LLM Quantization
- FP4 All the Way: Fully Quantized Training of LLMs
- Training Verifiers to Solve Math Word Problems
- Full-Stack FP4: Stable LLM Pretraining with Quantized Projections, Optimizers, and Attention
- GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers
- The Llama 3 Herd of Models
- Measuring Massive Multitask Language Understanding
- KronQ: LLM Quantization via Kronecker-Factored Hessian
- SpinQuant: LLM quantization with learned rotations
- Pretraining Large Language Models with NVFP4
- Microscaling Data Formats for Deep Learning
- WinoGrande: An Adversarial Winograd Schema Challenge at Scale
- ConQuR: Corner Aligned Activation Quantization via Optimized Rotations for LLMs
- QuIP#: Even Better LLM Quantization with Hadamard Incoherence and Lattice Codebooks
- SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks