Transforms for LLM Quantization: The Great Inversion and Format Co-Design
cs.LG, cs.IT, math.IT
Submitted: 2026-08-25
Updated: 2026-08-25
Code: https://github.com/ggml-org/llama.cpp
Terminology
Sources
- HadaCore: Tensor Core Accelerated Hadamard Transform Kernel
- Quantizing With Randomized Hadamard Transforms: Efficient Heuristic Now Proven
- INT v.s. FP: A Comprehensive Study of Fine-Grained Low-bit Quantization Formats
- TEQ: Trainable Equivalent Transformation for Quantization of LLMs
- Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling
- Adaptive Block-Scaled Data Types
- HadaNorm: Diffusion Transformer Quantization through Mean-Centered Transformations
- STaMP: Sequence Transformation and Mixed Precision for Low-Precision Activation Quantization
- Dissecting Quantization Error: A Concentration-Alignment Perspective
- Provable Quantization with Randomized Hadamard Transform
- Normalized Architectures are Natively 4-Bit
- OptRot: Mitigating Weight Outliers via Data-Free Rotations for Post-Training Quantization
- A Survey of Low-bit Large Language Models: Basics, Systems, and Algorithms
- LATMiX: Learnable Affine Transformations for Microscaling Quantization of LLMs
- APEX4: Efficient Pure W4A4 LLM Inference via Intra-SM Compute Rebalancing
- PolarQuant: Quantizing KV Caches with Polar Transformation
- NeuZip: Memory-Efficient Training and Inference with Dynamic Compression of Neural Networks
- BASE-Q: Bias and Asymmetric Scaling Enhanced Rotational Quantization for Large Language Models
- ConvRot: Rotation-Based Plug-and-Play 4-bit Quantization for Diffusion Transformers
- A Comprehensive Evaluation on Quantization Techniques for Large Language Models
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks