A Target-Centric Survey of Quantization-Aware Training
cs.LG
Submitted: 2026-08-30
Updated: 2026-08-30
Terminology
Sources
- Program Synthesis with Large Language Models
- Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation
- Low-Rank Quantization-Aware Training for LLMs
- Don't Waste Bits! Adaptive KV-Cache Quantization for Lightweight On-Device LLMs
- Evaluating Large Language Models Trained on Code
- PACT: Parameterized Clipping Activation for Quantized Neural Networks
- Training Verifiers to Solve Math Word Problems
- Compute-Optimal Quantization-Aware Training
- Measuring Massive Multitask Language Understanding
- Measuring Mathematical Problem Solving With the MATH Dataset
- Distilling the Knowledge in a Neural Network
- BinaryDuo: Reducing Gradient Mismatch in Binary Activation Network by Coupling Binary Activations
- Ternary Weight Networks
- CommVQ: Commutative Vector Quantization for KV Cache Compression
- Low-bit Model Quantization for Deep Neural Networks: A Survey
- SpinQuant: LLM quantization with learned rotations
- The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits
- Pointer Sentinel Mixture Models
- FP8 Formats for Deep Learning
- A White Paper on Neural Network Quantization
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks