Approximating Softmax in Pretrained LLMs: Model Sensitivity and Kernel Acceleration
cs.LG
Submitted: 2026-09-27
Updated: 2026-09-27
Terminology
Sources
- INT-FlashAttention: Enabling Flash Attention for INT8 Quantization
- FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness
- ITA: An Energy-Efficient Attention and Softmax Accelerator for Quantized Transformers
- I-BERT: Integer-only BERT Quantization
- I-ViT: Integer-only Quantization for Efficient Vision Transformer Inference
- LRP-QViT: Mixed-Precision Vision Transformer Quantization via Layer-wise Relevance Propagation
- FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision
- P$^2$-ViT: Power-of-Two Post-Training Quantization and Acceleration for Fully Quantized Vision Transformer
- EXAQ: Exponent Aware Quantization For LLMs Acceleration
- VFA: Relieving Vector Operations in Flash Attention with Global Maximum Pre-computation
- Efficient Attention Mechanisms for Large Language Models: A Survey
- A Survey on Transformer Compression
- MXAttention: Data-Free Optimal Scaling and Pre-Normalization Quantization for MXFP4 Attention
- PTQ4ViT: Post-training quantization for vision transformers with twin uniform quantization
- FlashAttention-4: Algorithm and Kernel Pipelining Co-Design for Asymmetric Hardware Scaling
- SageAttention2: Efficient Attention with Thorough Outlier Smoothing and Per-thread INT4 Quantization
- SageAttention: Accurate 8-Bit Attention for Plug-and-play Inference Acceleration
- SageAttention3: Microscaling FP4 Attention for Inference and An Exploration of 8-Bit Training
- IntAttention: A Fully Integer Attention Pipeline for Efficient Edge Inference
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks