PQ-HSA: Reusing Product-Quantized Scores for Hybrid Sparse-Approximate Attention
cs.LG
Submitted: 2026-09-27
Updated: 2026-09-27
Code: https://github.com/KunmingSHAO/pqhsa_release
Terminology
Sources
- GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints
- LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding
- Scatterbrain: Unifying Sparse and Low-rank Attention Approximation
- RetroInfer: A Vector Storage Engine for Scalable Long-Context LLM Inference
- MagicPIG: LSH Sampling for Efficient LLM Generation
- Norm-Explicit Quantization: Improving Vector Quantization for Maximum Inner Product Search
- FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness
- HashAttention: Semantic Sparsity for Faster Inference
- The Faiss library
- The Llama 3 Herd of Models
- Accelerating Large-Scale Inference with Anisotropic Vector Quantization
- Squeezed Attention: Accelerating Long Context Length LLM Inference
- Multipole Attention for Efficient Long Context Reasoning
- RULER: What's the Real Context Size of Your Long-Context Language Models?
- Billion-scale similarity search with GPUs
- Efficient Memory Management for Large Language Model Serving with PagedAttention
- InfiniGen: Efficient Generative Inference of Large Language Models with Dynamic KV Cache Management
- CommVQ: Commutative Vector Quantization for KV Cache Compression
- SnapKV: LLM Knows What You are Looking for Before Generation
- Transformer-VQ: Linear-Time Transformers via Vector Quantization
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks