Small Frequency Corrections Can Change What Survives KV Cache Compression
cs.CL
Submitted: 2026-08-27
Updated: 2026-10-06
Terminology
Sources
- PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling
- Expected Attention: KV Cache Compression by Estimating Attention from Future Queries Distribution
- SnapKV: LLM Knows What You are Looking for Before Generation
- ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference
- KeyDiff: Key Similarity-Based KV Cache Eviction for Long-Context LLM Inference in Resource-Constrained Environments
- H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering