UniCache: Task- and Type-Aware KV Cache Compression for Unified Multimodal Models
cs.LG
Submitted: 2026-09-26
Updated: 2026-09-26
Terminology
Sources
- Qwen2.5-VL Technical Report
- PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling
- Emerging Properties in Unified Multimodal Pretraining
- SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture
- MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
- ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
- Direct Inversion: Boosting Diffusion-based Editing with 3 Lines of Code
- Flash-Unified: A Training-Free and Task-Aware Acceleration Framework for Native Unified Models
- SnapKV: LLM Knows What You are Looking for Before Generation
- Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models
- Step1X-Edit: A Practical Framework for General Image Editing
- Scissorhands: Exploiting the Persistence of Importance Hypothesis for LLM KV Cache Compression at Test Time
- KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache
- Hyper-Bagel: A Unified Acceleration Framework for Multimodal Understanding and Generation
- Fast Transformer Decoding: One Write-Head is All You Need
- Chameleon: Mixed-Modal Early-Fusion Foundation Models
- Efficient Streaming Language Models with Attention Sinks
- AlphaQ: Calibration-Free Bit Allocation for Mixture-of-Experts Quantization
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks