MiX: Micro-Inverted-Scaling for End-to-End Low-Bit Vision-Language Model Acceleration
cs.AR, cs.CV
Submitted: 2026-09-17
Updated: 2026-10-08
Terminology
Sources
- GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers
- Rethinking Practical and Efficient Quantization Calibration for Vision-Language Models
- VEQ: Modality-Adaptive Quantization for MoE Vision-Language Models
- P4Q: Learning to Prompt for Quantization in Visual-language Models
- Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
- LLaVA-OneVision: Easy Visual Task Transfer
- MiniCPM-V: A GPT-4V Level MLLM on Your Phone
- Towards VQA Models That Can Read
- ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning
- VizWiz Grand Challenge: Answering Visual Questions from Blind People
- SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension
- LLM-QAT: Data-Free Quantization Aware Training for Large Language Models
- EfficientQAT: Efficient Quantization-Aware Training for Large Language Models
- MicroMix: Efficient Mixed-Precision Quantization with Microscaling Formats for Large Language Models
Related papers
- WitCert: Sound Runtime Risk Observability and Gating for KV-Cache Quantization
- Golden Ruler: A Numeric Format Catalog with Bit-Exact Conformance Vectors for FP8, BF16, MXFP4, and Microscaling Formats
- PoisonCap: Efficient Hierarchical Temporal Safety for CHERI
- Provisioning to Runtime Optimization of a 100 MW-Scale AI Cluster
- Bit-Accurate Modeling of GPU Matrix Multiply-Accumulate Units: Demystifying Numerical Discrepancy and Accuracy
- Optimizing Polynomial Multiplication and Fixed-Weight Sampling for HQC on ARM Cortex-M4