MCD: Causal Distillation of Multimodal In-Context Learning in Large Vision-Language Models
cs.CV, cs.CL
Submitted: 2026-09-30
Updated: 2026-09-30
Terminology
Sources
- Distributed LLMs and Multimodal Large Language Models: A Survey on Advances, Challenges, and Future Directions
- Qwen3-VL Technical Report
- MM-IQ: Benchmarking Human-Like Abstraction and Reasoning in Multimodal Models
- Beyond Next-Token Alignment: Distilling Multimodal Large Language Models via Token Interactions
- True Multimodal In-Context Learning Needs Attention to the Visual Context
- ContextNav: Towards Agentic Multimodal In-Context Learning
- Distilling the Knowledge in a Neural Network
- Many-Shot In-Context Learning in Multimodal Foundation Models
- CompoDistill: Attention Distillation for Compositional Reasoning in Multimodal LLMs
- DistiLLM: Towards Streamlined Distillation for Large Language Models
- LLaVA-OneVision: Easy Visual Task Transfer
- LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts
- LLAVADI: What Matters For Multimodal Large Language Models Distillation
- VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models
- MLLMs are Deeply Affected by Modality Bias
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models