Learning to Reason with Compressed Context: Ground-Truth-Free Adaptation of OmniLLMs via Self-Distillation
cs.CV
Submitted: 2026-09-30
Updated: 2026-09-30
Code: https://github.com/Bamboos2003/CAFD
Terminology
Sources
- OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence Chains
- Thinking Without Images: Internalizing Visual Manipulation with On-Policy Self-Distillation
- OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models
- AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression
- OmniOPSD: Rationale-Privileged On-Policy Self-Distillation for Affective Computing
- OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models
- VITA: Towards Open-Source Interactive Omni Multimodal LLM
- Allocation Before Ranking: Decoupled Token Compression for OmniLLMs
- OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs
- DASH: Dynamic Audio-Driven Semantic Chunking for Efficient Omnimodal Token Compression
- OmniDrop: Layer-wise Token Pruning for Omni-modal LLMs via Query-Guidance
- OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models
- OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models
- O-MARC: Omni Memory-Augmented Compression Distillation for Efficient Video Understanding
- Qwen2.5-Omni Technical Report
- Qwen3-Omni Technical Report
- OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models