Stage-adaptive Token Selection for Efficient Omni-modal LLMs
cs.CV
Submitted: 2026-05-19
Updated: 2026-09-27
Code: https://github.com/xxayt/SEATS
Terminology
Sources
- Qwen3-VL Technical Report
- OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models
- ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts
- EchoingPixels: Aliasing-Resistant Joint Token Reduction for Audio-Visual LLMs
- LLaVA-OneVision: Easy Visual Task Transfer
- LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models
- Baichuan-Omni-1.5 Technical Report
- video-SALMONN 2: Caption-Enhanced Audio-Visual Large Language Models
- LVOmniBench: Pioneering Long Audio-Video Understanding Evaluation for Omnimodal LLMs
- Qwen3.5-Omni Technical Report
- InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency
- Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities
- Qwen2.5-Omni Technical Report
- Qwen3-Omni Technical Report
- MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe
- Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models