OmniMoE-VL: A Sparse Vision-Language Model with Coupled Visual-Depth Routing
cs.CV, cs.LG
Submitted: 2026-09-26
Updated: 2026-09-26
Terminology
Sources
- Qwen3-VL Technical Report
- Qwen2.5-VL Technical Report
- Infinity-MM: Scaling Multimodal Performance with Large-Scale and High-Quality Instruction Data
- LoRA: Low-Rank Adaptation of Large Language Models
- EvoMoE: Expert Evolution in Mixture of Experts for Multimodal Large Language Models
- LLaVA-OneVision: Easy Visual Task Transfer
- BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- Evaluating Object Hallucination in Large Vision-Language Models
- Visual Instruction Tuning
- MMBench: Is Your Multi-modal Model an All-around Player?
- ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning
- DocVQA: A Dataset for VQA on Document Images
- DeepStack: Deeply Stacking Visual Tokens is Surprisingly Simple and Effective for LMMs
- Step-3 is Large yet Affordable: Model-system Co-design for Cost-effective Decoding
- GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning
- SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features
- Solving Token Gradient Conflict in Mixture-of-Experts for Large Vision-Language Model
- MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
- MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models