OmniSeek: Native Tool Integration for Multi-turn Audio-Visual Reasoning
cs.CV
Submitted: 2026-10-01
Updated: 2026-10-01
Terminology
Sources
- Qwen2.5-VL Technical Report
- OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence Chains
- OmniReasoner: Thinking with Long Audio-Video via Native Tool Use
- VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction
- LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
- Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence
- OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models
- VITA: Towards Open-Source Interactive Omni Multimodal LLM
- MMOU: A Massive Multi-Task Omni Understanding and Reasoning Benchmark for Long and Complex Real-World Videos
- Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation
- LLaVA-OneVision: Easy Visual Task Transfer
- VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning
- Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and Data
- Baichuan-Omni-1.5 Technical Report
- Qwen3-ASR Technical Report
- OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models
- video-SALMONN 2: Caption-Enhanced Audio-Visual Large Language Models
- LVOmniBench: Pioneering Long Audio-Video Understanding Evaluation for Omnimodal LLMs
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models