AVTrace: Diagnosing Audio-Visual Temporal Reasoning in Omni Models
cs.CV, cs.AI
Submitted: 2026-09-17
Updated: 2026-09-17
Code: https://github.com/YapengTian/AVVP-ECCV20
Project page: https://unav100.github.io
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Gemma 4 Technical Report
- LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos
- WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs
- AVHBench: A Cross-Modal Hallucination Benchmark for Audio-Visual Large Language Models
- Learning to Answer Questions in Dynamic Audio-Visual Scenarios
- VITATECS: A Diagnostic Dataset for Temporal Concept Understanding of Video-Language Models
- Audio-Visual Event Localization in Unconstrained Videos
- InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue
- CoVoST 2 and Massively Multilingual Speech-to-Text Translation
- MAVERIX: Multimodal Audio-Visual Evaluation and Recognition IndeX
- Qwen2.5-Omni Technical Report
- Qwen3-Omni Technical Report
- Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models
- Unlocking Cognitive Capabilities and Analyzing the Perception-Logic Trade-off
- Audio-Visual Segmentation
- Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models