Uncovering Ordinal-Matching Bias in Audio-Visual LLMs
cs.CV, cs.SD
Submitted: 2026-09-28
Updated: 2026-09-28
Terminology
Sources
- video-SALMONN 2: Caption-Enhanced Audio-Visual Large Language Models
- MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction
- Qwen2.5-Omni Technical Report
- Qwen3-Omni Technical Report
- On the Nature of Attention Sink that Shapes Decoding Strategy in Omni-LLMs
- Who Says What: Symbolic Trimodal Binding Mechanisms in Audio-Visual LLMs
- D-ORCA: Dialogue-Centric Optimization for Robust Audio-Visual Captioning
- DiaDem: Advancing Dialogue Descriptions in Audiovisual Video Captioning for Multimodal Large Language Models
- See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models
- SocialOmni: Benchmarking Audio-Visual Social Interactivity in Omni Models
- Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models