OmniCapBench: A Deep-Structured Evaluation Framework for Fine-Grained Audio-Visual Captioning
cs.CV
Submitted: 2026-10-08
Updated: 2026-10-08
Code: https://github.com/Jingkang50/FunQA
Project page: https://01yzzyu.github.io/OmniCapBench
Terminology
Sources
- Qwen2.5-VL Technical Report
- Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity
- TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models
- AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark
- AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration
- DiaDem: Advancing Dialogue Descriptions in Audiovisual Video Captioning for Multimodal Large Language Models
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction
- VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction
- MMOU: A Massive Multi-Task Omni Understanding and Reasoning Benchmark for Long and Complex Real-World Videos
- Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction
- VGI-Bench: Probing Visual Intelligence in Video Generation Models
- WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs
- Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos
- OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs
- Baichuan-Omni Technical Report
- Towards Universal Video MLLMs with Attribute-Structured and Quality-Verified Instructions
- CAPability: A Comprehensive Visual Caption Benchmark for Evaluating Both Correctness and Thoroughness
- Ola: Pushing the Frontiers of Omni-Modal Language Model
- Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models