OmniFysics-Captioner Technical Report: Grounding Omni-Modal Understanding in the Physical World for Better Captioning
cs.CV
Submitted: 2026-09-21
Updated: 2026-09-21
Code: https://github.com/Fysics-AI/OmniFysics-Captioner
Terminology
Sources
- OmniFysics: Towards Physical Intelligence Evolution via Omni-Modal Signal Processing and Network Optimization
- ShareGPT4Video: Improving Video Understanding and Generation with Better Captions
- video-SALMONN 2: Caption-Enhanced Audio-Visual Large Language Models
- AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration
- Active Perception Agent for Omnimodal Audio-Video Understanding
- VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs
- Qwen2.5-Omni Technical Report
- Qwen3-Omni Technical Report
- Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding
- UGC-VideoCaptioner: An Omni UGC Video Detail Caption Model and New Benchmarks
- AVSCap: Orchestrating Audio-Visual Synergy for Omni-modal Video Captioning
- Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities
- A Shortcut-aware Video-QA Benchmark for Physical Understanding via Minimal Video Pairs
- MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models
- PhysGame: Uncovering Physical Commonsense Violations in Gameplay Videos
- PhysicsMind: Sim and Real Mechanics Benchmarking for Physical Reasoning and Prediction in Foundational VLMs and World Models
- VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding
- WISA: World Simulator Assistant for Physics-Aware Text-to-Video Generation
- Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models