A Very Big Video Reasoning Suite
cs.CV, cs.AI, cs.LG, cs.MM, cs.RO
Submitted: 2026-02-23
Updated: 2026-09-23
Terminology
Sources
- MMGR: Multi-Modal Generative Reasoning Benchmark and Evaluation
- TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models
- Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark
- LTX-2: Efficient Joint Audio-Visual Foundation Model
- RULER-Bench: Probing Rule-based Reasoning Abilities of Next-level Video Generation Models for Vision Foundation Intelligence
- HunyuanVideo: A Systematic Framework For Large Video Generative Models
- Core Knowledge Deficits in Multi-Modal Language Models
- Can World Simulators Reason? Gen-ViRe: A Generative Visual Reasoning Benchmark
- The Philosophical Foundations of Growing AI Like A Child
- Increasing Computation Resolves Conflicts in Vision Language Models
- V-ReasonBench: Toward Unified Reasoning Benchmark Suite for Video Generation Models
- SVBench: Evaluation of Video Generation Models on Social Reasoning
- Movie Gen: A Cast of Media Foundation Models
- Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm
- Wan: Open and Advanced Large-Scale Video Generative Models
- Video models are zero-shot learners and reasoners
- Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks
- CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer
- Open-Sora: Democratizing Efficient Video Production for All
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models