Less from More: Reinforcing Sparse Video Reasoning from Dense References
cs.CV
Submitted: 2026-10-07
Updated: 2026-10-07
Terminology
Sources
- Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- Qwen3-VL Technical Report
- Qwen2.5-VL Technical Report
- Scaling RL to Long Videos
- Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- LOVE-R1: Advancing Long Video Understanding with an Adaptive Zoom-in Mechanism via Multi-Step Reasoning
- Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning
- Reinforcing Video Reasoning Segmentation to Think Before It Segments
- Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos
- A Shortcut-aware Video-QA Benchmark for Physical Understanding via Minimal Video Pairs
- LLaVA-OneVision: Easy Visual Task Transfer
- Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency
- VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning
- VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization
- VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice
- Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
- MARC: Memory-Augmented RL Token Compression for Efficient Video Understanding
- LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models
- VideoBrain: Learning Adaptive Frame Sampling for Long Video Understanding
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models