VideoGen-Agent: Reinforcing Video Generation Agents
cs.CV
Submitted: 2026-09-21
Updated: 2026-10-05
Code: https://github.com/genmoai/models
Terminology
Sources
- Qwen3-VL Technical Report
- Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets
- Gen-Searcher: Reinforcing Agentic Search for Image Generation
- NEWTON: Agentic Planning for Physically Grounded Video Generation
- Seedance 1.0: Exploring the Boundaries of Video Generation Models
- T2VPhysBench: A First-Principles Benchmark for Physical Consistency in Text-to-Video Generation
- Ctrl-World: A Controllable Generative World Model for Robot Manipulation
- ViMax: Agentic Video Generation
- HunyuanVideo: A Systematic Framework For Large Video Generative Models
- VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System
- ToRL: Scaling Tool-Integrated RL
- The Script is All You Need: An Agentic Framework for Long-Horizon Dialogue-to-Cinematic Video Generation
- $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
- Movie Gen: A Cast of Media Foundation Models
- Seedance 2.0: Advancing Video Generation for World Complexity
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning
- Wan: Open and Advanced Large-Scale Video Generative Models
- Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
- Loong: Generating Minute-level Long Videos with Autoregressive Language Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models