VideoX-Qwen: Data-Centric Instruction-Based Video Editing
cs.AI, cs.GR
Submitted: 2026-09-22
Updated: 2026-09-22
Comments: Technical report
Code: https://github.com/Vchitect/VBench
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Scaling Instruction-Based Video Editing with a High-Quality Synthetic Dataset
- Se\~norita-2M: A High-Quality Instruction-based Dataset for General Video Editing by Video Specialists
- AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks
- InsViE-1M: Effective Instruction-based Video Editing with Elaborate Dataset Construction
- InstructX: Towards Unified Visual Editing with MLLM Guidance
- Region-Constraint In-Context Generation for Instructional Video Editing
- SAM 3: Segment Anything with Concepts
- MiniMax-Remover: Taming Bad Noise Helps Video Object Removal
- Wan-Animate: Unified Character Animation and Replacement with Holistic Replication
- Wan: Open and Advanced Large-Scale Video Generative Models
- HunyuanVideo: A Systematic Framework For Large Video Generative Models
- CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer
- VACE: All-in-One Video Creation and Editing
- UniVideo: Unified Understanding, Generation, and Editing for Videos
- OpenVE-3M: A Large-Scale High-Quality Dataset for Instruction-Guided Video Editing
- Qwen3-VL Technical Report
- Flow Matching for Generative Modeling
- Kling-Omni Technical Report
- Qwen2.5-VL Technical Report
- Towards Accurate Generative Models of Video: A New Metric & Challenges
Related papers
- MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction
- Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
- The Clinician's Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing
- MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention
- Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems
- VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection