Edit-VAR: Taming Visual Autoregressive Model for Precise Video Editing
cs.CV
Submitted: 2026-09-18
Updated: 2026-09-18
Code: https://github.com/RehgLab/RAVE
Project page: https://chongbozhao3-coder.github.io/EditVAR
Terminology
Sources
- ToProVAR: Efficient Visual Autoregressive Modeling via Tri-Dimensional Entropy-Aware Semantic Analysis and Sparsity Optimization
- PAI-Studio: Cinematic Video Background Replacement with Camera-Aware Motion
- TokenFlow: Consistent Diffusion Features for Consistent Video Editing
- FastVAR: Linear Visual Autoregressive Modeling via Cached Token Pruning
- Prompt-to-Prompt Image Editing with Cross Attention Control
- EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning
- FlowDirector: Training-Free Flow Steering for Precise Text-to-Video Editing
- FiVE: A Fine-grained Video Editing Benchmark for Evaluating Emerging Diffusion and Rectified Flow Models
- ControlVAR: Exploring Controllable Visual Autoregressive Modeling
- OPSD-V: On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators
- Controllable Video Generation: A Survey
- Follow-Your-Creation: Empowering 4D Creation through Video Inpainting
- Follow-Your-Motion: Video Motion Transfer via Efficient Spatial-Temporal Decoupled Finetuning
- Follow-Your-Emoji-Faster: Towards Efficient, Fine-Controllable, and Expressive Freestyle Portrait Animation
- LiveLight: Real-time Streaming Video Relighting with Interactive Control
- FastVMT: Eliminating Redundancy in Video Motion Transfer
- EasyV2V: A High-quality Instruction-based Video Editing Framework
- SAM 2: Segment Anything in Images and Videos
- StreamingEffect: Real-Time Human-Centric Video Effect Generation
- VISTA: Triplet-Supervised Video Style Transfer with Diffusion Transformers
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models