Compress to Remember: Learning Compact Memory via On-Policy Distillation for Long Video Generation
cs.CV, cs.AI, cs.LG
Submitted: 2026-09-28
Updated: 2026-09-28
Terminology
Sources
- Echo-Infinity: Learning Evolving Memory for Real-Time Infinite Video Generation
- Pyramid Forcing: Head-Aware Pyramid KV Cache Policy for High-Quality Long Video Generation
- SlotMemory: Object-Centric KV Memory for Streaming Long-Video Generation
- LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation
- Scaling Laws for Neural Language Models
- MemRoPE: Training-Free Infinite Video Generation via Evolving Memory Tokens
- Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion
- Long-Horizon Streaming Video Generation via Hybrid Attention with Decoupled Distillation
- PackForcing: Short Video Training Suffices for Long Video Sampling and Long Context Inference
- Movie Gen: A Cast of Media Foundation Models
- Wan: Open and Advanced Large-Scale Video Generative Models
- LongLive: Real-time Interactive Long Video Generation
- DySink: Dynamic Frame Sinks for Autoregressive Long Video Generation
- Deep Forcing: Training-Free Long Video Generation with Deep Sink and Participative Compression
- WorldKV: Efficient World Memory with World Retrieval and Compression
- MBench: A Comprehensive Benchmark on Memory Capability for Video World Models
- Relax Forcing: Relaxed KV-Memory for Consistent Long Video Generation
- Causal-rCM: A Unified Teacher-Forcing and Self-Forcing Open Recipe for Autoregressive Diffusion Distillation in Streaming Video Generation and Interactive World Models
- Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models