MosaiChunk: Compositing Spatio-Temporal Memory for Autoregressive Video Generation
cs.CV, cs.GR
Submitted: 2026-10-01
Updated: 2026-10-01
Project page: https://mosaichunk.github.io
Terminology
Sources
- Qwen2.5-VL Technical Report
- Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion
- Past- and Future-Informed KV Cache Policy with Salience Estimation in Autoregressive Video Diffusion
- MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing
- Infinite Worlds with Versatile Interactions
- Can 4D Foundation Models Remember?
- RELIC: Interactive Video World Model with Long-Horizon Memory
- Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion
- Forcing-KV: Hybrid KV Cache Compression for Efficient Autoregressive Video Diffusion Models
- PackCache: A Training-Free Acceleration Method for Unified Autoregressive Video Generation via Compact KV-Cache
- Sekai: A Video Dataset towards World Exploration
- Depth Anything 3: Recovering the Visual Space from Any Views
- RAVEN: Real-time Autoregressive Video Extrapolation with Consistency-model GRPO
- Future Forcing: Future-aware Training-free KV Cache Policy for Autoregressive Video Generation
- $\pi^3$: Permutation-Equivariant Visual Geometry Learning
- Video World Models with Long-term Spatial Memory
- Addressable Memory for Video World Models
- Quant VideoGen: Auto-Regressive Long Video Generation via 2-Bit KV-Cache Quantization
- WorldMem: Long-term Consistent World Simulation with Memory
- WorldMark: A Unified Benchmark Suite for Interactive Video World Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models