CAST: Reconstruction-Coupled Acceleration of Interactive World Models
cs.CV
Submitted: 2026-09-28
Updated: 2026-09-28
Code: https://github.com/lokiniuniu/CAST
Terminology
Sources
- Longformer: The Long-Document Transformer
- Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets
- WorldDynCache: Risk-Controlled Latent Dynamics Approximation for Diffusion World Model
- Sol Video Inference Engine: Agent-Native Full-Stack Acceleration Framework for Efficient Video Generation
- Light Interaction: Training-Free Inference Acceleration for Interactive Video World Models
- LongCat-Video Technical Report
- WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling
- FIS-DiT: Breaking the Few-Step Video Inference Barrier via Training-Free Frame Interleaved Sparsity
- Matrix-Game 3.0: Real-Time and Streaming Interactive World Model with Long-Horizon Memory
- FlashEdit: Decoupling Speed, Structure, and Semantics for Precise Image Editing
- WorldMark: A Unified Benchmark Suite for Interactive Video World Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models