Latent-Foresight: End-to-End Learning Predictable Representations for Latent World Models
cs.CV
Submitted: 2026-10-01
Updated: 2026-10-01
Code: https://github.com/Sta8is/Latent-Foresight
Terminology
Sources
- World Simulation with Video Foundation Models for Physical AI
- V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning
- Layer Normalization
- Back to the Features: DINO as a Foundation for Video World Models
- LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics
- VFMF: World Modeling by Forecasting Vision Foundation Model Features
- End-to-End Autoregressive Image Generation with 1D Semantic Tokenizer
- End-to-End Training for Unified Tokenization and Latent Denoising
- Imagen Video: High Definition Video Generation with Diffusion Models
- Auto-Encoding Variational Bayes
- Stochastic Adversarial Video Prediction
- Back to Basics: Let Denoising Generative Models Denoise
- LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels
- Flow Matching in Feature Space for Stochastic World Modeling
- GLU Variants Improve Transformer
- VGGT-World: Transforming VGGT into an Autoregressive Geometry World Model
- Frozen Forecasting: A Unified Evaluation
- Emu3: Next-Token Prediction is All You Need
- VideoGPT: Video Generation using VQ-VAE and Transformers
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models