IntactWorld: Joint World Modeling with Intact Features
cs.CV
Submitted: 2026-10-08
Updated: 2026-10-08
Terminology
Sources
- Deep Variational Information Bottleneck
- V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning
- VideoPhy: Evaluating Physical Commonsense for Video Generation
- Revisiting Feature Prediction for Learning Visual Representations from Video
- Do Sparse Autoencoders Capture Concept Manifolds?
- Genie: Generative Interactive Environments
- VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models
- VideoCrafter1: Open Diffusion Models for High-Quality Video Generation
- VRAG: Learning World Models for Interactive Video Generation
- Diffusion Models Beat GANs on Image Synthesis
- Diffusion Models and the Manifold Hypothesis: Log-Domain Smoothing is Geometry Adaptive
- Learning and Leveraging World Models in Visual Representation Learning
- Classifier-Free Diffusion Guidance
- VJEPA: Variational Joint Embedding Predictive Architectures as Probabilistic World Models
- VBench: Comprehensive Benchmark Suite for Video Generative Models
- HunyuanVideo: A Systematic Framework For Large Video Generative Models
- Boosting Generative Image Modeling via Joint Image-Feature Synthesis
- Learning on the Manifold: Unlocking Standard Diffusion Transformers with Representation Encoders
- Back to Basics: Let Denoising Generative Models Denoise
- Enhancing End-to-End Autonomous Driving with Latent World Model
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models