CSWAM: Better Causal Semantic Representations for Out-of-Distribution Generalization in World Action Models
cs.CV, cs.AI
Submitted: 2026-09-16
Updated: 2026-10-06
Comments: 13 pages, 2 figures
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning
- Revisiting Feature Prediction for Learning Visual Representations from Video
- $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control
- GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation
- ABot-M0.5: Unified Mobility-and-Manipulation World Action Model
- RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation
- LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models
- Causal World Modeling for Robot Control
- Unified Video Action Model
- Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models
- JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling
- G0.5: One Autoregressive Stream for Robot Reasoning and Action
- V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning
- $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
- DINOv3
- DeMaVLA: A Vision-Language-Action Foundation Model for Generalizable Deformable Manipulation
- ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts
- Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models