WorldCast: Distributed Multiplayer World Models
cs.CV
Submitted: 2026-10-08
Updated: 2026-10-08
Code: https://github.com/ultralytics/ultralytics
Project page: https://ziyang-ye.github.io/WorldCast-Page
Terminology
Sources
- MASS: Multiplayer World Models with Authoritative Shared State
- Matrix-game 2.0: An open-source, real-time, and streaming interactive world model
- Multiplayer Interactive World Models with Representation Autoencoders
- MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data
- Memory Forcing: Spatio-Temporal Memory for Consistent Scene Generation on Minecraft
- LIVE: Long-horizon Interactive Video World Modeling
- Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players
- Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers
- WorldCam: Interactive Autoregressive 3D Gaming Worlds with Camera Pose as a Unifying Geometric Representation
- MultiGen: Level-Design for Editable Multiplayer Worlds in Diffusion Game Engines
- GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving
- Solaris: Building a Multiplayer Video World Model in Minecraft
- Prisma-World: Camera-Controllable Multi-Agent Video World Model
- Wan: Open and Advanced Large-Scale Video Generative Models
- ATI: Any Trajectory Instruction for Controllable Video Generation
- MultiWorld: Scalable Multi-Agent Multi-View Video World Models
- VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders
- RoboStereo: Dual-Tower 4D Embodied World Models for Unified Policy Optimization
- ShareVerse: Multi-Agent Consistent Video Generation for Shared World Modeling
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models