Physis-Lang: Self-Evolving Language as a Physical Representation for Video World Model
cs.CV
Submitted: 2026-09-30
Updated: 2026-09-30
Code: https://github.com/kandinskylab/kandinsky-wm
Terminology
Sources
- Enhancing Physical Plausibility in Video Generation by Reasoning the Implausibility
- CausalMotion: Structured Physical Reasoning as Keyframe and Trajectory Guidance for Training-Free Video Generation
- PhysVideoGenerator: Towards Physically Aware Video Generation via Latent Physics Guidance
- MMPhysVideo: Physically Plausible Video Generation Through Joint RGB-Perception Modeling
- Learning Plug-and-play Memory for Guiding Video Diffusion Models
- Seeking Physics in Diffusion Noise
- Think Before You Diffuse: Infusing Physical Rules into Video Diffusion
- Bootstrapping Physics-Grounded Video Generation through VLM-Guided Iterative Self-Refinement
- NEWTON: Agentic Planning for Physically Grounded Video Generation
- PhiZero: A World Model Built Around Physical Language
- PhysCorr: Dual-Reward DPO for Physics-Constrained Text-to-Video Generation with Automated Preference Selection
- PhyWorld: Physics-Faithful World Model for Video Generation
- Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers
- When Physical Preferences Meet Semantic Constraints: Physical and Semantic Direct Preference Optimization for Text-to-Video Generation
- PhyPrompt: RL-based Prompt Refinement for Physically Plausible Text-to-Video Generation
- Diffusion-DRF: Free, Rich, and Differentiable Reward for Video Diffusion Fine-Tuning
- DiReCT: Disentangled Regularization of Contrastive Trajectories for Physics-Refined Video Generation
- STANCE: Motion Coherent Video Generation Via Sparse-to-Dense Anchored Encoding
- PH-Dreamer: A Physics-Driven World Model via Port-Hamiltonian Generative Dynamics
- Motion Forcing: A Decoupled Framework for Robust Video Generation in Motion Dynamics
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models