PhysicsLENS: Diagnosing Physical Property Blindness in Video Generation Models
cs.CV, cs.RO
Submitted: 2026-10-01
Updated: 2026-10-01
Code: https://github.com/huggingface/lerobot
Terminology
Sources
- Cosmos 3: Omnimodal World Models for Physical AI
- IntPhys 2: Benchmarking Intuitive Physics Understanding In Complex Synthetic Environments
- AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems
- Rethinking Video Generation Model for the Embodied World
- GEOPHYS: The Geometry of Physical Plausibility
- What about gravity in video generation? Post-Training Newton's Laws with Verifiable Rewards
- Learning Explicit Physical Parameter Control and Benchmarking for Video Generation
- RoboGaze: Evaluating Robot World Models via Structured Vision-Language Analysis
- Cosmos World Foundation Model Platform for Physical AI
- Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning
- GPT-4o System Card
- Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation
- WorldGym: World Model as An Environment for Policy Evaluation
- T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation
- Wan: Open and Advanced Large-Scale Video Generative Models
- MAGI-1: Autoregressive Video Generation at Scale
- Physion++: Evaluating Physical Scene Understanding that Requires Online Inference of Different Physical Properties
- Towards Accurate Generative Models of Video: A New Metric & Challenges
- HunyuanVideo 1.5 Technical Report
- RoboCOIN: An Open-Sourced Bimanual Robotic Data Collection for Integrated Manipulation
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models