OmniFysics-Nano-V2 Technical Report: Understanding the Physical World Across Modalities
cs.AI
Submitted: 2026-09-22
Updated: 2026-09-22
Comments: 24 pages
Code: https://github.com/Fysics-AI/OmniFysics-Nano-V2
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence
- Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning
- Qwen3-VL Technical Report
- Qwen2.5-VL Technical Report
- Physion: Evaluating Physical Prediction from Vision in Humans and Machines
- Can Vision Language Models Learn Intuitive Physics from Interaction?
- PhysBench: Benchmarking and Enhancing Vision-Language Models for Physical World Understanding
- MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction
- CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training
- Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding
- Gemini: A Family of Highly Capable Multimodal Models
- AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information?
- OmniFysics: Towards Physical Intelligence Evolution via Omni-Modal Signal Processing and Network Optimization
- FysicsWorld: A Unified Full-Modality Benchmark for Any-to-Any Understanding, Generation, and Reasoning
- LLaVA-OneVision: Easy Visual Task Transfer
- Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking
- QuantiPhy: A Quantitative Benchmark Evaluating Physical Reasoning Abilities of Vision-Language Models
- Baichuan-Omni-1.5 Technical Report
- OmniBench: Towards The Future of Universal Omni-Language Models
- Reward Design for Physical Reasoning in Vision-Language Models
Related papers
- MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction
- Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
- The Clinician's Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing
- MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention
- Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems
- VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection