Physics-R1: An Audited Olympiad Corpus and Released Verifiers for Visual Physics Reasoning
cs.CL
Submitted: 2026-05-13
Updated: 2026-08-28
Code: https://github.com/shanyang-me/physics-r1-neurips2026
Project page: https://knzhou.github.io
Terminology
Sources
- Croissant: A Metadata Format for ML-Ready Datasets
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI
- MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- PhyX: Does Your Model Have the "Wits" for Physical Reasoning?
- HybridFlow: A Flexible and Efficient RLHF Framework
- Evaluation data contamination in LLMs: how do we measure it and (when) does it matter?
- UGPhysics: A Comprehensive Benchmark for Undergraduate Physics Reasoning with Large Language Models
- DAPO: An Open-Source LLM Reinforcement Learning System at Scale
- PhysReason: A Comprehensive Benchmark towards Physics-Based Reasoning
- Group Sequence Policy Optimization
- OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering