SPLIT-RL: Staged Perception-Language Reasoning Training with Claim-Level Advantages
cs.CV
Submitted: 2026-10-07
Updated: 2026-10-07
Code: https://github.com/hiyouga/EasyR1
Terminology
Sources
- Qwen3-VL Technical Report
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- VRPRM: Process Reward Modeling via Visual Reasoning
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning
- OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
- MM-PRM: Enhancing Multimodal Mathematical Reasoning with Scalable Step-Level Supervision
- Video-R1: Reinforcing Video Reasoning in MLLMs
- Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
- Med-R1: Reinforcement Learning for Generalizable Medical Reasoning in Vision-Language Models
- Tulu 3: Pushing Frontiers in Open Language Model Post-Training
- Let's Verify Step by Step
- CLEVR-Math: A Dataset for Compositional Language, Visual and Mathematical Reasoning
- Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement
- UI-R1: Enhancing Efficient Action Prediction of GUI Agents by Reinforcement Learning
- GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents
- MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning
- DOCCI: Descriptions of Connected and Contrasting Images
- LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL
- We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models