Learning Where Outcomes Change:Credit-Addressable Reasoning for Multimodal Geometry
cs.LG, cs.CL
Submitted: 2026-08-31
Updated: 2026-08-31
Code: https://github.com/gjn12-31/CE-GRPO
Terminology
Sources
- Qwen3-VL Technical Report
- Qwen2.5-VL Technical Report
- CodePlot-CoT: Mathematical Visual Reasoning by Thinking with Code-Driven Images
- GeoVLMath: Enhancing Geometry Reasoning in Vision-Language Models via Cross-Modal Reward for Auxiliary Line Creation
- GeoSym127K: Scalable Symbolically-verifiable Synthesis for Multimodal Geometric Reasoning
- VinePPO: Refining Credit Assignment in RL Training of LLMs
- MultiMath: Bridging Visual and Mathematical Reasoning for Large Language Models
- Credit Assignment with Resets in Language Model Reasoning
- Proximal Policy Optimization Algorithms
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- GeoTikzBridge: Advancing Multimodal Code Generation for Geometric Perception and Reasoning
- VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning
- Geoint-R1: Formalizing Multimodal Geometric Reasoning with Dynamic Auxiliary Constructions
- GPO: Learning from Critical Steps to Improve LLM Reasoning
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks