MMVistaReason: Toward Open-Data and Post-Training Recipes for Multimodal Reasoning
cs.CV
Submitted: 2026-10-01
Updated: 2026-10-01
Code: https://github.com/JackieForest/MMVistaReason
Terminology
Sources
- OpenDataArena: A Fair and Open Arena for Benchmarking Post-Training Dataset Value
- LongRLVR: Long-Context Reinforcement Learning Requires Verifiable Context Rewards
- VisualSphinx: Large-Scale Synthetic Vision Logic Puzzles for RL
- Distilling the Knowledge in a Neural Network
- KAT-Coder-V2.5 Technical Report
- Scaling Reasoning Efficiently via Relaxed On-Policy Distillation
- MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources
- Zebra-CoT: A Dataset for Interleaved Vision Language Reasoning
- LLaVA-OneVision: Easy Visual Task Transfer
- Euclid's Gift: Enhancing Spatial Perception and Reasoning in Vision-Language Models via Geometric Surrogate Tasks
- MMFineReason: Closing the Multimodal Reasoning Gap via Open Data-Centric Methods
- Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning
- Visual-Advantage On-Policy Distillation for Vision-Language Models
- MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training
- MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning
- Vero: An Open RL Recipe for General Visual Reasoning
- HybridFlow: A Flexible and Efficient RLHF Framework
- DeepVision-103K: A Visually Diverse, Broad-Coverage, and Verifiable Mathematical Dataset for Multimodal Reasoning
- Mach-Mind-4-Flash Technical Report
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models