RLHarness: Co-evolving Procedural Skills with Reinforcement Learning for Long-horizon Multimodal Reasoning

arXiv:2609.32326 · cs.AI · Submitted 2026-09-26 · Read on arXiv

cs.AI

Submitted: 2026-09-26

Updated: 2026-09-26

Code: https://github.com/Ziqiao-Shang/RLHarness

Terminology

Sources

Related papers