MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation

arXiv:2510.18383 · cs.CL, cs.AI · Submitted 2025-10-21 · Read on arXiv

cs.CL, cs.AI

Submitted: 2025-10-21

Updated: 2026-08-27

Code: https://github.com/choics2623/MENTOR-RL

Project page: https://artofproblemsolving.com/wiki/index.php/2023_AMC_12A_Problems

Terminology

Sources

Related papers