To Mix or To Merge: Toward Multi-Domain Reinforcement Learning for Large Language Models

arXiv:2602.12566 · cs.AI · Submitted 2026-02-13 · Read on arXiv

cs.AI

Submitted: 2026-02-13

Updated: 2026-09-07

Comments: Accepted by COLM 2026

Code: https://github.com/Mosi-AI/M2RL

License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/

Terminology

Sources

Related papers