GVPO++: Group Variance Policy Optimization for LLM Post-Training and On-Policy Distillation

arXiv:2609.21432 · cs.AI, cs.LG · Submitted 2026-09-18 · Read on arXiv

cs.AI, cs.LG

Submitted: 2026-09-18

Updated: 2026-09-18

Comments: Extended version of the NeurIPS 2025 paper "GVPO: Group Variance Policy Optimization for Large Language Model Post-Training"

License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/

Terminology

Related papers