Quality Determines Direction, Length Shapes Magnitude: Length Control for Open-Ended Reinforcement Learning
cs.LG, cs.CL
Submitted: 2026-09-28
Updated: 2026-09-28
Terminology
Sources
- GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models
- Preference as Reward, Maximum Preference Optimization with Importance Sampling
- Kimi K2.5: Visual Agentic Intelligence
- Jointly Reinforcing Diversity and Quality in Language Model Generations
- From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline
- Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy
- On the Optimal Reasoning Length for RL-Trained Language Models
- Nemotron 3 Nano: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning
- Think Dense, Not Long: Dynamic Decoupled Conditional Advantage for Efficient Reasoning
- Qwen3 Technical Report
- Prompt-Level Reward Specifications for Open-Ended Post-Training
- Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning
- Group Sequence Policy Optimization
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks