CodeScaler: Scaling Code LLM Training and Test-Time Inference via Reward Models
cs.LG, cs.AI
Submitted: 2026-02-04
Updated: 2026-09-27
Code: https://github.com/volcengine/verl
Project page: https://lark-ai-lab.github.io/codescaler.github.io
Terminology
Sources
- OpenCodeInstruct: A Large-scale Instruction Tuning Dataset for Code LLMs
- OpenCodeReasoning: Advancing Data Distillation for Competitive Coding
- Program Synthesis with Large Language Models
- Evaluating Large Language Models Trained on Code
- MHPP: Exploring the Capabilities and Limitations of Language Models Beyond Basic Code Generation
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback
- DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence
- QueST: Incentivizing LLMs to Generate Difficult Problems
- Does Math Reasoning Improve General LLM Capabilities? Understanding Transferability of LLM Reasoning
- AgentCoder: Multi-Agent-based Code Generation with Iterative Testing and Optimisation
- EffiCoder: Enhancing Code Generation in Large Language Models through Efficiency-Aware Fine-tuning
- Qwen2.5-Coder Technical Report
- CodeSearchNet Challenge: Evaluating the State of Semantic Code Search
- CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment
- S*: Test Time Scaling for Code Generation
- AceCoder: Utilizing Existing Code to Enhance Code Generation
- TACO: Topics in Algorithmic COde generation dataset
- Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning
- Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks