Revisiting On-policy Adversarial Black-Box Distillation: Calibrating Groupwise Reward Geometry for Effective Advantage Construction
cs.LG, cs.CV
Submitted: 2026-09-30
Updated: 2026-09-30
Code: https://github.com/2018cx/GRGC
Terminology
Sources
- DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- Exploiting GPT-4 Vision for Zero-shot Point Cloud Understanding
- Black-Box On-Policy Distillation of Large Language Models
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- OVD: On-policy Verbal Distillation
- Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL
- Distilling the Knowledge in a Neural Network
- Towards Cross-Tokenizer Distillation: the Universal Logit Distillation Loss for LLMs
- A Dual-Space Framework for General Knowledge Distillation of Large Language Models
- Instruction Tuning with GPT-4
- The False Promise of Imitating Proprietary LLMs
- Orca: Progressive Learning from Complex Explanation Traces of GPT-4
- OpenThoughts: Data Recipes for Reasoning Models
- LIMO: Less is More for Reasoning
- s1: Simple test-time scaling
- Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning
- Qwen2.5 Technical Report
- The Llama 3 Herd of Models
- gpt-oss-120b & gpt-oss-20b Model Card
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks