WHALE: A Simple Recipe for Joint Harness-Weight Optimization
cs.LG, cs.AI
Submitted: 2026-08-31
Updated: 2026-08-31
Code: https://github.com/krafton-ai/WHALE
Terminology
Sources
- FireAct: Toward Language Agent Fine-tuning
- ReTool: Reinforcement Learning for Strategic Tool Use in LLMs
- Reinforced Self-Training (ReST) for Language Modeling
- Automated Design of Agentic Systems
- Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning
- Billion-scale similarity search with GPUs
- Meta-Harness: End-to-End Optimization of Model Harnesses
- Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses
- P 2O: Joint Policy and Prompt Optimization
- Evolving Agents in the Dark: Retrospective Harness Optimization via Self-Preference
- HARBOR: Automated Harness Optimization
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models
- Fine-Tuning and Prompt Optimization: Two Great Steps that Work Better Together
- Learning, Fast and Slow: Towards LLMs That Adapt Continually
- Large Language Models as Optimizers
- DAPO: An Open-Source LLM Reinforcement Learning System at Scale
- STaR: Bootstrapping Reasoning With Reasoning
- AFlow: Automating Agentic Workflow Generation
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks