DMRL: Document-Mediated Reinforcement Learning for Skill Optimization in Advertising Recommendation
cs.LG
Submitted: 2026-09-02
Updated: 2026-09-02
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- EvoSkill: Automated Skill Discovery for Multi-Agent Systems
- Soft Adaptive Policy Optimization
- SoK: Agentic Skills -- Beyond Tool Use in LLM Agents
- Tulu 3: Pushing Frontiers in Open Language Model Post-Training
- SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks
- SkillForge: Forging Domain-Specific, Self-Evolving Agent Skills in Cloud Technical Support
- Understanding R1-Zero-Like Training: A Critical Perspective
- SkillClaw: Let Skills Evolve Collectively with Agentic Evolver
- Skill-Pro: Learning Reusable Skills from Experience via Non-Parametric PPO for LLM Agents
- Trace2Skill: Distill Trajectory-Local Lessons into Transferable Agent Skills
- AutoRefine: Compiling Trajectories into Validated Typed Agent Artifacts
- Proximal Policy Optimization Algorithms
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- SKILLFOUNDRY: Building Self-Evolving Agent Skill Libraries from Heterogeneous Scientific Resources
- SkillX: Automatically Constructing Skill Knowledge Bases for Agents
- Voyager: An Open-Ended Embodied Agent with Large Language Models
- EvolveR: Self-Evolving LLM Agents through an Experience-Driven Lifecycle
- AgenticRecTune: Multi-Agent with Self-Evolving Skillhub for Recommendation System Optimization
- SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning
- SkillOpt: Executive Strategy for Self-Evolving Agent Skills
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks