Action Shaping: Policies Absorb What They Can Express
cs.AI, cs.LG
Submitted: 2026-09-26
Updated: 2026-09-26
Terminology
Sources
- Residual Off-Policy RL for Finetuning Behavior Cloning Policies
- An Agency-Transferring Model-Free Policy Enhancement Technique
- The Gate Always Closes: On Injecting Auxiliary Signals into Frozen Vision-Language Models
- Efficient Multi-Task Reinforcement Learning via Task-Specific Action Correction
- SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training
- Warp RL: Reshaping Base Policy Distributions for Dynamics Adaptation
- Gated Normalization Removal and Scale Anchoring in Pre-Norm Transformers
- Exact Network Surgery: Functional Invariance and Gradient Plasticity in Reactive Computational Graphs
- Real-World Reinforcement Learning with MPC Scaffolding for Dexterous Manipulation
- SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization
- What Makes Value Learning Efficient in Residual Reinforcement Learning?
- ORPA: Online Residual Policy Adaptation for Robot Manipulation Control with Human Feedback
- Constrained Exploration and Recovery from Experience Shaping
- Data-Free Pruning of Self-Attention Layers in LLMs
- Proximal Policy Optimization Algorithms
- PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning
- Residual Policy Learning
- DecAP: Decaying Action Priors for Accelerated Imitation Learning of Torque-Based Legged Locomotion Policies
- APEX: Action Priors Enable Efficient Exploration for Robust Motion Tracking on Legged Robots
- One Policy, Any Budget: Internalizing Budget-Aware Search via Reinforcement Learning
Related papers
- MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction
- Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
- The Clinician's Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing
- MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention
- Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems
- VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection