PHIRL: Aligning Learned Rewards with Task Progress for Inverse Reinforcement Learning
cs.RO, cs.AI
Submitted: 2026-09-25
Updated: 2026-09-25
Code: https://github.com/PHIRL2026/PHIRL
Terminology
Sources
- Comprehensive Overview of Reward Engineering and Shaping in Advancing Reinforcement Learning Applications
- Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities
- Reward Transfer from Inverse Reinforcement Learning: A Coupled Minimax Approach
- Learning Reward Functions by Integrating Human Demonstrations and Preferences
- Better-than-Demonstrator Imitation Learning via Automatically-Ranked Demonstrations
- Step-Level Preference Learning for Generative Agents in Social Simulations
- TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics
- $\chi_{0}$: Resource-Aware Robust Manipulation via Taming Distributional Inconsistencies
- Mind the Sim2Real Gap in User Simulation for Agentic Tasks
- Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots
- How Much Progress Did I Make? An Unexplored Human Feedback Signal for Teaching Robots
- robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
- ReWiND: Language-Guided Rewards Teach Robot Policies without New Demonstrations
- Hybrid Inverse Reinforcement Learning
- Learning from Demonstrations via Capability-Aware Goal Sampling
- PROGRESSLM: Towards Progress Reasoning in Vision-Language Models
- Gemma 3 Technical Report
- LoRA: Low-Rank Adaptation of Large Language Models
- What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving