IAPO: Influence-Aware Policy Optimization for Credit Assignment in Multi-Turn Service Agents
cs.LG
Submitted: 2026-08-25
Updated: 2026-08-26
Terminology
Sources
- $\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment
- Process Reinforcement through Implicit Rewards
- DeepSeek-V3 Technical Report
- Tree Search for LLM Agent Reinforcement Learning
- Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs
- Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical Reasoning
- Understanding R1-Zero-Like Training: A Critical Perspective
- GPT-4 Technical Report
- GRPO-$\lambda$: Credit Assignment improves LLM Reasoning
- UserBench: An Interactive Gym Environment for User-Centric Agents
- UserRL: Training Interactive User-Centric Agent via Reinforcement Learning
- AgentChangeBench: A Multi-Dimensional Evaluation Framework for Goal-Shift Robustness in Conversational AI
- Credit Assignment with Resets in Language Model Reasoning
- Proximal Policy Optimization Algorithms
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Hindsight Credit Assignment for Long-Horizon LLM Agents
- Gemini: A Family of Highly Capable Multimodal Models
- MINT: Evaluating LLMs in Multi-turn Interaction with Tools and Language Feedback
- RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
- Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Reward Design
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks