Beyond Pairwise Feedback: Listwise Vision-Language Supervision for Preference-Based Reward Learning
cs.LG, cs.RO
Submitted: 2026-08-26
Updated: 2026-08-26
Comments: 13 pages, 10 figures. Srivalli Katkuri and Maxwell Kawada contributed equally to this work
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Concrete Problems in AI Safety
- The Effects of Reward Misspecification: Mapping and Mitigating Misaligned Models
- The many routes to the ubiquitous Bradley-Terry model
- VLM-RL: A Unified Vision Language Models and Reinforcement Learning Framework for Safe Autonomous Driving
- Vision-Language Models as a Source of Rewards
- RoboCLIP: One Demonstration is Enough to Learn Robot Policies
- Preference-based Reinforcement Learning beyond Pairwise Comparisons: Benefits of Multiple Options
- VARP: Reinforcement Learning from Vision-Language Model Feedback with Agent Regularized Preferences
- HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation
- Qwen3-VL Technical Report
- OpenAI Gym
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks