Embodied Intelligence Observer

Beyond Pairwise Feedback: Listwise Vision-Language Supervision for Preference-Based Reward Learning

Industry

Source: arXiv cs.ROPublish time unverified

arXiv:2608.25350v1 Announce Type: cross Abstract: Vision-language models (VLMs) have emerged as a powerful source of supervision for reinforcement learning, enabling agents to leverage rich semantic knowledge during training. Inspired by the success of preference-based reward learning (PbRL) in reinforcement learning from human feedback (RLHF), vision-language model generated image-based preferences provide an effective source for learning reward functions.

Beyond Pairwise Feedback: Listwise Vision-Language Supervision for Preference-Based Reward Learning | Embodied Intelligence Observer