具身智能观察

Beyond Pairwise Feedback: Listwise Vision-Language Supervision for Preference-Based Reward Learning

产业动态

来源:arXiv cs.RO发布时间待核实

arXiv:2608.25350v1 Announce Type: cross Abstract: Vision-language models (VLMs) have emerged as a powerful source of supervision for reinforcement learning, enabling agents to leverage rich semantic knowledge during training. Inspired by the success of preference-based reward learning (PbRL) in reinforcement learning from human feedback (RLHF), vision-language model generated image-based preferences provide an effective source for learning reward functions.

Beyond Pairwise Feedback: Listwise Vision-Language Supervision for Preference-Based Reward Learning | 具身智能观察