PEAfowl:感知增强多视角 VLA 双臂操作
Original title: PEAfowl: Perception-Enhanced Multi-View Vision-Language-Action for Bimanual Manipulation
IndustryAI 66
Source: arXiv cs.ROPublish time unverified
arXiv:2601.17885v2 Announce Type: replace-cross Abstract: Bimanual manipulation in cluttered scenes requires policies that remain stable under occlusions, viewpoint changes and scene variations. Existing vision-language-action models often lack such robustness because (i) multi-view features are fused via view-agnostic token concatenation, yielding limited cross-view spatial representations, and (ii) language is injected as global conditioning, resulting in coarse instruction grounding.