Embodied Intelligence Observer

VISTA: Visually Inferred Spatial ConTact Attention for Contact-Rich Manipulation

Research

Source: arXiv cs.ROPublish time unverified

arXiv:2608.25872v1 Announce Type: new Abstract: Contact-rich manipulation requires precise interaction feedback. While vision-centric imitation learning is prevalent, external visual observations provide indirect and ambiguous cues about contact states, particularly under occlusion or subtle object--gripper interactions; dedicated tactile or force sensors can provide rich contact information but introduce additional hardware complexity, calibration requirements, and deployment costs.

VISTA: Visually Inferred Spatial ConTact Attention for Contact-Rich Manipulation | Embodied Intelligence Observer