具身智能观察

李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」

产业动态

来源:雷峰网发布时间待核实

视觉轨迹充当“同声传译”,让世界模型和机器人动作真正“同频对话”。 作者丨幸丽娟 编辑丨岑 峰 日前,一篇叫做《TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks》的论文悄然上线 arXiv。论文署名中出现了两个大家很熟悉的名字——李飞飞、吴佳俊。 论文链接:https://arxiv.org/html/2608.24101v1 熟悉具身智能圈的人都知道,这两个名字放在一起,分量不轻。 李飞飞是世界模型“空间智能”方向的旗帜人物,而刚刚领完 IJCAI 2026 计算机与思想奖的吴佳俊,则是这一领域最核心的研究者之一。 这两位长期合作的学术战友,最近在具身智能领域动作频频。就在一个月前,他们刚与 ControlNet 作者张吕敏等十余位学者共同发表了《Masked Visual Actions for Unified World Modeling》,把机器人动作渲染成像素轨迹,喂给视频世界模型。 但对于他们而言,之前的尝试或许还不够彻底。 世界模型能看懂机器人动作了,但机器人动作那一侧的问题还卡着…

李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」 | 具身智能观察