具身智能观察

李飞飞首个多模态世界模型 Atlas 正式发布:从零开始预训练,几张图就能构建世界

波士顿动力产业动态AI 78

来源:InfoQ 中文发布时间待核实

李飞飞的 Atlas 来了 一张照片能够告诉 AI,房间里有一张桌子。但如果把镜头移到桌子背后,那里应该是什么样?如果机器人伸手推动桌上的杯子,接下来又会发生什么? 识别物体、生成画面和理解空间,是相互关联、却不能直接画等号的能力。李飞飞创办的World Labs,正在尝试跨越它们之间的距离。 昨晚,World Labs 发布新一代世界模型 Atlas,这是一款全域模型,团队从零开始预训练,使其能够原生处理文本、图像、视频和 3D 数据。Atlas 它将用于后续 Marble 及其他产品,目前面向部分合作伙伴开放早期访问,而非全面上线。 这款备受关注的多模态世界模型的亮点是什么? 按照官方披露,Atlas的主要能力包括世界生成、重建和模拟等广泛任务: 可控运镜:Atlas 可利用像素级相机控制,从一张或多张图像生成图像和视频,输出长达 1 分钟的 1440p 视频。 空间重建:Atlas 可以根据一张或数十张输入图像重建真实世界场景。它既可以生成来自新视角的图像帧,也可以生成明确的 3D 输出,其性能优于目前最先进的 3D 重建专用模型。 时空模拟:Atlas 通过输入视频对空间和时间…

相关动态