对话英伟达李柏依:物理智能的基本单位可能是运动
产业动态AI 90
来源:MIT科技评论中文发布时间待核实
2020 年底,李柏依在康奈尔大学的博士生涯进入第三年,也走进了一段研究上的困顿期。 此前,她一直从事表征学习研究,但在那段日子里,她越往前走,似乎越不知道这条路还能通向哪里。也就是在那段时间,她开始接触多模态学习。当时,多模态还不是视觉研究的主流热点,三维视觉吸引了更多关注。她向同学说起自己正在做多模态,得到的反应往往礼貌而寡淡。 但她隐约觉得,当时按照固定类别完成检测和分割的视觉系统太“死”了:输入是预设的,输出也是预设的,像功能机上的实体按键,只能完成事先规定好的操作。有没有可能像智能手机一样,让输入变得任意,让视觉系统根据人的意图灵活地理解世界? 这个问题把她引向视觉与语言的对齐,也让她恰好赶上了 CLIP 发布后多模态研究爆发的前夜。 几年后,多模态已经成为 AI 领域最核心的方向之一。李柏依也从那个“不知道该往哪里走”的博士生,成为英伟达研究院和加州大学伯克利分校的研究员与研究负责人,带领团队推进 Foundation Motion,探索机器能否通过运动理解物理世界。 她的研究从计算机视觉出发,经过多模态学习,延伸到自动驾驶和具身智能。应用场景不断变化,贯穿其中的问题却始终…