大晓联合香港大学发布StreamPI,让 VLA 真正理解时间,迈向连续物理智能
IndustryAI 82
Source: 雷峰网Publish time unverified
当 VLA 模型理解语言、感知环境并直接生成机器人动作,一个更基础的问题开始浮现:机器人如何理解一个持续变化的物理世界?物体从哪里移动而来、杯子此前遮住了什么、机械臂正在接近还是远离目标——真正决定下一步动作的信息,往往不只存在于当前一帧,而存在于连续的时间之中。 近日,大晓机器人联合香港大学发布全新的连续物理智能研究成果 StreamPI(Streaming Multimodal Temporal Modeling for Vision-Language-Action Models),直指 VLA 长期存在的“单帧智能”瓶颈,为其补上关键的“时间维度”。不同于传统 VLA 主要依据当前观测独立决策,StreamPI 为模型建立持续的多模态时序上下文,使机器人能够记住过去、理解状态变化、判断任务进程,并利用跨帧信息增强精细空间感知与动作决策。它推动 VLA 从“识别当前状态”,进一步走向“理解一个正在发生的物理过程”。 更重要的是,StreamPI 并未依赖额外参数堆叠换取时序能力,而是基于现有 VLA 骨干,通过指令持续锚定、历史信息流式缓存与随机时间间隔训练,实现从单帧决策到连续时…