具身智能观察

MOSS-VL技术报告:将实时交互作为一等能力的开源视觉语言模型家族

产业动态

来源:AI HOT 精选发布时间待核实

MOSS-VL是一个将实时交互(边感知边说话)作为一等能力的开源视觉语言模型家族,通过门控交叉注意力让语言解码器在生成时同步处理视觉输入。MOSS-VL-Realtime在四个流式基准中平均成绩居开源模型之首(三项第一、一项第二),在OmniMMI Proactive Alerting上以66.0分大幅领先最佳基线(37.5分)。

MOSS-VL技术报告:将实时交互作为一等能力的开源视觉语言模型家族 | 具身智能观察