Embodied Intelligence Observer

MOSS-VL技术报告:将实时交互作为一等能力的开源视觉语言模型家族

Industry

Source: AI HOT 精选Publish time unverified

MOSS-VL是一个将实时交互(边感知边说话)作为一等能力的开源视觉语言模型家族,通过门控交叉注意力让语言解码器在生成时同步处理视觉输入。MOSS-VL-Realtime在四个流式基准中平均成绩居开源模型之首(三项第一、一项第二),在OmniMMI Proactive Alerting上以66.0分大幅领先最佳基线(37.5分)。

MOSS-VL技术报告:将实时交互作为一等能力的开源视觉语言模型家族 | Embodied Intelligence Observer