豆包视频通话升级,火山引擎多模态传输系统提供技术支撑
Industry
Source: InfoQ 中文Publish time unverified
走到一个陌生景点,举着手机让豆包带你逛,它看到路牌标识主动提醒方向,看到建筑开口介绍典故;旁边路人聊天、街边叫卖,豆包不会被带偏,依然只跟你对话。豆包视频通话功能升级后,AI 可以在连续变化的真实场景中实现更自然的连续交互,这为用户带来了三个最直观的感受: 能边看边听边说。 用户不用等 AI 说完才能开口,AI 能同时接收和处理音频、视频、文本三路输入。指着航班牌问 "这个怎么走",它看懂你指的是行李转盘;多人聊天时,它结合口型和画面判断是谁在对话,不被旁边闲聊带偏。 AI 会主动开口。 持续感知环境变化,看到关键标识会主动提醒,处理任务时主动调用工具查信息、整理结果。交互模式从 "一问一答" 升级成了 "双向协作",用户不用每次都先开口。 对话节奏自然。 不打断也不冷场,该说时说,该听时听。自然接话、合理停顿,精准分辨旁人闲聊和背景噪声。官方评测显示,对比传统级联方案,对话节奏违和问题减少了约 50%—— 用户几乎不会遇到 "AI 说完话突然停住" 或 "我还没说完 AI 就抢答" 的尴尬。 这背后是一次双线升级:模型层接入原生音视频全双工大模型 SeedRealtime,在业界率先…