Embodied Intelligence Observer

谷歌落后一个时代?CEO 亲自官宣“语音转文字”模型,网友:你们看不清形势啊

Industry

Source: InfoQ 中文Publish time unverified

谷歌发布号称“迄今最强”语音转文本模型 8月26日,谷歌发布新一代语音转文本模型 Gemini 3.5 Transcribe,可以在转录过程中自动处理“嗯”“啊”等语气词、口误和重复表达,并补充标点、大小写及文本格式。 谷歌将其称为“迄今最精确的语音转文本模型”,谷歌 CEO Pichai 在x上宣布了该模型。 与只追求逐字记录的传统语音识别模型不同,Gemini 3.5 Transcribe 希望直接将原始语音转换为更接近成稿的文本,减少用户后续整理会议记录、采访速记和通话内容的工作量。 例如,当用户说“我们周二开会——不,改成周三”时,模型能够理解后半句是对前面内容的修正,并在最终文本中保留正确结果,而不是机械记录整段口误。 Gemini 3.5 Transcribe支持85种以上语言和地区变体,并能够自动判断当前使用的语言。用户不需要提前设置语种,即使在一句话或者同一段对话中切换语言,模型也可以继续转录。 这项能力主要面向跨国会议、多语言访谈、客服通话以及同时夹杂中英文专业术语的场景。 在真实录音中,影响转录准确率的往往不只是口音,还包括背景噪声、多人同时发言和专业词汇。谷歌称,…

谷歌落后一个时代?CEO 亲自官宣“语音转文字”模型,网友:你们看不清形势啊 | Embodied Intelligence Observer