谷歌Gemini3.5Transcribe发布,准确率提升70%,多语言支持超85种
谷歌(GOOGL.US)于当地时间8月26日发布了其最新的语音转文字模型——Gemini 3.5 Transcribe,称这是目前该公司语音识别技术中准确度最高的产品。与传统的语音识别工具不同,Gem...
谷歌(GOOGL.US)于当地时间8月26日发布了其最新的语音转文字模型——Gemini 3.5 Transcribe,称这是目前该公司语音识别技术中准确度最高的产品。与传统的语音识别工具不同,Gemini 3.5 Transcribe不仅提升了对复杂场景的适应能力,还实现了从"逐字记录"到"意图理解"的跨越,标志着语音识别技术迈入了一个新的发展阶段。
在技术细节方面,Gemini 3.5 Transcribe的核心优势体现在多个维度。首先,在流式处理场景下,该模型的平均词错率(WER)仅为4.0%,非流式处理场景下更是低至2.6%,相较于上一代模型Chirp 3的7.32%有了显著提升。特别是在FLEURS多语言基准测试中,Gemini 3.5 Transcribe Live的词错误率为5.50%,远低于竞争对手OpenAI GPT Live Transcribe的8.9%。此外,该模型还具备强大的语境理解能力,能够自动识别说话人的自我修正(如将"周二见面"改为"周三见面"),并删除口头禅(如"um"、"uh")以及完成标点符号和文本格式的整理。
值得注意的是,Gemini 3.5 Transcribe在多语言支持方面也表现出色,能够自动识别超过85种语言及方言口音,并支持多语言混说场景。用户还可以通过自定义词汇表来适配专业术语和特殊拼写需求,例如邮政编码、订单号等字母数字组合。对于预录音频,模型还支持说话人识别和逐词时间戳功能,为会议记录和通话分析提供了更精细的支持。
在应用场景方面,Gemini 3.5 Transcribe已经率先落地于Android平台的Gboard Rambler语音输入功能以及Mac版Gemini应用。未来,谷歌计划将其引入Chrome浏览器,届时用户可以在网页文本输入框内直接通过语音输入内容,涵盖回复消息、撰写帖子及向Gemini发出指令等场景。这一举措将进一步推动语音交互成为用户与AI系统的主要连接方式。
开发者层面,Gemini 3.5 Transcribe通过两套API提供服务:基于Live API的实时流式接口(gemini-3.5-transcribe-live)支持双向流式传输,延迟低于一秒;基于Interactions API的录音转写接口可处理会议与通话录音,提供词级时间戳。目前两者均已在Google AI Studio与Gemini Enterprise Agent Platform开启公开预览,开发者可以通过调用低延迟转录、自定义词汇及智能格式化等功能,将语音识别能力嵌入自有应用。
此次发布是谷歌系统性推进Gemini"语音入口"战略的重要组成部分。随着语音转文本技术从单纯的后台基础能力演变为AI应用的重要交互入口,用户与AI的交互方式有望从键盘输入向语音指令转移。对谷歌而言,将Gemini 3.5 Transcribe嵌入Chrome、Gboard、Docs、Gmail等高频产品,有助于进一步扩大Gemini在日常生产力场景中的渗透深度,并在语音交互这一新兴入口上巩固其竞争地位。