谷歌Gemini3.8FlashTTS升级,支持自然语言定制声音与30秒语音复刻

谷歌近日推出 Gemini 3.8 Flash TTS 和 Flash-Lite TTS 两款全新文本转语音模型,显著提升语音生成的可控性和表现力。新模型支持通过自然语言描述创建定制声音,仅需 30 ...

人工智能

在人工智能语音技术领域,谷歌再次迈出重要一步。9月23日,谷歌宣布其 Gemini 家族新增两款文本转语音(TTS)模型——Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS。这两款模型旨在将语音生成从静态预设转变为动态创意工作室,帮助创作者、开发者和企业打造更具表现力的音频体验。

新推出的 Gemini 3.8 Flash TTS 模型面向深度创意方向和角色设计,用户可以通过自然语言提示从头创建全新语音。该模型支持在100多种语言和方言中自定义角色、口音和语音特征,适用于游戏、沉浸式有声读物、播客和互动媒体等场景。此外,它还能对表演提示、节奏、方言转换等进行精细控制,实现从平静客服到悬疑场景等多种演绎效果。

相比之下,Gemini 3.8 Flash-Lite TTS 则专注于大容量、高性价比规模场景。该模型针对大容量配音、音频内容创作和富有表现力的语音代理进行了优化,可对音调、节奏和表现力细微差别进行精细控制。用户可以将原有30种原始语音扩展至无限语音库,同时访问超过2000种现成语音,覆盖包括墨西哥西班牙语、魁北克法语、苏格兰英语在内的广泛区域变体。

这两款新模型的核心亮点在于其强大的语音复刻能力。仅需30秒音频样本,系统即可重现一致的声音特征,并内置同意验证、SynthID水印和C2PA凭据,保护开发者和声音人才的权益。这一功能特别适合需要快速创建个性化语音的应用场景,如虚拟助手、游戏角色配音等。

图2

在性能方面,Gemini 3.8 Flash TTS 在Hume AI的语音设计基准测试中以71.4分位居总体第一,在口音建模方面也以60.8分处于领先地位。与前代产品相比,新模型在长格式内容和双扬声器剧本控制等用例中有显著改进。在Voice Arena的盲法人类偏好评估中,两款模型在全球主要语言(包括日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语)竞争对手中均占据领先地位。

图3

为了确保内容的透明度和安全性,谷歌在语音创建和复制功能中内置了严格的保护措施。对于语音复制,系统要求用户提供来自语音所有者的口头同意记录,并与参考说话者匹配后才能创建语音。此外,模型还支持保存和管理自定义语音,确保在持续项目中保持一致性能,最小化漂移。

这两款新模型的推出,标志着谷歌在AI语音技术领域的又一次重大突破。它们不仅提升了语音生成的可控性和表现力,还为内容创作者提供了更丰富的音频制作工具。随着AI技术的不断发展,这类创新性的语音解决方案有望在更多应用场景中发挥重要作用,推动整个行业的进步。