阶跃发布StepAudio3系列,覆盖语音交互与创作的全栈大模型

9月15日,阶跃正式推出 StepAudio 3 系列语音大模型,包含实时交互、语音识别、语音生成和音乐创作等五款产品。该系列在多个权威榜单中位列全球第一,标志着语音大模型从单项能力向全栈能力的跨越。

人工智能

近日,国内领先的语音技术公司阶跃宣布推出新一代语音大模型 StepAudio 3 系列,一次性发布涵盖实时语音交互、语音识别、语音生成和音乐创作的五款核心模型。这一发布标志着语音大模型技术正从单一功能向全栈能力迈进。

StepAudio 3 系列包括 StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen 和 StepAudio 3 Music 五款产品,分别针对不同应用场景。其中,面向实时语音交互的 StepAudio 3 Realtime 在 Artificial Analysis Conversational Dynamics 榜单中以 98.9% 的综合得分位居榜首,不仅支持原生全双工对话,还能处理临时打断和连续反馈,同时具备语音推理和任务执行能力。

在语音识别方面,StepAudio 3 ASR 结合高精度识别与大语言模型的上下文理解能力,在 Artificial Analysis 非流式语音识别准确性榜单中以 1.7% 的词错误率(WER)并列全球第一。该模型能够准确识别专业术语、人名、地名、方言以及复杂上下文,特别优化了低声、快速语音、含糊连读和背景音乐等复杂输入场景。

语音生成领域,StepAudio 3 TTS 实现真人级语音生成,不仅能模拟音色、语调和节奏,还能生成笑声、迟疑等副语言表现。而 StepAudio 3 Gen 则进一步整合了人声、音效、环境声和背景音乐的生成,用户可通过自然语言描述生成包含多种声音元素的完整音频内容。

文章配图

面向音乐创作的 StepAudio 3 Music 更是突破传统限制,支持歌曲创作、清唱配乐、歌曲翻唱以及基于 ABC 记谱法的多轮交互创作,使 AI 能够深度参与实际音乐生产流程。

文章配图

“过去一年,语音大模型的竞争已经从单项能力转向全栈能力的融合。”阶跃首席科学家表示,“StepAudio 3 系列的发布,标志着我们在语音理解、推理和内容创作领域的全面突破。”目前,这五款模型均已上线阶跃星辰开放平台,供开发者和企业使用。

从行业角度来看,StepAudio 3 系列的发布将推动语音技术在更多场景的应用,特别是在智能客服、虚拟助手、内容创作等领域。随着技术门槛的降低,越来越多的企业和个人开发者将能够利用这些先进模型开发创新应用。