阿里Qwen语音模型登顶全球权威榜单,多语种合成技术突破行业天花板

9月28日,阿里巴巴发布的语音大模型Qwen-Audio-3.1-TTS在Artificial Analysis的语音排行榜上以1177 Elo评分夺得全球第一。该模型支持多语种及方言合成,可通过指令...

人工智能

在人工智能领域,语音合成技术一直是衡量AI能力的重要指标之一。近日,阿里巴巴旗下的语音大模型Qwen-Audio-3.1-TTS在全球权威评测平台Artificial Analysis的语音排行榜(Controlled Voice Arena)中以1177 Elo评分荣登榜首,成为当前业界领先的语音合成解决方案。

图中清晰展示了Qwen-Audio-3.1-TTS在众多竞争对手中的领先地位。这款模型是阿里在2026年云栖大会上推出的新一代语音合成系统,属于Qwen-Audio-3.1系列,该系列还包括语音转写(ASR)和实时语音交互(Realtime)两类模型,均已上线千问AI平台提供API服务。

与传统语音合成技术相比,Qwen-Audio-3.1-TTS的最大亮点在于其对声音表现力的深度优化。用户不仅可以通过指令控制情绪、语速和表达方式,还能让同一音色在不同语言之间自然迁移,用一种声音流畅地讲出多种语言。这种跨语言的自然切换能力,使得Qwen-Audio-3.1-TTS在国际化的应用场景中具有显著优势。

此外,Qwen-Audio-3.1-TTS还开源了多款相关模型,如Qwen-Audio-Agent和CosyVoice,在GitHub上累计获得了数万星标,吸引了海内外开发者的广泛关注。目前,阿里已将全线语音模型的价格下调最高达95%,为开发者和企业降低了应用门槛。

文章配图

值得注意的是,此次夺冠并非偶然。阿里在语音技术领域的长期投入为其奠定了坚实基础。根据近期机构研报显示,阿里正通过AI芯片、基础设施与模型层的同步激进投入,构建起显著的竞争壁垒。例如,平头哥真武V900芯片提前至2027年一季度发布,性能达到M890的3倍;云端数据中心目标2032年超20GW,对应FY33外部收入约1750亿美元。

这一成就也反映了AI语音技术正在经历一场深刻的变革。随着终端侧AI算力的提升和算法的不断优化,语音合成不再局限于简单的字音还原,而是向着更加自然、更具表现力的方向发展。高通最新推出的骁龙畅听平台(Snapdragon Sound Elite Gen 2)就是一个典型代表,它整合了高端音频技术、终端侧AI算力以及微功耗Wi-Fi 6E,为无线耳机等设备提供了更强的智能听觉支持。

展望未来,随着AI语音技术的持续进步,跨语言、跨场景的自然语音交互将成为可能。无论是车载音响系统还是智能家居设备,都将受益于这项技术的发展。而像HUAWEI SOUND非凡系列这样的国产高端车载音响品牌,也在通过软硬件结合的方式,为用户带来更优质的听觉体验。

总的来说,阿里Qwen-Audio-3.1-TTS的全球夺冠不仅是对其技术实力的认可,也为整个AI语音行业树立了新的标杆。随着更多创新技术的涌现,我们有理由相信,未来的语音交互将更加智能、更加人性化。