腾讯混元HyASR3.0发布,上下文理解能力提升,多场景识别准确率达3%左右

在语音识别领域,腾讯混元于2026年8月4日正式发布了新一代语音识别模型Hy ASR 3.0 Preview。这款模型的发布标志着语音识别技术从单纯的听清向听懂迈进,为智能交互提供了更精准的语音转写能...

人工智能

在语音识别领域,腾讯混元于2026年8月4日正式发布了新一代语音识别模型Hy ASR 3.0 Preview。这款模型的发布标志着语音识别技术从单纯的听清向听懂迈进,为智能交互提供了更精准的语音转写能力。

图片

据腾讯介绍,Hy ASR 3.0 Preview基于最新一代大语言模型Hy3的语言理解能力,通过融合高精度语音识别与深度语义理解,在多个核心维度实现了显著提升。在开源测试集中,该模型在中文普通话(WER 3.34%)、英语(WER 2.62%)和粤语(WER 3.12%)等多语种上的词错误率均控制在3%左右,整体表现处于行业领先地位。

与传统语音识别模型相比,Hy ASR 3.0 Preview最大的突破在于其上下文理解能力。通过结合Hy3的大语言模型,该模型能够智能识别同音词歧义,例如在"致癌"与"治癌"这类同音词场景中给出正确的转写结果。同时,模型还支持热词注入功能,可快速识别品牌名称、人名及行业术语,降低企业在模型适配和词库维护方面的成本。

在复杂声学环境下的表现也是此次升级的重点。针对高噪声、耳语和低声说话等场景,Hy ASR 3.0 Preview进行了专项优化,确保在嘈杂环境中仍能保持稳定的转写效果。这一特性使得用户在地铁、菜市场等嘈杂环境中使用语音输入时,也能获得更准确的转写结果。

技术层面,Hy ASR 3.0 Preview采用了兼顾效率与性能的MoE架构,并将基座模型升级至Hy3。语音侧则自研了无监督语音Encoder,通过数千万小时级的无监督语音数据进行训练,从复杂音频中提取高质量的声学特征。此外,混元团队还对语音Encoder与大语言模型进行了联合训练,引入了多来源、多方言的语音数据,进一步提升了模型的泛化能力。

目前,Hy ASR 3.0 Preview已上线腾讯云官网对外提供API服务,可广泛应用于智能客服、内容理解、语音搜索等场景。腾讯元宝作为首批接入的产品,已完成首发上线,用户可通过语音输入体验相关功能,且功能免费开放。WorkBuddy等产品也在陆续接入中。

此次发布的Hy ASR 3.0 Preview不仅展示了腾讯在语音识别领域的技术积累,也为行业提供了新的发展方向。随着语音交互在智能设备、车载系统、远程办公等场景中的广泛应用,更精准、更智能的语音识别技术将成为提升用户体验的关键因素。