小米开源CocktailASR-1,解决多人语音识别鸡尾酒会难题
9月11日,小米正式发布并开源工业级目标说话人语音识别大模型Xiaomi-CocktailASR-1。该模型采用端到端LLM架构,通过声纹提示技术,在多人同时说话的复杂环境中精准提取目标用户语音,解决...
在人工智能语音处理领域,一个长期存在的技术难题被称为"鸡尾酒会问题"——当多人同时讲话时,传统语音识别系统(ASR)的准确率会显著下降。为解决这一挑战,小米近日宣布开源其自主研发的工业级目标说话人语音识别大模型Xiaomi-CocktailASR-1。
这款模型的核心创新在于其独特的处理方式:不是单纯地增强降噪能力,而是通过提供目标说话人的参考音频作为声纹提示,让系统能够从嘈杂的多人语音中精准提取并转录指定用户的语音内容。这种设计使得模型能够在复杂的多说话人场景下保持高精度的语音识别能力。
根据官方数据,Xiaomi-CocktailASR-1在AliMeeting、AMI、LibriMix等多个主流多说话人测试集上均达到了当前最优性能(SOTA)。同时,该模型还具备出色的单人识别能力,其表现可与现有的标准ASR模型相媲美,实现了单人和多人场景的无缝切换。此外,模型还支持负样本拒识功能,当目标说话人不在场时,系统将输出空文本,有效避免了误触发。
值得注意的是,Xiaomi-CocktailASR-1还引入了思维链推理模式,为识别结果提供了可解释性的推理过程。这意味着用户不仅可以获得语音转录结果,还能了解系统是如何做出判断的,这对于提升系统的透明度和可信度具有重要意义。
目前,Xiaomi-CocktailASR-1的模型权重与推理代码已经开源,开发者可以通过GitHub(https://github.com/xiaomi-research/xiaomi-cocktailasr-1)和HuggingFace(https://huggingface.co/Ease3/Xiaomi-CocktailASR-1)获取相关资源,进行二次开发和应用部署。

这张示意图清晰地展示了Xiaomi-CocktailASR-1的工作原理:左侧部分描绘了传统的多说话人识别场景,存在多个干扰说话人;右侧部分则展示了目标说话人识别的场景,系统能够精准提取并转录目标说话人的语音,同时拒绝非目标说话人的干扰。
小米表示,这款开源模型的发布不仅标志着公司在语音识别技术领域的又一重要突破,也为业界提供了一个强大的工具,有助于推动相关技术的发展和应用落地。