语音模型价格对齐,千问Qwen-Audio-3.1降价70%,量纲统一成关键

千问发布 Qwen-Audio-3.1 系列语音大模型,全线产品价格下调,其中 TTS 模型降价约 70%。文章深入分析了语音模型定价中的量纲混乱问题,并通过实际测试展示了不同模型在计费方式、性能表现...

人工智能

在人工智能领域,语音大模型的价格体系一直存在争议。近日,千问正式推出 Qwen-Audio-3.1 系列语音大模型,不仅在技术上实现了多项升级,更大幅下调了全线产品的价格,其中 TTS 模型降价约 70%,Realtime 模型降幅达 85%,ASR 模型更是砍掉 95% 的成本。这一系列动作引发了行业对语音模型定价机制的重新审视。

然而,看似简单的价格下调背后,隐藏着复杂的工程挑战。以 Qwen-Audio-3.1-TTS-Flash 和 cosyvoice-v3-flash 为例,尽管都是中文文本转语音模型,但它们的计费单位却完全不同:前者按百万词元(tokens)计费,后者则按万字符计费。这种量纲不一致导致直接比较价格变得毫无意义。例如,同样是合成一段 253 字符的文本,Qwen-Audio-3.1-TTS-Flash 实际消耗 133 词元,而 cosyvoice-v3-flash 只记录字符数,两者无法直接对比。

为解决这一问题,开发者需要进行一系列复杂的计算和转换。以一次文本合成为例,首先需要获取模型的实际用量数据,然后将不同单位的数据统一到同一标准下进行比较。图1 展示了使用百炼 CLI 工具查询模型用量的命令行界面,清晰地显示了如何通过 "bl usage stats" 命令获取详细的用量信息。此外,还需要考虑模型的等待时间差异,如 Qwen-Audio-3.1-TTS-Flash 的平均响应时间为 2.2 秒,而 cosyvoice-v3-flash 则需要 17.0 秒,差距高达 7.7 倍。

值得注意的是,价格调整不仅仅是数字的变化,它还涉及到模型性能的优化。例如,Qwen-Audio-3.1 系列在保持低价的同时,显著提升了语音合成的质量和实时交互的流畅度。图3 展示了 Qwen-Audio-3.1 的核心功能,包括 ASR(语音转文字)、TTS(文本转语音)和 Realtime(实时语音交互),这些功能共同构成了完整的音频处理能力栈。

文章配图

对于开发者而言,价格对齐工程的意义不仅在于降低成本,更在于提高开发效率。通过统一的计费单位和标准化的接口,开发者可以更方便地进行跨模型比较和选择。同时,这也为构建更复杂的语音应用提供了可能,例如多轮对话系统或实时语音翻译服务。

文章配图

总的来说,千问此次推出的 Qwen-Audio-3.1 系列及其配套的价格调整策略,不仅展示了其在语音技术领域的实力,也为整个行业树立了一个新的标杆。随着更多厂商加入价格战,未来语音大模型的市场格局或将发生深刻变化。