微软推出MAI-Image-2.5-Pro与MAI-Voice-2-Flash,自研模型全面赋能核心产品
微软人工智能研究实验室(Microsoft AI)日前在其官方博客上宣布,正式推出两款全新的自研MAI模型变体:MAI-Image-2.5-Pro和MAI-Voice-2-Flash。这两款模型目前已...
微软人工智能研究实验室(Microsoft AI)日前在其官方博客上宣布,正式推出两款全新的自研MAI模型变体:MAI-Image-2.5-Pro和MAI-Voice-2-Flash。这两款模型目前已进入公开预览阶段,标志着微软在自主开发人工智能技术方面迈出了重要一步。
其中,MAI-Image-2.5-Pro被定位为“质量优先”的旗舰图像模型,是微软迄今为止保真度最高的图像生成模型。该模型支持高精度图像生成、细节化编辑以及准确的图内文字渲染(in-image text rendering),并能够通过自然语言指令进行编辑操作。定价方面,每百万文本输入token为5美元,每百万图像输入token为8美元,每百万图像输出token为106美元。
另一款模型MAI-Voice-2-Flash则主打速度与规模优化,特别适合高并发语音场景。相比前代MAI-Voice-2,其处理速度提升2倍,成本降低32%,同时在自然韵律(prosody)与声学质量上保持旗舰水准。定价为每百万字符15美元。
值得注意的是,这两款新模型并非仅停留在技术榜单上的刷分表现,而是已经大规模应用于微软的核心产品中。例如,Bing Image Creator已100%切换至MAI-Image-2.5;PowerPoint中的图像生成与编辑功能使用MAI-Image-2.5后,GPU成本较GPT-Image-2降低最多84%;OneDrive图像编辑场景切换为MAI-Image-2.5后,保存率提升26%,P95延迟下降约25%。
此外,微软还展示了其在专业领域的应用成果。与医疗方案Dragon Copilot合作,后者服务17万医疗提供者,上季度处理2800万次就诊记录;MAI-Transcribe-1.5已接替原有模型,覆盖58种语言,在多数语言上的转录与语种识别错误率相对下降50%。
微软强调,这一系列更新的核心目标是用自研模型驱动自有产品,其模型完全在内部训练,不依赖第三方模型蒸馏。通过提供质量、速度、成本各异的模型选项,微软希望为用户与开发者提供更多选择与更高性价比。
图片展示了MAI-Image-2.5的强大图像生成能力,从简单的文本提示或上传的图像中可以创建高质量、逼真的设计就绪图像。