Ming-Flash-Omni,全模态大模型的技术突破与实践路径
在人工智能领域,大型语言模型正经历从单一模态向全模态演进的关键阶段。近日,蚂蚁集团高级算法专家郭清沛在QCon全球软件开发大会2026北京站的演讲中,系统阐述了其团队研发的Ming-Flash-Omn...
在人工智能领域,大型语言模型正经历从单一模态向全模态演进的关键阶段。近日,蚂蚁集团高级算法专家郭清沛在QCon全球软件开发大会2026北京站的演讲中,系统阐述了其团队研发的Ming-Flash-Omni全模态统一大模型的技术创新与落地实践。
郭清沛指出,当前多模态大模型的发展趋势可概括为"模型越来越像人"。从感知维度看,模型需要整合视觉、听觉等多模态感知能力;从能力维度看,则要实现理解与生成任务的一体化。基于这一判断,Ming-Flash-Omni从立项之初就定位为一个原生全模态统一模型,而非简单的语言模型外挂多模态功能。
在技术实现上,Ming-Flash-Omni采用了三条核心路径:首先是模态统一,通过原生多模态训练直接在预训练阶段引入多模态序列;其次是任务统一,构建共享空间表征(Unified Shared Space)实现理解与生成任务的协同;最后是工程优化,包括跨模态融合架构和数据异构性处理。
特别值得关注的是,Ming-Flash-Omni在医学影像分析领域取得了突破性进展。通过采用SigLIP-400M编码器和三种窗宽窗位映射到RGB三通道的预处理方法,该模型在MedQA、MedMCQA等医学问答任务上分别达到89.8%和74.2%的准确率,较现有方案提升2.6%-10%。同时,针对病理WSI(Whole Slide Imaging)的十亿像素级数据,Ming-Flash-Omni提出WSI-Precision和WSI-Relevance两个专用指标,有效解决了诊断区域极度稀疏的问题。
此外,Ming-Flash-Omni还在风控建模领域展现出显著优势。通过对信审文本、视频、车辆GPS等多模态数据进行融合编码,该模型能够有效应对经济环境变化与新型信贷欺诈攻击,相比传统风控模型错误率降低50%以上。
郭清沛强调,Ming-Flash-Omni的成功实践标志着全模态大模型从理论研究走向实际应用的重要里程碑。未来,随着更多行业应用场景的拓展,全模态大模型将在医疗、金融、工业等多个领域发挥更大价值。