小米MiMo-V3启用HySparse2架构,长文本检索性能提升5倍
小米大模型负责人罗福莉宣布MiMo-V3将采用全新架构HySparse 2,该技术在100万Token上下文条件下可使预填充计算量降低5.02倍、KV缓存占用缩小4.5倍。同时,小米还发布了面向专业场...
【太平洋科技讯】9月23日,小米公司宣布其新一代大模型MiMo-V3将采用全新的架构设计,核心组件为HySparse 2技术。据小米大模型负责人罗福莉介绍,这项新技术通过多项创新优化,在长文本处理能力上实现了显著提升。
在关键技术指标方面,HySparse 2架构在100万Token长度的上下文条件下,预填充计算量(FLOPs)降低了5.02倍,KV缓存占用减少了4.5倍。同时,模型在MRCRv2和RULER-v2等关键评测指标上表现更优,AgentPPL和LongPPL等指标也有所改善。
罗福莉指出,智能体推理是当前大模型应用中的重要场景,但这种工作负载对预填充成本、KV缓存规模和检索准确率提出了更高要求。为此,HySparse 2架构引入了多项创新设计:采用KV桥接机制,让交叉解码器利用自解码器的隐藏状态构建K/V值;实现KV重用,在混合块内部稀疏层复用前一层全注意力层的KV缓存与选择索引;改进选择机制,从块级选择改为Token粒度选择,并用近期Token强制窗口替代独立SWA分支,从而实现本地与全局Token共享同一份KV缓存。
值得注意的是,小米不仅在MiMo-V3上进行技术创新,还在同一天发布了面向专业场景的MiMo-V2.6系列模型。该系列包含Pro、Flash和UltraSpeed三款产品,均支持全模态理解能力,针对不同专业需求进行了全面优化。
其中,MiMo-V2.6-Pro作为旗舰版本,采用万亿参数规格,专为复杂项目落地、长程任务处理等专业需求设计;MiMo-V2.6-Flash则定位高效均衡款,适合高频调用的专业办公场景;MiMo-V2.6-Pro-UltraSpeed版本最高可实现20倍输出速度提升,主要服务于强实时交互的生产类场景。
此外,小米还同步推出了两项配套服务:MiMo批量推理(Batch API)支持Flash与Pro两款模型,为大批量非实时推理提供更高性价比解决方案;团队版Token Plan订阅服务则帮助开发团队和企业清晰管控成本,聚焦业务交付。
业内人士分析认为,小米通过MiMo-V3和MiMo-V2.6系列的双重发布,展示了其在大模型领域的持续创新能力。HySparse 2架构的推出不仅解决了长文本处理中的关键痛点,也为智能体应用提供了更强大的技术支持。而MiMo-V2.6系列的专业化布局,则表明小米正在加速推进AI技术在各行业的深度应用。