蚂蚁Altum系统助力大模型训练,性能优化与实践案例解析

蚂蚁集团新一代大模型训练数据处理系统 Altum 在 QCon 上海大会上首次亮相,其设计旨在解决大模型训练中的高失败率、低吞吐和长交付时长等痛点。通过异构算力融合调度、端到端存储优化及 Agenti...

人工智能

在 2026 年 QCon 全球软件开发大会上海站上,蚂蚁集团展示了其最新研发的下一代大模型训练数据处理系统 Altum。该系统针对当前大模型训练中普遍存在的性能瓶颈问题,提供了一套完整的解决方案,标志着蚂蚁在 AI Data Infra 领域的技术突破。

文章配图

Altum 系统的核心设计理念围绕着"构建 AI"向"驾驭 AI"的转变展开,重点解决了大模型训练过程中面临的三大挑战:高失败率、低吞吐量以及长交付周期。系统通过四个关键维度进行优化:全局资源利用率、存储与网络 IO 性能、计算性能以及研发效率。

在算力层面,Altum 采用异构算力融合调度技术,向上兼容不同算子体系,向下支持多种算力类型,从而实现全局资源利用率的最大化。同时,系统基于 Apache Paimon 数据湖存储架构,对从数据采集到模型训练消费的整个流程进行了端到端优化,显著提升了存储与网络 IO 性能。

计算性能方面,Altum 通过算子性能优化和增量计算机制(包括全局去重、样本重试、增量同步等功能),有效提升了 GPU 计算效率。稳定性提升则体现在样本级重试、端到端可观测性保障、SLA 服务等级协议以及熔断保护机制等方面。

研发效率的提升主要得益于端到端场景化 Pipeline 的构建,以及增强型节点和算子能力的人机协同研发模式。此外,Altum 还引入了 Agentic 数据处理方式,支持逐条数据的多轮 Agent 处理,进一步提高了系统的智能化水平。

据蚂蚁集团大模型训练数据处理系统技术负责人王鑫介绍,Altum 已在阿福、百灵等多个内部场景中成功落地应用,取得了显著的业务成效。未来,蚂蚁计划持续优化 Altum 系统,推动 AI Data Infra 的发展,为更多行业提供高效的大模型训练解决方案。

与此同时,华为与中电信合作推出的星辰轻量级代码智能体大模型 Xing4.0-29B-A4B 也值得关注。该模型基于昇腾超节点完成训练,总参数量 290 亿,激活参数仅 40 亿,是国内首个完成百亿参数级别训练的模型。Xing4.0-29B-A4B 在长程任务处理、多步骤执行能力以及工具调用协同方面表现出色,特别是在代码生成和智能体执行任务上展现了强大的综合能力。

此外,上海阶跃星辰发布的 Step 5 Preview 模型也在全球开源模型排名中快速攀升,从第三名跃升至第二名。该模型以更小的参数规模和更低的任务成本,实现了更高的综合智能排名,为真实世界智能体任务提供了新的解决方案。