从算子调优到推理自治,构建MaaS场景下的AIInference自动优化闭环

在 MaaS(模型即服务)场景下,AI 推理的自动化优化闭环正在成为技术突破的关键。阿里巴巴高级技术专家杨林枫在 QCon 上海大会分享了如何通过 Atrex Kernel Agent 实现从算子调优...

人工智能

随着 AI 技术的快速发展,从"构建 AI"到"驾驭 AI"已成为行业共识。在 2026 年 QCon 全球软件开发大会上海站上,阿里巴巴高级技术专家杨林枫分享了关于构建 MaaS 场景下 AI Inference 自动优化闭环的实践经验。这一技术突破不仅解决了传统人工调优周期长、效率低的问题,更为 AI 系统的稳定性和可控性提供了新的解决方案。

杨林枫指出,在 MaaS 业务中,模型、硬件和请求工况的变化速度远超传统优化流程的响应能力。传统的部署调优和算子优化依赖人工完成需求分析、性能定位、算子开发、验证及上线等环节,整个优化周期难以跟上生产负载的变化。为此,他团队开发了一套面向 MaaS 生产场景的自动优化流程:给定卡型、模型和典型工况后,系统首先探索合适的部署配置,然后从实际运行 Trace 中识别热门算子,并结合当前工况判断是否采用已有的算子融合模式。接着对典型工况进行归并、清洗、脱敏和泛化,生成可复现的 Benchmark,再由 Atrex Kernel Agent 通过 Agent Loop 完成性能分析、代码生成、验证和持续优化,最后将优化结果回接推理框架进行端到端性能回归和灰度验证。

"这套流程的核心在于实现从算子调优到推理自治的转变," 杨林枫表示,"它让优化任务直接面向线上负载,确保每一次性能提升都能真实可靠地转化为推理服务收益。"

与此同时,智谱研究院也在递归自我改进(RSI)领域取得了重要进展。首席科学家唐杰在社交媒体上表示,智谱已经实现了最小的闭环,即模型优化系统,系统服务模型。一个由 GLM-5.3 驱动的 Infra Agent 参与了 GLM-5.3-Flash 推理服务的搭建与优化,这套服务运行在十万张以上的国产 AI 芯片上,从第一次跑通到承接全部线上流量仅用了两周时间。

演讲亮点

"当模型开始给自己干活时,研发效率和成本控制都得到了显著提升," 唐杰解释道,"优化过程中积累的任务、验证结果和修正经验又可以成为后续研发的资源,形成一个自我供给的循环。"

这种递归自我改进的能力不仅降低了模型自研成本,也为未来 AI 研发模式提供了新的可能性。不过,唐杰也强调,虽然实现了最小闭环,但距离 AI 完全自主研发下一代 AI 仍有很长的路要走。关键在于如何衡量、监督和控制这个自我改进的过程,以确保其安全性和可控性。

在 Anthropic 最近发布的《衡量前沿实验室内部 AI 的发展速度》报告中,提出了三个测量维度:AI 承担了多少 AI 研发工作、Agent 的行动受到怎样的监督、以及算力在模型研发和安全工作之间如何分配。这些指标为观察和检验 AI 自我改进过程提供了量化标准。

"我们正在努力构建一个既能提高效率又能保证安全性的闭环系统," 杨林枫总结道,"这不仅是技术上的挑战,也是对未来 AI 发展模式的探索。"

芯片与电路

这张图片展示了杨林枫在 QCon 上海大会上的演讲内容,重点介绍了从 MaaS 真实业务 Trace 中提取热点算子与典型 Shape,构建可复现的优化任务,以及 Atrex Kernel Agent 如何自动完成 Kernel 生成、性能分析和多轮迭代等内容。

这张图片展示了 AI 基础设施的概念图,包括 AI 软件工程、Agent 工程化、AI 业务落地等多个方面,反映了当前 AI 技术发展的全面布局。

这张图片展示了芯片与电路的抽象设计,象征着 AI 技术底层硬件的支持,体现了 AI 系统与硬件协同优化的重要性。