Agent生产流量可观测实践,从Trace到规模化实时评估
随着AI Agent进入真实业务场景,如何实现对其运行状态的可观测性成为关键挑战。蚂蚁集团架构师刘杨在QCon上海2026大会上分享了面向生产流量的Agent可观测实践,通过Trace实时评估、两阶段...
在AI技术快速发展的今天,Agent已经从简单的问答模型演变为能够自主规划、调用工具、执行任务的软件系统。然而,当这些具备自主能力的AI系统进入真实业务场景后,传统的日志、指标和链路追踪方法已难以满足对其运行状态的全面监控需求。面对这一挑战,蚂蚁集团架构师刘杨在2026年10月22日至24日于上海举办的QCon全球软件开发大会(技术大会)上,带来了题为《从 Trace 到规模化实时评估:面向生产流量的 Agent 可观测实践》的主题分享。
刘杨指出,尽管Agent系统已经部署在生产环境中,但仅依靠传统日志、指标和完整Trace仍然难以准确判断Agent是否正确完成任务,也无法快速定位质量问题。为此,蚂蚁集团提出了一套企业级Agent可观测与评估体系,该体系在采集层遵循OpenTelemetry GenAI语义约定,统一了模型调用、工具调用和Agent执行过程的埋点与采集标准。在评估层则以Trace为核心,构建了实时处理管线,实现了分钟级延迟的任务筛选、关键信息提取和自动评估。
具体而言,这套体系采用了声明式表达式支持不同业务Agent低成本接入,并创新性地提出了两阶段评估机制:首先使用轻量小模型进行全量、低成本、高召回筛查;再对候选Trace按需加载完整执行上下文,由大模型完成精准语义裁决。这种机制不仅有效降低了90%的token成本,还使大规模安全、合规等底线类指标评估覆盖全生产流量成为可能。
为了应对复杂性能与质量类问题,刘杨团队还深入探索了从Agent执行链路到推理引擎内部推理过程的跨层深度可观测方法。通过关联Agent Trace与模型推理过程,在Token粒度进一步定位性能问题,并探索模型内部不确定性信号在轨迹分析中的应用。
"我们发现,仅仅关注Agent层面的可观测性是不够的,还需要将视线延伸到底层推理引擎,"刘杨表示,"只有这样才能真正实现对Agent运行质量的全面掌控。"
这张图表清晰展示了AI Agent在未来几年内预计的每月Token消耗量增长趋势,其中企业级Agent的增长尤为显著,预计到2030年将达到每月约120 quadrillion(千万亿)个Token。这表明,随着Agent应用场景的不断扩展,其背后支撑的计算体系面临着前所未有的压力。
"Agent的普及正在推动整个AI产业链的变革,"IDC分析师表示,"从模型训练到基础设施建设,每一个环节都需要重新思考和优化。"
与此同时,全球最大的开源模型Kimi K3的发布也引发了业界对计算资源的广泛关注。该模型总参数量达到2.8T,激活参数量104B,其庞大的规模对算力系统提出了极高的要求。据SemiAnalysis分析,K3每执行一次前向计算,仅HBM带宽需求就高达约1.5TB,这对现有的AI计算架构提出了严峻挑战。
为了解决这些问题,2026年9月21日在北京中关村国际创新中心举行的AICC2026人工智能计算大会应运而生。本次大会设置了1个主会场、7个分会场,近60场专题报告,汇聚了芯片、存算、互连、系统、框架、Infra等领域的专家,共同探讨下一代AI计算体系的构建方向。
"Agent的持续在线运行对算力的需求呈指数级增长,"Gartner分析师指出,"一个Agent工作流每任务消耗的Token量可能是标准聊天机器人的5到30倍,单次用户请求通常会触发10到20次顺序模型调用。"
高盛预测,到2030年全球Token消耗量将较2026年增长24倍,达到每月约120000万亿Token。这意味着,支撑Agent运行的大模型正在变得越来越大,越来越难运行。例如,Kimi K3的权重文件约1.56TB,普通AI服务器的GPU显存根本无法容纳,需要扩展到64卡甚至更大规模才能运行。
"解决这些问题的关键在于构建一个能够支撑大规模Agent运行的计算体系,"刘杨强调,"这不仅需要硬件层面的突破,更需要软件层面的协同创新。"
通过这次分享,刘杨和他的团队为业界提供了一个可落地的Agent可观测性解决方案,也为未来AI Agent的大规模应用奠定了技术基础。随着Agent应用场景的不断扩展,这套体系有望成为保障AI系统稳定运行的重要支撑。
这张图片展示了刘杨在QCon上海2026大会上的演讲亮点,包括声明式Trace实时评估、两阶段评估机制以及跨层可观测关联Agent请求LLM与推理的方法,直观呈现了其技术方案的核心内容。