从接住告警到自我进化,快手智能运维助手实践解析
在2026年QCon上海大会上,快手AgenticOps研发负责人吴垚分享了公司智能运维助手的实践经验。该系统通过将运维事件作为一等公民,结合确定性上下文预取和结构化经验自进化机制,实现了运维模式从人...
在2026年10月22日至24日于上海举办的QCon全球软件开发大会中,快手AgenticOps研发负责人吴垚发表了题为《从接住告警到自我进化:快手智能运维助手实践》的主题演讲。这一实践案例展示了AI技术如何深度融入运维领域,推动传统运维模式向智能化、自动化方向转型。
吴垚指出,尽管运维数据(如指标、日志、Trace等)早已完备,但传统的运维流程仍存在诸多痛点。一个告警从触发到闭环需要经过十余个步骤,其中最耗时的并非决策环节,而是信息查询和上下文拼接等重复性工作。为此,快手构建了一套以运维事件为核心的Agent架构,将告警、巡检、变更、应急处理等关键环节纳入系统统一管理。
具体而言,当运维事件发生时,系统首先通过确定性pipeline完成上下文预取,随后由Agent进行归因推理与方案生成,并在过程中持续更新事件状态。这种设计不仅提高了事件处理效率,还为后续的自进化奠定了基础。吴垚强调,运维场景的核心挑战在于经验沉淀问题——经验往往只存在于个别人员手中,导致同类误判反复出现。因此,他们将改进助手本身也纳入闭环管理,从每次事件处理中提取运维经验,并在同类事件中复用这些经验,形成线上反馈驱动的迭代机制。
这套体系已在快手多条核心业务线的大盘巡检、告警初判、应急定位等场景落地应用。吴垚在演讲中详细阐述了运维事件驱动的Agent架构设计思路,以及如何让运维Agent实现持续进化。他特别提到,自进化的对象是结构化的运维经验而非模型权重,这些经验资产可以通过diff、审计和回滚机制进行追溯,确保系统的稳定性和可维护性。
此外,吴垚还分享了团队在实践中遇到的几个关键挑战:如何平衡上下文信息的丰富度与注意力集中度,防止信息过载或缺失;如何应对业务架构演进带来的知识劣化问题;以及如何建立有效的运维助手评测体系。这些问题的解决不仅提升了系统的实用性,也为其他企业在构建类似系统时提供了宝贵的经验。
本次演讲引发了与会者的广泛关注,许多技术从业者表示,快手的实践为AI在运维领域的应用提供了新的思路,特别是在Agent架构设计、经验沉淀与自进化机制方面具有重要的参考价值。