陶炳哲详解LLM-as-Judge闭环,如何让AI系统持续自我校准
在AI Agent从实验走向生产的进程中,阶跃星辰产品负责人陶炳哲提出了一套基于LLM-as-Judge的自我校准评估闭环方案。该方案通过双层评估机制和每周迭代优化,解决了Agent系统上线后容易跑偏...
随着AI技术的快速发展,大型语言模型(LLM)已从简单的问答工具演变为能够自主规划、调用工具并执行任务的复杂系统。然而,在将这些AI系统投入生产环境时,许多团队发现,虽然模型本身表现优异,但实际运行中却常常出现"跑偏"现象:输出看似完整却未达预期、资源消耗过高却无实质进展、结果正确但操作越权等。这些问题的核心在于缺乏有效的评估与校准机制。
在2026年QCon上海全球软件开发大会期间,阶跃星辰开放平台产品负责人陶炳哲发表了题为《不下班的经营者:把LLM-as-Judge做成会自我校准的评估闭环》的主题演讲,深入剖析了这一问题并分享了解决方案。陶炳哲指出,AI Agent的成功不仅依赖于强大的模型能力,更关键的是构建一个能够持续自我评估和校准的闭环系统。
陶炳哲的解决方案主要包括两个核心部分:双层评估机制和每周迭代优化。首先,系统采用生产级Checker和盲评Meta-Evaluator双层评估体系。其中,生产Checker负责日常运行中的实时评估,而Meta-Evaluator则进行独立的盲评验证。当两者评估结果偏差超过8分时,系统会自动触发Rubric重校准,并将偏差原因作为下一轮升级的素材。这种机制确保了评估质量的可度量性和自动干预能力。
其次,系统通过每周一次的Planner-Generator-Evaluator三Agent单变量对抗迭代,实现系统的自我进化。在这个过程中,系统不仅能够自动升级,还支持快照回滚功能,有效防止因更新导致的意外问题。此外,系统还设置了HUMAN_GATE人工闸门,确保关键操作的安全性。
为了帮助其他团队构建类似的闭环系统,陶炳哲提出了设计Loop的八问方法论。这八个问题涵盖了目标定义、触发机制、上下文管理、工具分工、隔离安全、记忆状态、评估观测以及身份权限等多个方面。他特别强调,这八个问题的顺序不能随意调整,必须按照先定义成功标准、再设计执行流程、最后补充护栏的逻辑顺序进行思考。
在具体实现细节上,陶炳哲分享了几个关键点:Evaluator只返回PASS/REWORK/ESCALATE三种状态,并附带修改建议;模型分层处理,高频执行追求成本效益,关键验收环节注重可靠性;每个有副作用的动作都必须具备幂等性。
这项研究不仅解决了当前AI Agent系统上线后容易出现的问题,更为AI系统的长期稳定运行提供了可复用的设计框架。通过这套自我校准的评估闭环,团队可以确保AI系统从"能跑一次"真正进化到"连续跑对十次",从而实现AI从能力到系统的跨越,推动AI技术从实验阶段走向真正的生产应用。