Agent论文揭示模型与Harness联合优化新路径
一篇题为WHALE的Agent研究论文提出,模型权重与Harness必须交替优化才能提升Agent性能。该研究在SearchQA、数学推理等任务上验证了这一方法的有效性,但指出生产环境中实施联合优化将...
近日,一篇关于Agent的研究论文引发了业界广泛关注。该论文提出了一个颠覆性的观点:Agent的能力并非单纯由模型权重决定,而是模型权重与Harness(上下文组织、工具暴露、错误处理等)共同构成的结果。这一发现不仅揭示了Agent性能提升的新路径,也为AI系统的工程化落地提供了重要参考。
论文作者王零壹指出,传统的Agent开发模式往往将模型和Harness分开优化。当模型能力不足时,开发者倾向于微调模型;而当模型已经足够强大时,则会通过调整Prompt、更换工具或增加检索等方式来提升性能。然而,这种分治策略存在明显缺陷:模型权重的变化可能导致原有Harness不再适用,而Harness的调整也可能使模型无法充分发挥其潜力。
为解决这一问题,论文提出了Weight-Harness Alternating Learning(WHALE)算法。该算法的核心思想是让模型权重和Harness进行交替更新:先在当前Harness下优化模型权重,然后基于更新后的模型搜索更优的Harness,如此循环往复。实验结果表明,在SearchQA、数学推理和棋类任务上,WHALE方法相比传统训练方式,在Qwen3.5 2B和4B模型上取得了4.15到24.38个百分点的mean@8准确率提升。
值得注意的是,虽然WHALE算法在理论上证明了模型与Harness联合优化的有效性,但在实际生产环境中实施这一策略却面临诸多挑战。首先,持续的模型训练和Harness搜索会带来高昂的计算成本;其次,频繁的系统更新可能导致技术债务积累,形成难以维护的复杂系统;最后,不同组件之间的深度适配可能增加迁移和部署的难度。
针对这些问题,论文建议企业采用"Agent Release"的标准化发布流程。具体而言,在研发阶段完成模型与Harness的联合优化后,将整套组合冻结为一个包含模型检查点、Harness配置、工具契约、权限策略和沙箱环境的完整交付单元。这种做法既能保留联合优化带来的性能优势,又能确保系统的可复现性、可审计性和可回滚性。
"随着模型能力的不断提升,我们越来越需要关注系统的稳定性要求。"科技公司尹文辉博士表示,未来Agent基础设施的核心将是执行过程的标准化和持久运行时能力,而非单纯依赖模型本身。他强调,越强的模型越需要稳定的系统基础设施作为支撑,这样才能确保AI能力的安全释放。