AI工程误解再探讨,Harness复杂度从能力层转向协作层
在当前AI编程领域,一场关于底层框架Harness未来走向的争论正在激烈上演。近期,前Kimi CLI负责人、Raft创始人stdrc(Richard Qian)针对业内流行的"模型派"观点提出了颠覆...
在当前AI编程领域,一场关于底层框架Harness未来走向的争论正在激烈上演。近期,前Kimi CLI负责人、Raft创始人stdrc(Richard Qian)针对业内流行的"模型派"观点提出了颠覆性见解:随着大模型能力的增强,Harness非但不会消失,反而会变得更加复杂,只是这种复杂性已从单纯的能力补足转向了更高层次的协作管理。
这一观点直接回应了当前AI圈内两极分化的趋势:一边是以Pi为代表的"极简Agent派",主张通过精简Prompt和工具实现模型自我驱动;另一边则是Agent Swarm等多智能体协作方案,强调系统复杂性的必要性。stdrc从一线开发经验出发,拆解了 Harness 的核心作用:它不仅是模型的训练场,更是支撑复杂业务场景的关键框架。
"说Harness会被训进模型里的人,肯定是没做过Harness的。"stdrc在社交媒体上明确表示。他指出,Harness的演变并非简单的"越强越薄",而是经历了从"能力补足"到"协作管理"的动态转化。例如,在弱模型时代,Harness主要承担工具调用、错误处理等基础功能;而在强模型时代,它需要解决多智能体之间的协同问题、跨会话状态同步以及动态权限管理等更复杂的任务。
这种复杂度的转移不仅体现在技术层面,也反映了AI应用从单任务处理向长流程、多角色协作的范式转变。stdrc强调,单纯依赖模型进行复杂业务处理存在固有缺陷,这本质上是一个系统工程问题,而非模型能力不足的问题。
值得注意的是,这一观点在AI行业引发了广泛讨论。2026年8月,OpenAI Codex负责人Tibo与Anthropic Claude Code负责人Boris Cherny之间的一场公开"互怼"事件,进一步凸显了Harness在实际应用中的重要性。尽管双方争议焦点在于模型迁移的具体实现,但实质上反映出不同 Harness 架构对模型表现的巨大影响。
"同一个模型,权重一个参数都不改,只是换一套Harness,表现就可能大幅波动。"EverMind在 HarnessBank 研究中给出的实证数据印证了这一点。在AppWorld测试集中,同一颗冻结权重的Qwen3.6-27B模型,仅通过Harness进化,测试集Pass@1从41.3%提升至56.7%,七个基准测试均取得显著改进。
然而,如何确保这些改进的真实性和可复用性,成为 Harness 自进化走向产品化必须解决的核心问题。EverMind提出的HarnessBank架构,通过双Agent设计实现了 Harness 的自动化迭代,为这一难题提供了新的解决方案。
"Harness的复杂性让模型能够学习它们。"stdrc在另一条推文中进一步阐释道, Harness 不是模型的替代品,而是其能力的延伸和组织者。随着模型智能的不断提升,Harness也在不断演进,从简单的工具调用发展到包含并行工具调用、子代理、代理群、代理团队、交接、主动压缩、通道、跨会话通信等功能的复杂系统。
这一动态演化的过程,正如阴阳相生相克的哲学规律,揭示了AI系统设计的本质:模型能力的提升不是终点,而是 Harness 复杂度升级的新起点。