AutoCompact,编码智能体主动压缩上下文,SWE-bench通过率提升9.2%
新加坡管理大学、南洋理工与哈佛的研究团队提出 AutoCompact 方法,让编码智能体在任务进行中主动决定何时压缩上下文、保留什么内容以及如何继续。该方法通过在线纠错和任务奖励训练模型,使上下文管理...
在编程辅助工具领域,上下文管理一直是影响编码智能体性能的关键因素。当智能体处理复杂任务时,早期的探索痕迹(如失败尝试、被否决的假设)会不断积累,最终导致上下文过载,影响后续任务执行效率。传统的自动压缩机制通常是在上下文接近限制时才触发,这种被动方式往往会导致重要信息被误删或关键证据丢失。
为解决这一问题,新加坡管理大学、南洋理工大学与哈佛大学的研究团队提出了 AutoCompact 方法。该方法的核心思想是将上下文压缩能力作为编码智能体的一项主动技能进行训练,而非依赖于系统提示中的简单规则。研究团队设计了一个两阶段训练流程:首先利用 judge 模型(如 GPT-5.5-Codex)对基座模型在真实任务中的表现进行实时纠正,重点在于优化压缩的时机、内容选择以及压缩后的行为;其次通过任务成败的奖励机制强化模型的学习效果。
实验结果显示,AutoCompact 在 SWE-bench Verified 数据集上的通过率从 30.4% 提升至 39.6%,绝对提升 9.2%。值得注意的是,在推理预算受限的情况下,AutoCompact 的优势更加明显。例如,在 16K 强制压缩设置下,朴素的固定阈值压缩方法(Fixed Compaction)通过率仅为 28.8%,甚至低于完全不压缩的基线(30.4%)。这表明,合理的上下文压缩不仅能避免信息过载,还能有效提升任务完成质量。
AutoCompact 的实现机制主要包括三个关键点:何时压缩(When)、保留什么(What)、如何继续(How)。当任务达到适合压缩的节点时,模型会主动调用 compact() 动作,生成一份工作状态摘要,保留已确认的结论、相关代码与工作区状态,并明确下一步动作。随后,模型基于摘要轻装上阵,继续执行剩余任务。这种主动压缩策略不仅避免了压缩时机不当的问题,还确保了压缩后的行为与摘要内容保持一致。
论文作者进一步指出,尽管近年来已有研究尝试让模型提前决定何时压缩,但这些方法普遍存在压缩质量和后续行为脱节的问题。AutoCompact 通过在线纠错和任务奖励的双重监督,成功解决了这一难题。实验数据表明,即使在压缩预算有限的情况下,AutoCompact 也能显著提升任务通过率,证明了其在实际应用中的价值。
这项研究为编码智能体的上下文管理提供了新的思路,也为未来智能体的设计指明了方向。随着人工智能技术的不断发展,如何高效地管理上下文信息将成为提升智能体性能的关键因素之一。
