网通社科技快报
AutoCompact 提升编码智能体上下文管理 通过率增9.2%
针对编码智能体在处理复杂任务时因早期探索痕迹积累导致的上下文过载问题,新加坡管理大学、南洋理工大学与哈佛大学的研究团队联合开发了 AutoCompact 方法。该方法通过将上下文压缩能力训练为模型的主动技能,而非依赖被动触发机制,有效解决了传统方法中压缩时机不当或关键信息丢失的问题。
AutoCompact 的核心创新在于其两阶段训练流程:首先利用 judge 模型(如 GPT-5.5-Codex)对基座模型在真实任务中的表现进行实时纠正,优化压缩时机、内容选择及后续行为;其次通过任务成败奖励强化学习效果。实验结果表明,在 SWE-bench Verified 数据集上,AutoCompact 将通过率从 30.4% 提升至 39.6%,绝对提升 9.2%。尤其在推理预算受限的情况下,优势更加明显——16K 强制压缩设置下,固定阈值压缩方法通过率仅为 28.8%,甚至低于不压缩的基线(30.4%)。这证明合理的上下文压缩不仅能避免信息过载,还能提升任务完成质量。
AutoCompact 的实现机制围绕三个关键点展开:何时压缩(When)、保留什么(What)、如何继续(How)。当任务达到适合压缩节点时,模型会主动调用 compact() 动作,生成工作状态摘要,保留已确认结论、相关代码及工作区状态,并明确下一步动作。随后轻装上阵继续任务,确保压缩后行为与摘要一致。论文作者指出,尽管已有研究尝试提前决定压缩时机,但普遍存在压缩质量与后续行为脱节的问题,而 AutoCompact 通过在线纠错和任务奖励双重监督成功解决这一难题。
这项研究为编码智能体的上下文管理提供了新思路,也为未来智能体设计指明方向。随着人工智能技术发展,高效管理上下文信息将成为提升智能体性能的关键因素之一。
AutoCompact 的核心创新在于其两阶段训练流程:首先利用 judge 模型(如 GPT-5.5-Codex)对基座模型在真实任务中的表现进行实时纠正,优化压缩时机、内容选择及后续行为;其次通过任务成败奖励强化学习效果。实验结果表明,在 SWE-bench Verified 数据集上,AutoCompact 将通过率从 30.4% 提升至 39.6%,绝对提升 9.2%。尤其在推理预算受限的情况下,优势更加明显——16K 强制压缩设置下,固定阈值压缩方法通过率仅为 28.8%,甚至低于不压缩的基线(30.4%)。这证明合理的上下文压缩不仅能避免信息过载,还能提升任务完成质量。
AutoCompact 的实现机制围绕三个关键点展开:何时压缩(When)、保留什么(What)、如何继续(How)。当任务达到适合压缩节点时,模型会主动调用 compact() 动作,生成工作状态摘要,保留已确认结论、相关代码及工作区状态,并明确下一步动作。随后轻装上阵继续任务,确保压缩后行为与摘要一致。论文作者指出,尽管已有研究尝试提前决定压缩时机,但普遍存在压缩质量与后续行为脱节的问题,而 AutoCompact 通过在线纠错和任务奖励双重监督成功解决这一难题。
这项研究为编码智能体的上下文管理提供了新思路,也为未来智能体设计指明方向。随着人工智能技术发展,高效管理上下文信息将成为提升智能体性能的关键因素之一。