CodexGPT-6Astra开xhigh模式实测,推理多省Token,效率反提升
Codex GPT-6 Astra模型在xhigh模式下,尽管推理Token消耗增加约2.6倍,但总Token消耗反而下降8.6%,显示出更优的效率。通过4万多次实际调用数据回测,该模式在复杂任务中能...
在AI大模型应用实践中,Codex推出的GPT-6 Astra模型近期引发了关于其xhigh模式效率的讨论。经过老金对9月5日至14日共40,125次历史请求的详细分析,发现了一个与直觉相悖的现象:虽然xhigh模式的平均推理Token消耗是medium模式的2.6倍,但总Token消耗却减少了约8.6%。
具体数据显示,medium模式平均每次使用69.8个推理Token和141,247个总Token;而xhigh模式则为182.5个推理Token和129,146个总Token。这一结果表明,在某些场景下,模型前期投入更多思考时间,反而能在后续环节减少重复计算,整体效率得到提升。
这种现象背后的原因在于,xhigh模式能够更充分地理解问题背景和已有进展,从而避免了不必要的返工。例如,在多媒体处理任务中,模型可以一次性理清文件读取、代码修改和检查等步骤,而不是像低档位模式那样反复重新交代任务。
ARC Prize公布的Astra结果也印证了这一点。在ARC-AGI-3的Standard harness测试中,xhigh模式得分59.3%,比high模式高出4.5个百分点,但费用却降低了约8.3%。这说明更高的推理投入确实能让模型用更少的动作完成任务,减少了模型调用和总Token消耗。
不过,值得注意的是,这种效率提升并非适用于所有场景。对于简单任务,如单文件修改或文章编辑,low档位模式可能更为合适。但对于涉及跨文件、跨项目或多工具协作的复杂任务,xhigh模式的优势就显现出来了。
为了最大化利用xhigh模式的优势,用户可以在任务开始时明确完成标准,并将已完成部分和现有记录一并提供给模型。这样可以帮助模型更好地理解上下文,避免重复劳动,提高整体效率。
图1展示了Codex GPT-6 Astra在xhigh模式下的核心理念:"开xhigh反而省Token"。通过这张宣传图,我们可以直观地看到xhigh模式在效率上的独特优势。
图2则进一步解释了为什么思考更多反而总量未必更多。图表清晰地展示了不同档位模式在推理Token和总Token消耗上的对比,以及它们在完成任务时的不同表现。
总的来说,Codex GPT-6 Astra的xhigh模式提供了一种新的思路,即通过前期更多的思考投入,换取后期更高的效率和更低的总体成本。这对于需要处理复杂任务的用户来说,无疑是一个值得尝试的选择。
