Claude与GPT模型分级体系对比,从跑分到成本的深度解析

OpenAI和Anthropic近期推出的多款大模型在性能与价格上形成鲜明对比。第三方评测显示,Claude Fable 5在SWE-bench Pro测试中表现优于Sonnet 5,但价格差距达5倍...

人工智能

随着OpenAI和Anthropic相继推出新一代大模型,市场对这些产品的性能与价值比产生了浓厚兴趣。根据第三方评测机构FACTA的最新报告,Claude Fable 5与Sonnet 5在多个关键指标上存在显著差异,尤其是在复杂代码修复任务中的表现。

在SWE-bench Pro测试中,Fable 5以80.3%的通过率领先于Sonnet 5的63.2%,这意味着在处理多文件bug修复时,Fable 5的成功率明显更高。然而,这种性能提升也带来了成本上的显著差异:Fable 5的输入/输出定价为每百万token 10美元/10美元,而Sonnet 5仅为2美元/10美元。值得注意的是,FACTA指出实际使用成本可能远超标价,因为Fable 5的深度思考模式无法关闭,导致处理非琐碎任务时会产生更多昂贵的输出token。

相比之下,OpenAI的GPT-6 Sol系列则采取了不同的策略。GPT-6 Sol相比上一代产品价格几乎腰斩,Luna版本更是进一步降低了成本。OpenAI将这一变化归功于缓存和推理效率的提升,使得节省的成本能够直接反映在API价格上。例如,GPT-6 Astra的部分训练方法被继承并优化,从而在保持性能的同时降低了推理端的成本。

在模型分级体系方面,Claude系列呈现出明显的层次结构。第一层是Claude Mythos类,强调同一大脑但护栏设置不同;第二层关注算力与推理深度差异,如Fable 5比Sonnet 5在SWE-bench Pro测试中高出17个百分点;第三层则涉及持续思考模式的实际账单影响。基于这些差异,FACTA建议用户根据任务类型选择合适的模型:日常分类、摘要和代码重构等任务可优先考虑Sonnet 5,而前沿级高风险代码任务则更适合Fable 5。

小米的MiMo-V2.6和SpaceXAI的Grok 4.7则展示了另一种技术路径。MiMo-V2.6没有降低API价格,而是通过扩大Agentic强化学习规模,在V2.5基础上实现了性能提升。具体而言,不到6天的直播强化学习训练中,Flash和Pro累计产生约75万条trajectory,使模型能够在更短路径、更少Token下完成任务。SpaceXAI的Grok 4.7则采用了更大的基础模型,并进行了更长时间的强化学习,同时提升了自我验证、长上下文处理和Agent能力,最终在维持原有价格的情况下进一步提高了Coding和Agent任务的表现。

文章配图

尽管各厂商的技术路线不同,但共同的目标是提高模型效率和降低成本。从训练后的强化学习到推理优化、提示词缓存,再到减少无效Token和工具调用,模型厂商正在整个链条上寻找效率提升的空间。这种趋势不仅体现在价格战上,更反映了大模型从单纯追求参数规模向精细化优化的转变。

文章配图

对于开发者而言,选择合适的模型需要综合考虑性能需求和成本预算。例如,一位每天运行多个并行编程会话的开发者表示,切换到主要使用Luna后,每日token开销从20-50美元降至2-3美元,这表明便宜模型在大多数场景下已经能够满足需求。然而,在代码审查、调研和长期规划等高价值任务上,仍然需要依赖更强大的模型。

总的来说,当前大模型市场的竞争焦点已从单纯的性能比拼转向性价比的全面考量。厂商们通过技术创新和效率提升,正在让智能变得更「便宜」,同时也推动着Agent应用从聊天窗口走向编程、研究和办公等更广泛的领域。