ClaudeHaiku5.5降本增效,计算机操作猛进但编程短板仍存
Anthropic发布的Claude Haiku 5.5在成本降低75%的同时,计算机操作和知识工作能力显著提升,OSWorld评测成绩达72.4%,但复杂编程任务与Sonnet 5.5相比仍有明显差...
Anthropic公司近日发布了其最新小模型Claude Haiku 5.5,这款模型在保持极低成本优势的同时,在多个核心能力指标上实现了显著突破。根据官方数据,Haiku 5.5的平均运行成本较前代Haiku 4.5降低了约75%,而其在计算机操作、知识工作等领域的表现也大幅提升。
在计算机操作方面,Haiku 5.5在OSWorld 2.1离线子集上的完成率从上一代的15.7%跃升至72.4%,这一进步幅度远超其他同类模型。特别是在处理多步骤、状态依赖的任务时,Haiku 5.5展现出更强的连续操作能力和环境适应性。不过,实际业务场景中的动态页面、权限限制和异常状态仍需在具体环境中单独测试。
知识工作领域,Haiku 5.5的表现同样亮眼。在GDPval-AA v2.1评测中获得1620分,是上一代的两倍多;在AA-Briefcase v1.1评测中也从614分提高至1578分。这些评测涵盖了44类职业的实际工作任务,涉及材料分析、信息整合和工作成果生成等多个维度。
然而,在复杂编程任务方面,Haiku 5.5与更高端的Sonnet 5.5之间仍存在明显差距。在Terminal-Bench 4.0评测中,Haiku 5.5仅获得39.2%的准确率,而Sonnet 5.5达到70.6%。这表明Haiku 5.5更适合范围明确的子任务、摘要和上下文压缩等工作,而在需要持续规划和执行状态维护的复杂智能体编程任务上,仍然建议优先使用Sonnet 5.5或Opus 5.5。
价格方面,Haiku 5.5采取了分段定价策略:提示词在10万Token以内的请求(占Haiku 4.5请求量的90%),输入输出价格直接砍90%;超过10万Token的部分,只砍50%。这一策略使得在不超出100k提示词时的价格比DeepSeek-V4.1 Flash的谷时价格还要便宜。
尽管Haiku 5.5在多项评测中表现出色,但其更换的tokenizer导致同样任务会多耗费约30%的Token,特别是代码、表格和非英语内容的处理效率可能更低。因此,虽然API价格便宜了,但"完成任务的平均成本"并未达到理想区间。
总体而言,Claude Haiku 5.5的成功发布标志着小模型在性能和成本之间的平衡取得了重要进展,但在特定复杂任务领域仍需进一步优化。对于企业用户来说,选择合适的模型版本和配置仍然是关键考量因素。
