网通社科技快报

Claude Haiku 5.5降本75%编程短板仍存

Anthropic公司近日推出最新小模型Claude Haiku 5.5,在保持极低成本优势的同时,多项核心能力实现显著突破。该模型平均运行成本较前代降低约75%,在计算机操作领域表现尤为突出,OSWorld 2.1评测中完成率从15.7%跃升至72.4%,远超同类模型。知识工作方面,Haiku 5.5在GDPval-AA v2.1和AA-Briefcase v1.1评测中分别获得1620分和1578分,是上一代的两倍多。

然而,在复杂编程任务上,Haiku 5.5与高端模型Sonnet 5.5仍有明显差距。Terminal-Bench 4.0评测显示,Haiku 5.5准确率为39.2%,而Sonnet 5.5达70.6%。这表明其更适合范围明确的任务,如摘要生成和上下文压缩,而非需要持续规划的复杂智能体编程。

价格策略方面,Haiku 5.5采用分段定价:10万Token以内请求砍价90%,超过部分砍价50%。这一策略使不超10万Token时的价格比DeepSeek-V4.1 Flash更低,但更换tokenizer导致代码、表格等处理效率下降约30%,实际任务成本优化有限。

总体而言,Claude Haiku 5.5在性能与成本平衡上取得重要进展,但在特定复杂任务领域仍需进一步优化,企业用户需根据具体需求选择合适版本。