DeepSeek推出多模态视觉模型V4-Flash-Vision-Exp,视觉能力补强Agent任务表现

就在刚刚,中国AI公司DeepSeek宣布推出其首款实验性质的多模态视觉理解模型:DeepSeek-V4-Flash-Vision-Exp。这款模型的上线标志着DeepSeek正式进入多模态AI领域,...

人工智能

就在刚刚,中国AI公司DeepSeek宣布推出其首款实验性质的多模态视觉理解模型:DeepSeek-V4-Flash-Vision-Exp。这款模型的上线标志着DeepSeek正式进入多模态AI领域,为开发者提供了全新的视觉理解能力。

图片

根据DeepSeek官方介绍,V4-Flash-Vision-Exp在文本处理能力(包括代理、推理和世界知识)方面与之前的V4-Flash版本保持一致,但在需要视觉理解的Agent基准测试中实现了显著提升。例如,在Terminal Bench 2.1测试中,V4-Flash-Vision-Exp获得了83.9分,接近Anthropic的Opus-4.8模型的85.0分。

"我们一直在关注多模态能力的重要性,"DeepSeek首席执行官梁文锋表示,"虽然这不是我们的主线发展方向,但作为Agent和推理能力的补充,视觉理解能力可以显著提升产品的实用性。"

为了支持这一新模型,DeepSeek还同步推出了Harness 0.1.1版本,该版本原生支持V4-Flash-Vision-Exp,开发者可以直接将其集成到现有的Agent工作流中。这意味着,从办公文档分析到界面问题诊断,再到内容创作辅助,Agent现在可以处理更多类型的视觉信息。

图片

在定价策略上,DeepSeek延续了其一贯的低门槛原则。每张图片最多折算为384个输入Token,即使在高峰期,一张图的费用也仅为约0.12元人民币。这种价格策略旨在降低开发者调用视觉模型的成本,鼓励更多开发者尝试和使用。

然而,用户实测结果表明,尽管官方跑分亮眼,但在实际应用中,V4-Flash-Vision-Exp的表现仍存在一些局限性。例如,在人物识别任务中,模型将DeepSeek创始人梁文锋误认为其他科技行业高管;在复杂任务如网页复刻和代码生成方面,虽然能搭建出整体框架,但细节处理和效率仍有待提高。

"我们选择以实验版的形式发布这款模型,主要是希望通过公开测试收集真实场景中的问题反馈,"DeepSeek技术负责人陈小康解释道,"这有助于我们在正式版本中进行针对性的优化。"

目前,DeepSeek V4-Flash-Vision-Exp已在API平台上开放调用,开发者可以通过设置model='deepseek-v4-flash-vision-exp'来访问该模型。随着更多开发者接入,预计未来几周内将积累大量实际使用数据,为后续版本的改进提供依据。

总的来说,DeepSeek V4-Flash-Vision-Exp的发布标志着公司在多模态AI领域的初步探索,虽然在某些基础视觉任务上还有提升空间,但其在Agent任务中的表现已经显示出巨大的潜力。随着技术的不断迭代和完善,这款模型有望成为推动AI Agent发展的重要工具。