Gemini3.6Flash发布,性能提升但网友调侃依旧

在人工智能领域持续发力的Google,于近期正式推出了Gemini系列的最新成员——3.6 Flash模型。这款被定位为"主力"的AI模型,在性能和成本控制上均有所突破,然而其发布却意外地伴随着网友的...

人工智能

在人工智能领域持续发力的Google,于近期正式推出了Gemini系列的最新成员——3.6 Flash模型。这款被定位为"主力"的AI模型,在性能和成本控制上均有所突破,然而其发布却意外地伴随着网友的调侃声。

图片

作为Gemini系列的最新迭代,3.6 Flash在多个关键指标上实现了显著提升。根据DeepSWE基准测试,其代码生成能力从37%提升至49%,同时减少了不必要的代码改动。在机器学习研究方向的MLE Bench测试中,准确率更是从49.7%跃升至63.9%。此外,该模型还新增了计算机操作(computer use)功能,成为Gemini API和企业版的内置工具,进一步提升了实用性。

价格方面,3.6 Flash也展现出明显优势。输入token费用降至1.5美元/百万,输出token费用则为7.5美元/百万,相比前代产品降低了约17%的成本。这一调整使得单个AI代理任务的成本大幅下降,为大规模应用提供了更经济的解决方案。

值得注意的是,与3.6 Flash形成鲜明对比的是3.5 Flash-Lite的表现。这款主打快速和低成本的模型,在多个基准测试中展现了令人惊讶的实力。例如在SWE-Bench Pro测试中,3.5 Flash-Lite以54.2%的准确率超越了3 Flash的49.6%;在OSWorld-Verified测试中,其表现也从65.1%提升至74.0%。这种"以小博大"的表现,不仅让3.5 Flash-Lite获得了Ashler、Palo Alto Networks等客户的认可,也让不少用户感叹:原来便宜的也能这么强。

图片

除了性能上的提升,3.6 Flash还在知识截止日期上进行了更新,从2025年1月延长至2026年3月,解决了长期困扰用户的"老黄历"问题。安全方面,新版模型采用了升级版的Frontier Safety防护系统,重点加强了对CBRN(化学、生物、放射性、核)和网络攻击的防范能力,同时优化了误判处理机制,确保在打击滥用行为的同时,尽量减少对正常需求的影响。

尽管Google在发布会上强调了这些改进,但网友的反应却显得颇为复杂。有人调侃道:"如果你从去年就开始用Gemini,那感觉就像看着自家兄弟慢慢得了阿尔茨海默症。"这种幽默的评论,既反映了用户对Gemini系列长期发展的关注,也暗示了他们对这次更新效果的保留态度。

总的来说,Gemini 3.6 Flash及其配套模型的发布,展示了Google在AI技术领域的持续创新。虽然部分用户对其实际表现仍持观望态度,但不可否认的是,这些新模型在性能、成本和安全性等方面都取得了显著进步,为AI应用的普及提供了更多可能性。