网通社科技快报

DeepSeek梁文锋推8万亿参数模型 AI规模竞赛再升温

近日,国内AI领军企业DeepSeek创始人梁文锋在投资者会议上透露,公司将启动8万亿参数超大模型的研发计划,标志着AI领域新一轮规模竞赛的开启。这一规划直接对标字节跳动正在预训练的最高可达10万亿参数新模型以及美国闭源模型Anthropic的旗舰产品Mythos 5(约8万亿参数)。值得注意的是,DeepSeek此前以高效训练著称——其V3模型仅用278.8万H800 GPU小时便完成训练,成本仅为557.6万美元。然而,随着公司融资进展和上市筹备工作的推进,DeepSeek开始调整战略方向,将更多资源投入到模型规模扩展中。

DeepSeek的8万亿参数规划并非孤例。字节跳动、阿里云等国内头部AI实验室也在同步推进超大模型研发,其中字节跳动的新模型可能达到10万亿参数,阿里云下一代模型则瞄准5万亿至10万亿参数区间。这些动向表明,尽管过去两年行业更关注模型效率和小模型发展,但参数规模再次成为衡量AI能力的重要指标。

然而,单纯扩大模型规模并非没有挑战。随着模型参数迈向10万亿级,如何有效利用算力成为关键问题。华为副董事长汪涛在昇腾960超节点发布会上指出,当模型规模扩大到十万卡级别时,通信、同步和数据搬运的成本会显著增加,传统集群架构下的MFU(模型浮点算力利用率)往往难以超过30%。为此,华为推出了采用NPO光互联技术的昇腾960超节点,旨在解决大规模AI计算中的通信瓶颈问题。

DeepSeek的8万亿参数规划,正是在这样的背景下提出的。公司表示,通过优化训练流程和引入新的MoE(混合专家)架构,DeepSeek-V3已经实现了充分验证。未来,DeepSeek将继续探索如何在保持训练效率的同时,实现更大规模的模型扩展。

这场围绕超大模型参数的竞赛,不仅反映了AI技术的发展趋势,也揭示了产业生态的变化。在资本加持和上市预期的推动下,AI公司开始重新审视规模与效率的关系,试图在激烈的市场竞争中占据更有利的位置。