DeepSeek卷超大模型,梁文锋8万亿参数规划引行业新竞速
DeepSeek宣布将训练8万亿参数模型,标志着AI大模型竞赛进入新阶段。作为国内领先的AI公司,DeepSeek在完成两轮融资后加速推进算力与模型研发,其后续规划不仅反映了当前技术趋势,也揭示了AI...
近日,DeepSeek创始人梁文锋在投资者会议上透露,公司下一步计划将模型参数推至8万亿级别,这一消息迅速引发业界关注。事实上,DeepSeek并非首个提出超大模型参数目标的公司,但其明确的8万亿规划,使得这场围绕模型规模的竞争重新回到聚光灯下。
2024年底,DeepSeek发布V3模型时曾以6710亿总参数、3728亿激活参数的数据刷新行业认知。而此次8万亿的后续规划,相当于V3的近5倍规模。值得注意的是,DeepSeek此前一直以高效训练著称——其V3模型仅用278.8万H800 GPU小时便完成训练,成本仅为557.6万美元。然而,随着公司融资进展和上市筹备工作的推进,DeepSeek开始调整战略方向,将更多资源投入到模型规模扩展中。
"以前我们是在有限条件下追求极致效率,现在条件变了,我们可以大胆尝试更大规模的模型。"一位DeepSeek内部人士表示。今年以来,DeepSeek先后完成两轮融资,累计融资额接近150亿元人民币,对应估值约5000亿元。与此同时,公司已聘请中信证券筹备科创板IPO,并于9月21日迎来原高瓴创投合伙人严文韬出任CFO。
与DeepSeek同步,其他头部AI实验室也在推进超大模型研发。字节跳动正在预训练一个最高可能达到10万亿参数的新模型;阿里云公开表示下一代模型将向5万亿到10万亿参数迈进;美国闭源模型Anthropic的旗舰产品Mythos 5也被业内估计达到约8万亿参数规模。这些动向表明,尽管过去两年行业更关注模型效率和小模型发展,但参数规模再次成为衡量AI能力的重要指标。
"参数量从未失去吸引力,它就像游戏中的战力值,虽然不能代表全部,但永远是最直观的参照系。"一位AI行业分析师指出。当前,前沿模型的总参数规模正在明显抬升,从Kimi K3的2.8万亿参数,到字节跳动可能推出的10万亿参数模型,参数规模的竞赛正重新成为焦点。
然而,单纯扩大模型规模并非没有挑战。随着模型参数迈向10万亿级,如何有效利用算力成为关键问题。华为副董事长汪涛在昇腾960超节点发布会上指出,当模型规模扩大到十万卡级别时,通信、同步和数据搬运的成本会显著增加,传统集群架构下的MFU(模型浮点算力利用率)往往难以超过30%。
"组织算力比堆砌算力更重要。"汪涛强调。为此,华为推出了采用NPO光互联技术的昇腾960超节点,旨在解决大规模AI计算中的通信瓶颈问题。该系统首次在超节点中采用Hi-ONE光引擎,将电信号转为光信号的位置进一步靠近计算单元,从而提升整体算力利用率。
DeepSeek的8万亿参数规划,正是在这样的背景下提出的。公司表示,通过优化训练流程和引入新的MoE(混合专家)架构,DeepSeek-V3已经实现了充分验证。未来,DeepSeek将继续探索如何在保持训练效率的同时,实现更大规模的模型扩展。
"我们相信,规模和效率并不矛盾,关键在于找到平衡点。"DeepSeek相关负责人表示。目前,DeepSeek已完成对DeepSeek-V3的预训练,并通过监督式微调强化其性能。随着后续训练过程的推进,DeepSeek有望在保持模型稳定性的前提下,实现更高参数规模的突破。
这场围绕超大模型参数的竞赛,不仅反映了AI技术的发展趋势,也揭示了产业生态的变化。在资本加持和上市预期的推动下,AI公司开始重新审视规模与效率的关系,试图在激烈的市场竞争中占据更有利的位置。