DeepSeek轻量模型本地部署成焦点,普通显卡也能跑,对标阿里Qwen
DeepSeek正在开发一款可本地部署的轻量级大模型,目标是让普通游戏显卡(如RTX 4060/5060)也能运行。该模型已进入测试阶段,能处理日常任务,性能接近阿里Qwen3.8 27B。在Open...
9月24日,DeepSeek宣布正在开发一款轻量级大模型,该模型能够在普通游戏显卡上运行,标志着其在本地化部署方向的重大进展。这一消息源于DeepSeek内部投资人会议中梁文锋的透露,目前该模型已进入测试阶段,能够处理绝大多数日常任务,显示出相当可观的能力。
与当前市场上的同类产品相比,DeepSeek的目标是实现更广泛的硬件兼容性。虽然RTX 5090等高端显卡性能强劲,但价格高昂且并非所有用户都能负担。相比之下,DeepSeek希望这款轻量级模型能在RTX 4060或5060级别的显卡上稳定运行,确保至少30T/s的计算速度以满足基本需求。这种设计思路不仅降低了用户的硬件门槛,也为更多普通消费者提供了使用先进AI技术的机会。
在开源大模型领域,阿里云的Qwen系列一直是标杆之作。其中,Qwen3.8 27B版本凭借强大的社区支持和持续优化,已经成为可以本地部署的热门选择。尽管如此,DeepSeek的新模型依然备受关注,因为它不仅具备相似的功能,还可能在成本控制方面更具优势。
值得注意的是,DeepSeek的定价策略一直以其亲民著称。例如,其V4.1 Flash模型在闲时缓存命中情况下,每百万Token输入仅需0.02元,远低于竞争对手。即便是在缓存未命中时,输入和输出费用也分别仅为1元和4元,而高峰时段则升至2元和8元。这种灵活的价格机制使得DeepSeek在面对OpenAI GPT-6降价冲击时依然保持竞争力。
近期,OpenAI发布了GPT-6系列新模型,包括Sol和Luna两个版本。其中,Luna的API价格降至每百万Token输入0.1美元、输出0.5美元,约合人民币0.7元和3.5元。这一降价幅度显著,使得Luna在高频、规模化工作场景中更具吸引力。然而,DeepSeek凭借其长期积累的缓存效率优势,依然能够在某些特定场景下提供更具性价比的选择。
从技术角度看,DeepSeek的新轻量级模型预计将在多个维度上与现有解决方案展开竞争。首先,在硬件适配方面,它将覆盖更广泛的显卡型号,从而吸引更多普通用户。其次,在功能支持上,该模型预计将涵盖JSON输出、工具调用、响应API等多种实用特性,满足不同应用场景的需求。最后,在价格体系方面,DeepSeek有望延续其一贯的低定价策略,为用户提供更具性价比的选择。
总体而言,DeepSeek正在通过开发轻量级本地模型,进一步巩固其在AI领域的竞争优势。随着市场竞争的加剧,如何在保证性能的同时降低成本,将成为决定未来成败的关键因素。对于普通用户而言,这意味着他们将有机会以更低的成本体验先进的AI技术,从而推动整个行业的普及和发展。
图表显示了DeepSeek两款主要模型(deepseek-flash和deepseek-v4-pro)在BASE URL、模型版本、思考模式、上下文长度、输出长度及功能支持等方面的详细对比。可以看出,deepseek-v4-pro在深度搜索能力、非思考与思考模式切换、以及更长的上下文支持方面具有明显优势,适合需要更高精度和复杂任务处理的场景;而deepseek-flash则在缓存命中情况下的成本控制上表现优异,特别适合高频次、低成本的应用需求。
该图表展示了AutomatonBench测试中,不同AI模型在成本与性能之间的权衡关系。可以看出,GPT-6 Sol在专业工作和Agent任务上表现出色,特别是在低推理强度下,其成本效益比显著优于Claude Opus 5和Fable 5.1。这表明,尽管DeepSeek在缓存命中情况下的成本优势明显,但在某些特定任务上,GPT-6 Sol依然具有不可忽视的竞争优势。
