DeepSeek-V4性能周期性波动,字节Seed揭示Token站位影响

字节跳动旗下Seed团队发现,DeepSeek-V4系列模型在长上下文处理中存在明显的性能周期性波动。研究显示,模型表现会随输入信息的Token位置变化而呈现规律性差异,这一现象与分块KV Cache...

人工智能

近日,字节跳动旗下的Seed团队对外披露了一项关于DeepSeek-V4系列模型的重要发现:该模型在处理长上下文任务时,其性能表现呈现出显著的周期性波动特征。这一发现不仅揭示了当前大模型在长文本处理中的潜在局限性,也为后续的技术优化指明了方向。

根据Seed团队的研究报告,这种性能波动主要体现在两个方面:一是模型对特定问题的回答准确性会随着输入信息在序列中的位置变化而发生周期性改变;二是模型在长上下文检索任务中的准确率会因目标信息相对于压缩窗口边界的位置不同而出现明显差异。

文章配图

具体而言,在一项针对代码补全的任务测试中,研究人员发现,即使问题本身、答案要求以及模型架构均保持不变,仅仅通过在输入序列前端添加不同数量的装饰性字符(这些字符对实际任务无任何影响),就能导致模型输出结果发生显著变化。实验数据显示,当装饰性字符长度模4余数为0或1时,模型倾向于给出错误答案;而当余数为2或3时,则更可能给出正确答案。

为了进一步验证这一现象的普遍性,Seed团队将研究范围扩展到更为复杂的长上下文检索任务。他们构建了一个包含1.6万个键值对的超长上下文环境,并测试了模型从中查找指定Key对应Value的能力。结果显示,在不同位置之间的最大准确率差距达到了惊人的40.2个百分点,这表明模型的表现严重依赖于输入信息的具体排列方式。

Seed团队指出,这种周期性波动现象的根源在于DeepSeek-V4采用的一项关键技术——分块KV Cache压缩。这项技术虽然有效提升了模型处理长文本的效率和内存利用率,但同时也引入了新的不确定性因素。当模型在处理长序列时,其注意力机制会受到压缩后数据分布的影响,从而导致对同一信息的不同位置表现出截然不同的理解能力。

这一发现对于大模型的实际应用具有重要指导意义。例如,在需要处理长文档的场景中,开发者可能需要特别注意输入信息的组织方式,以避免因Token位置不当而导致的性能下降。同时,这也为未来的大模型设计提供了新的思考方向:如何在保证效率的同时,消除这种由数据压缩带来的不一致性影响。

目前,Seed团队已经将相关研究成果整理成论文发表,希望业界同行能够共同探讨解决方案,推动大模型技术的进一步发展。