字节Seed揭开DeepSeek长文本波动的根源,问题出在分块压缩

来源:互联网 时间:2026-10-10

A5站长网10月10日消息,不少DeepSeek用户遇到过同一种怪事:同一道题、同一段材料,把关键信息挪个位置,回答的质量就明显不同。字节跳动Seed团队近日在预印本平台arXiv提交了一篇论文,给这个现象补上了一个技术解释。论文标题是《Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression》,指向的是一种叫相位敏感性的效应。

要理解这个问题,先得回到大模型读长文本的方式。模型把读过的内容临时记在KV缓存里,文本越长,缓存越大,占用的内存和注意力计算也越多。为了省成本,一种常见做法是分块压缩:以固定步幅把连续的Token窗口打包成更少的缓存条目。省是省了,但它额外引入了一个新的位置坐标,也就是每个Token相对于压缩窗口边界的位置,论文把它叫作相位。

研究团队拿DeepSeek-V4-Flash的官方推理代码做了个实验,截出一段FP8量化函数让模型补全最后一个Token。正确答案是8,模型有时会答成32。为了找原因,他们在代码前面加了一段只有重复等号的装饰性文本,再调整等号数量。代码没改、要补的位置没改、答案也没改,唯一变的是前缀长度,模型的倾向却开始来回翻转,周期恰好是4个Token,与它采用的压缩步长吻合。

放大到长上下文检索,现象更明显。在12.8万Token规模的检索测试里,同一条信息换个位置放,DeepSeek-V4-Flash在不同位置上的准确率最大差距达到40.2个百分点,V4-Pro也达到34.8个百分点。经过后训练优化的V4.1-Flash把差距收窄到6.1个百分点,周期性差异却没有完全消除。也就是说,用户平时看到的平均准确率,是把高相位和低相位的结果平均之后的样子。

为了排除是某一家模型实现的问题,团队以Qwen3-0.6B为底座从头训练了多组对照模型。结果是,所有采用分块压缩的方案都出现了与压缩步长对应的周期性波动,而全注意力基线模型没有这个现象。这说明它不是某段代码写错了,而是分块KV缓存压缩这种设计本身可能引入的结构性弱点。

论文给的建议很具体:评估采用分块KV缓存压缩的模型时,应该把同一条信息放在不同相位上分别测,而不是只看整体平均准确率。一个好看的平均分,可能正好盖住了模型在某些位置上的系统性失效。对普通用户来说,能直接用的经验是,把关键信息放得靠前一点,命中盲区的概率会小一些。

相关文章

A5创业网 版权所有

返回顶部