10月9日消息,你在用DeepSeek处理长文档时,是否遇到过这样的怪事?同一个问题,模型有时能精准揪出答案,有时却仿佛换了个大脑,死活检索不到关键内容。
这种不稳定的 “抽风” 表现,让很多用户感到困惑。不少人会以为是网络故障,或是自己的提示词写得不够到位。而字节跳动Seed团队近期发布在arXiv上的一篇论文,给出了解释。
字节Seed团队今年9月底,在预印本平台arXiv提交论文,指出DeepSeek这类现象的根源,来自分块KV缓存压缩带来的相位敏感性。
研究团队测试了基础版与后训练版DeepSeek-V4-Flash、DeepSeek-V4-Pro,以及经过后训练的DeepSeek-V4.1-Flash。
据悉,这类模型依靠分块KV缓存压缩技术,以固定步幅把连续token窗口压缩成更少的缓存条目,以此降低长上下文推理的内存占用与注意力计算开销。
但这套压缩机制,额外引入了全新位置参数:Token相位,也就是token相对于压缩窗口边界所处的位置。
团队研究发现,搭载该压缩方案的模型存在系统性不对称特性:同样一段信息,当它处于某一相位时模型很容易检索到;
换到另一相位,则很难读取。研究人员把这种检索性能周期性波动的特性命名为“相位敏感性”。
在使用同类压缩方案的开源大模型中,长上下文检索准确率在不同相位之间最高能相差40个百分点。这说明,我们常看的基准平均分,会掩盖模型这种周期性短板。
那么,这一发现意义在哪?日常大家参考AI评测成绩,看的都是平均分。平均分就好比一名学生总均分80分,但某些章节能考满分,有些章节只能拿到20分。
放到大模型场景,意味着AI能否找到文档里的答案,不完全取决于问题本身,还取决于目标信息在文本里所处的位置。一些不起眼的细节,就可能让关键信息落入模型的 “相位盲区”。