正文内容 评论(0)

DeepSeek为何会时常“抽风”?字节seed团队挖出了隐藏原因
2026-10-09 13:06:06  出处:快科技 作者:秋白 编辑:秋白     评论(0)点击可以复制本篇文章的标题和链接复制对文章内容进行纠错纠错

快科技10月9日消息,你在用DeepSeek处理长文档时,是否遇到过这样的怪事?同一个问题,模型有时能精准揪出答案,有时却仿佛换了个大脑,死活检索不到关键内容。

这种不稳定的 “抽风” 表现,让很多用户感到困惑。不少人会以为是网络故障,或是自己的提示词写得不够到位。而字节跳动Seed团队近期发布在arXiv上的一篇论文,给出了解释。

DeepSeek为何会时常“抽风”?字节seed团队挖出了隐藏原因

字节Seed团队今年9月底,在预印本平台arXiv提交论文,指出DeepSeek这类现象的根源,来自分块KV缓存压缩带来的相位敏感性。

研究团队测试了基础版与后训练版DeepSeek-V4-Flash、DeepSeek-V4-Pro,以及经过后训练的DeepSeek-V4.1-Flash。

据悉,这类模型依靠分块KV缓存压缩技术,以固定步幅把连续token窗口压缩成更少的缓存条目,以此降低长上下文推理的内存占用与注意力计算开销。

但这套压缩机制,额外引入了全新位置参数:Token相位,也就是token相对于压缩窗口边界所处的位置。

DeepSeek为何会时常“抽风”?字节seed团队挖出了隐藏原因

团队研究发现,搭载该压缩方案的模型存在系统性不对称特性:同样一段信息,当它处于某一相位时模型很容易检索到;

换到另一相位,则很难读取。研究人员把这种检索性能周期性波动的特性命名为“相位敏感性”。

在使用同类压缩方案的开源大模型中,长上下文检索准确率在不同相位之间最高能相差40个百分点。这说明,我们常看的基准平均分,会掩盖模型这种周期性短板。

那么,这一发现意义在哪?日常大家参考AI评测成绩,看的都是平均分。平均分就好比一名学生总均分80分,但某些章节能考满分,有些章节只能拿到20分。

放到大模型场景,意味着AI能否找到文档里的答案,不完全取决于问题本身,还取决于目标信息在文本里所处的位置。一些不起眼的细节,就可能让关键信息落入模型的 “相位盲区”。

DeepSeek为何会时常“抽风”?字节seed团队挖出了隐藏原因

【本文结束】如需转载请务必注明出处:快科技

责任编辑:秋白

文章内容举报

  • 支持打赏
  • 支持0人

  • 反对

  • 打赏

文章价值打分

当前文章打分0 分,共有0人打分
  • 分享好友:
  • |
本文收录在
#DeepSeek#Token#Flash

  • 热门文章
  • 换一波

  • 好物推荐
  • 换一波

  • 关注我们

  • 微博

    微博:快科技官方

    快科技官方微博
  • 今日头条

    今日头条:快科技

    带来硬件软件、手机数码最快资讯!
  • 抖音

    抖音:kkjcn

    科技快讯、手机开箱、产品体验、应用推荐...