字节Seed团队发现DeepSeek“抽风”原因,长上下文可能性能漂移

业界
2026
10/09
13:03
IT之家
分享
评论

10 月 9 日消息,字节 Seed 团队今年 9 月底在预印本平台 arXiv 提交了一篇论文,谈到分块 KV 缓存压缩带来的相位敏感性,直指 DeepSeek“抽风”原因。

该研究评估了基础版和后训练版的 DeepSeek-V4-Flash 和 DeepSeek-V4-Pro,以及后训练后的 DeepSeek-V4.1-Flash。

模型通过分块 KV 缓存压缩以固定步幅将连续标记的窗口压缩为更少的缓存条目,能够减少长上下文推理的内存和注意力成本。

然而,这种压缩还引入了一个新的位置坐标:Token 的相位,或其相对于压缩窗口边界的位置。

该团队发现使用这种压缩的模型中存在系统性不对称性:相同的信息在一个阶段很容易检索,但在另一个阶段很难检索。团队将这种检索性能的周期性变化称为相位敏感性(phase sensitivity)。

在采用此类压缩的大型开放权重模型中,长上下文检索准确度在各个阶段之间可能相差高达 40 个百分点,从而揭示了平均基准分数可能掩盖的周期性弱点。

【来源:IT之家】

THE END
广告、内容合作请点击这里 寻求合作
DeepSeek
免责声明:本文系转载,版权归原作者所有;旨在传递信息,不代表砍柴网的观点和立场。

相关热点

9月30日,DeepSeek宣布正式开源面向华为昇腾算力平台的基础设施组件,涵盖TileLang高级语言编译工具、计算库及分布式通信库。
业界
9月28日消息,9月10日发布DeepSeek V4.1 Flash之后,DeepSeek提到后续还有V4.1 Pro,但没有给出明确的日期,现在马上国庆节了,V4.1 Pro已曝出正在测试中。
业界
9月23日消息,据媒体报道,当地时间9月23日,联合国安理会将召开专题会议,聚焦人工智能发展与国际安全核心议题,集中研讨人工智能技术快速迭代背后的安全风险与全球治理方案。
业界
DeepSeek宣布,计划将V4 Pro服务推迟至9月14日12时下线。
业界
9月9日,据DeepSeek开放平台公告,DeepSeek将于北京时间9月10日12时起下调Flash系列模型调用价格。
业界

相关推荐

1
3