前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
AI 大模型/10.09 · 15:11/4 MIN/编译自 闻乐/1 阅读

字节Seed发现DeepSeek性能波动根因:分块KV Cache诱发周期性偏差

字节跳动Seed团队最新研究揭示,DeepSeek长上下文表现起伏受输入Token位置影响,甚至每隔数个Token呈周期性波动。根源在于分块KV Cache压缩机制导致的相位敏感性,准确率落差最高超40个百分点。

输入同样的问题,仅仅在前方多插入几个无关字符,大语言模型就可能从答对变为答错。字节跳动Seed团队在最新研究中捕获了这一现象:DeepSeek-V4的表现会随着信息输入位置,呈现出每隔4个Token的周期性波动。

在128K长上下文检索测试中,同一条信息仅因所处相对位置不同,DeepSeek-V4系列模型的检索准确率落差最高可达40.2个百分点。团队研究表明,该现象源自长上下文优化技术——分块KV Cache压缩。

相位敏感性测试

几个Token之差,答案反复横跳

研究团队最初在DeepSeek-V4-Flash-Base上进行代码补全测试。他们截取了官方推理代码中的一段FP8量化函数,要求模型补全最后一个Token(正确答案应为8)。模型有时却会错误预测为32。

为了排查原因,研究人员在代码前插入了一段包含重复等号的纯装饰性字符串,并逐步改变等号数量。在代码逻辑、待补全位置均未改变的情况下,答案展现出强烈的周期性规律:

周期性规律展示

当填充长度模4余数为0或1时,模型明显偏向错误答案32;余数为2或3时,则高度倾向正确答案8。在一组位置上,错误答案的平均概率高达71.3%;挪动一到两个Token后,正确答案概率则逆转飙升至91.5%。

随后,团队在标准的128K长上下文“大海捞针”测试中复现了此问题。在包含约1.6万个键值对的上下文中,仅调整目标信息相对于压缩窗口边界的位置,DeepSeek-V4-Flash-Base的检索准确率极差达到40.2个百分点,DeepSeek-V4-Pro-Base的差距也达34.8个百分点。

长上下文检索准确率波动

经后训练微调后,DeepSeek-V4.1-Flash的差距降至6.1个百分点,但起伏周期从4个Token缩短为2个Token。这一周期恰好精准对应两代架构所采用的KV Cache压缩步长。

根源指向分块KV Cache压缩机制

在长文本推理中,KV Cache占据大量显存。分块KV Cache压缩将连续Token划分为固定窗口,并将窗口内的键值信息压缩存储,以大幅减少长上下文注意力计算的开销。

然而,当每4个Token构成一个压缩步长时,信息位于窗口内的第1、2、3或4个位置(即所处“相位”,Phase),其被压缩时的环境截然不同。研究人员将这种性能随位置系统性变动的特征命名为相位敏感性(Phase Sensitivity)。

KV Cache压缩示意图

为排除特定架构或位置编码的影响,研究团队基于Qwen架构自建了一批模型进行消融实验,分别对比全注意力模型与各类分块压缩方案。

对比实验结果

实验显示:全注意力基线未出现显著周期性,而所有分块压缩模型均表现出与设定步长严格对应的性能震荡。步长设为6,周期即为6个Token;步长设为8,周期随之变为8个Token。即使移除RoPE位置编码或将可学习压缩改为简单均值池化,现象依然存在。

进一步的注意力头干预实验表明,网络内部演化出了“相位专门化”(Phase Specialization):不同的注意力头逐步对压缩窗口内的特定位置产生分工偏好。这种偏好在分工检索的同时,也使某些特定位置成为推理薄弱点。

相位专门化分析

研究团队指出,由于常规基准测试往往只汇报平均分,这种隐藏在微观Token站位中的性能洼地极易被掩盖。在评估采用分块KV Cache压缩的模型时,需要将测试样本遍历不同的相位位置,以真实衡量长上下文检索的鲁棒性。

标签:DeepSeek大语言模型推理优化

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

谷歌Playground的账本:做游戏的人付钱,玩游戏的人免费
置顶

谷歌Playground的账本:做游戏的人付钱,玩游戏的人免费

微软和Meta收紧Claude:被削掉的是入口,不是模型
置顶

微软和Meta收紧Claude:被削掉的是入口,不是模型

前途科技前途科技
服务关于快讯技术商业报告
微信咨询二维码

咨询微信

扫码添加微信咨询

前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
FBTriton 重构 TBE:推荐系统嵌入算子的 Triton 内核设计与性能优化
置顶

FBTriton 重构 TBE:推荐系统嵌入算子的 Triton 内核设计与性能优化

//

24小时热榜

特斯拉FSD欧洲更名为辅助驾驶,德国表态支持准入
TOP1

特斯拉FSD欧洲更名为辅助驾驶,德国表态支持准入

比亚迪第15万台新能源商用车下线,加速布局重卡市场
TOP2

比亚迪第15万台新能源商用车下线,加速布局重卡市场

3

Anthropic模型误报虚假凶杀案线索

8小时前
Anthropic模型误报虚假凶杀案线索
4

微软发布决策模型 Decision-1:专为智能体打造的超快控制层

8小时前
微软发布决策模型 Decision-1:专为智能体打造的超快控制层
5

中国一汽落地企业智能体:七大硅基员工上岗汽车制造全流程

10小时前
中国一汽落地企业智能体:七大硅基员工上岗汽车制造全流程
6

硅谷大模型掀价格战:Claude比DeepSeek更便宜

11小时前
硅谷大模型掀价格战:Claude比DeepSeek更便宜
7

获5亿美元融资估值翻倍,脱离Meta的Manus迎独立大考

11小时前
获5亿美元融资估值翻倍,脱离Meta的Manus迎独立大考
8

Meta、Manus与国内巨头激战个人Agent赛道

11小时前
Meta、Manus与国内巨头激战个人Agent赛道
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断