界面新闻记者 |
近日,字节跳动旗下Seed团队发布的最新研究论文,揭示了大语言模型在处理超长文本时出现性能波动的技术原因,直接点明了DeepSeek“抽风”的核心成因。
该研究评估了基础版和后训练版的DeepSeek-V4-Flash和DeepSeek-V4-Pro,以及训练后的DeepSeek-V4.1-Flash。研究发现,模型采用分块KV缓存压缩虽能减少内存成本,但引入了“相位敏感性”这一新变量,导致模型在长上下文推理中出现周期性的性能漂移。
所谓分块KV缓存压缩,是指模型以固定步幅将连续标记(Token)的窗口压缩为更少的缓存条目,从而减少长上下文推理时的内存和注意力成本。据IT之家报道,这种压缩方法引入了一个新的位置坐标:Token的相位,即其相对于压缩窗口边界的位置。
研究团队发现,使用这种压缩的模型中存在系统性不对称性:相同的信息在一个相位容易检索,但在另一个相位则较难检索。团队将这种周期性的检索性能变化称为相位敏感性(phase sensitivity)。在采用此类压缩的大型开放权重模型中,长上下文检索准确度在不同相位之间可能相差高达40个百分点,揭示了平均基准分数可能掩盖的周期性弱点。
这也解释了长期存在的一个矛盾现象:不少公开基准测试中拿到亮眼平均分数的大模型,在普通用户的日常使用场景里却经常表现“翻车”。平均得分实际上是模型在不同相位下表现高低互抵后的结果,大量用户实际遇到的,恰恰是检索准确度处于低位的相位区间,最终直接感受到“AI怎么突然就不好用了”。

这一技术发现,也为此前DeepSeek用户多次遭遇的“抽风”现象提供了解释。不少长期使用DeepSeek的用户会遇到此类场景:同样的提问,有时能得到逻辑完整、细节准确的长文本回复,有时却出现内容断裂、关键信息遗漏甚至答非所问的情况。
有用户反馈凌晨时段使用通常更为顺畅,高峰时段则容易出现卡顿;也有用户摸索出了实用经验,把提示语里的关键内容放在最前面,能大幅提升模型准确抓取信息的概率。
多数用户将这类不稳定表现归因于服务器压力过大、访问人数过多,而最新的技术研究显示,模型架构本身的设计选择,才是造成这类周期性性能波动的核心原因。
在此之前,DeepSeek还曾因另一起异常输出事件引发关注。
2026年5月,多位用户在社交媒体和技术论坛上反映,DeepSeek网页版存在异常输出问题。据称,在新建的空白对话框中,仅输入特定字符(如")后发送,模型既不报错,也不要求用户澄清,而是直接输出一段段看似完整、实则与对话上下文毫无关联的问答内容。这些内容题材广泛,涵盖数学解题、物理概念解释、线性代数、命理推演乃至教育学分析等多个领域。
同月19日,DeepSeek发布说明,指出该异常系特殊字符引发的模型幻觉所致,不涉及安全问题或用户隐私泄露,并承诺将通过针对性训练进行优化。
另外,值得注意的是,8月13日,DeepSeek V4 Pro正式版在静默发布后不到24小时被撤回,其官网发布通知及开放平台公告已被撤下,但官方API文档中该版本仍显示。
