Skip to content

DeepSeek V4最大的遗憾:那个被所有人期盼的架构组件,论文里没有

2026年5月5日

📰 概要

DeepSeek V4论文里没有Engram——这是所有人都在期盼的架构组件。

2026年1月,DeepSeek联合北大发布Engram论文:一个给Transformer加的原生知识查表模块。"伦敦是英国首都"这种事实,不用动用整个深层网络去重新推一遍,直接查就行。

所有人都以为V4会内置Engram。V4发布后,大家第一时间command+F去论文里找——没有。

Engram的核心理念已经在V4里悄然铺开,但Engram本身不在论文里。这是V4最大的遗憾,也是开源生态补上的空白。


🔍 解读

Engram解决了一个根本问题:Transformer把两类任务混在一起做——需要深度动态计算的组合推理,和检索静态知识。

之前的问题是:识别一个实体(比如"戴安娜王妃"),模型要走6层注意力和前馈网络逐层拼凑特征。前几层还在纠结"Wales是英国的一个地区""Princess of Wales是某种头衔",最后一层才反应过来这是戴安娜王妃。

这种"用昂贵的运行时计算重建一个静态查找表"的活,本来可以让深层网络去干更高阶的推理。

Engram的思路是:既然N-gram模型就能用O(1)的时间复杂度捕获局部依赖,干脆把这能力直接嵌进Transformer。

就像做数学题:该用的公式不必每次从头推一遍,翻表代进去就行。Transformer之前没这张表,只能每道题都从公理走起。Engram等于把这张表交到模型手里。


💎 深挖

具体做法是在Transformer的第2层和第15层之间各插入一个Engram模块。每个模块包含两个表:键表(KB)和值表(VB)。

值表(VB)存储知识,键表(KB)决定何时激活。模型识别到相关线索时,直接在表中查到答案,不再走深层网络。

效果数据:知识类任务,MMLU/CMMLU提升3.4/4.0个百分点;长上下文NIAH从84.2%升至97.0%;稀疏参数节省20-25%。

Engram的本质是给Transformer加了一个原生知识层。它让模型把"该算的算、该查的查"分开处理。从这个角度,V4里虽然没有直接用Engram,但它的MoE架构(稀疏激活)和Engram的思路是一致的——都是让模型更高效地分配计算资源。

DeepSeek V4最大的遗憾不是技术失败,而是它没有成为那个完整的答案。但开源生态不会停在这里。


「什么情况不建议用」:如果你在做需要实时更新知识的应用,Engram的不可变特性意味着每次知识更新都需要重新训练模块。在知识更新频繁的场景(如新闻分析、实时数据处理),这可能成为一个限制因素。

Engram适合知识相对稳定的领域(医疗、法律、学术),而不适合知识快速迭代的场景。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来