Appearance
📰 概要
DeepSeek V4论文里没有Engram——这是所有人都在期盼的架构组件。
2026年1月,DeepSeek联合北大发布Engram论文:一个给Transformer加的原生知识查表模块。"伦敦是英国首都"这种事实,不用动用整个深层网络去重新推一遍,直接查就行。
所有人都以为V4会内置Engram。V4发布后,大家第一时间command+F去论文里找——没有。
Engram的核心理念已经在V4里悄然铺开,但Engram本身不在论文里。这是V4最大的遗憾,也是开源生态补上的空白。
🔍 解读
Engram解决了一个根本问题:Transformer把两类任务混在一起做——需要深度动态计算的组合推理,和检索静态知识。
之前的问题是:识别一个实体(比如"戴安娜王妃"),模型要走6层注意力和前馈网络逐层拼凑特征。前几层还在纠结"Wales是英国的一个地区""Princess of Wales是某种头衔",最后一层才反应过来这是戴安娜王妃。
这种"用昂贵的运行时计算重建一个静态查找表"的活,本来可以让深层网络去干更高阶的推理。
Engram的思路是:既然N-gram模型就能用O(1)的时间复杂度捕获局部依赖,干脆把这能力直接嵌进Transformer。
就像做数学题:该用的公式不必每次从头推一遍,翻表代进去就行。Transformer之前没这张表,只能每道题都从公理走起。Engram等于把这张表交到模型手里。
💎 深挖
具体做法是在Transformer的第2层和第15层之间各插入一个Engram模块。每个模块包含两个表:键表(KB)和值表(VB)。
值表(VB)存储知识,键表(KB)决定何时激活。模型识别到相关线索时,直接在表中查到答案,不再走深层网络。
效果数据:知识类任务,MMLU/CMMLU提升3.4/4.0个百分点;长上下文NIAH从84.2%升至97.0%;稀疏参数节省20-25%。
Engram的本质是给Transformer加了一个原生知识层。它让模型把"该算的算、该查的查"分开处理。从这个角度,V4里虽然没有直接用Engram,但它的MoE架构(稀疏激活)和Engram的思路是一致的——都是让模型更高效地分配计算资源。
DeepSeek V4最大的遗憾不是技术失败,而是它没有成为那个完整的答案。但开源生态不会停在这里。
「什么情况不建议用」:如果你在做需要实时更新知识的应用,Engram的不可变特性意味着每次知识更新都需要重新训练模块。在知识更新频繁的场景(如新闻分析、实时数据处理),这可能成为一个限制因素。
Engram适合知识相对稳定的领域(医疗、法律、学术),而不适合知识快速迭代的场景。
