Appearance
📰 概要
DeepSeek V4发布后,网友们第一时间在技术报告里搜索Engram——结果并没有。
Engram是DeepSeek与北大在2026年1月联合开源的记忆增强模块,被视为V4的架构地基。它的缺席,成为V4最大的遗憾。
🔍 解读
技术路线上的取舍。
Engram的核心价值在于,给Transformer加了一个原生知识查表模块,能查的别算,直接查表就行。这个设计可以显著降低模型计算成本。
V4没有集成它,意味着团队在架构上做出了其他选择。
💎 深挖
Engram是什么
Engram是DeepSeek与北大在2026年1月联合开源的项目,全称为《Conditional Memory via Scalable Lookup》。
论文的核心观察是,语言建模包含两种性质不同的任务:需要深度动态计算的组合推理,以及检索静态知识。
为什么大家都在盼
Engram的创新在于,它给Transformer增加了一个原生知识查表模块。
「伦敦是英国首都」这种事实,模型不用动用整个深层网络去重新推一遍,直接查表就行。
论文举例。
「Diana, Princess of Wales」这个实体,模型要走6层注意力才能识别完。
V4论文里找不到
自1月初论文发表以来,所有人都觉得Engram是V4的架构地基。
但V4发布后,大家command+F去论文里找Engram,结果并没有。
Engram并没有消失
虽然没有集成到V4,但Engram的理念、探索和后续应用已经悄然铺开。
后续三篇值得注意的论文接力出现,为下一代模型打下基础。
为什么值得关注
Engram的设计代表了一种提升模型效率的新方向——用查表替代重复计算,让深层网络专注复杂推理。
这次缺席说明,V4在架构上选择了其他路径,但Engram的探索仍在继续。
什么情况不建议用
如果你关注的是模型的实际性能而不是技术路线,Engram的缺席对你的使用体验没有直接影响。
