Skip to content

刘壮万字访谈:架构没那么重要,数据才是AI进步的真正推手

2026年5月1日

📰 概要

2026年4月30日,引用量超10万的普林斯顿助理教授刘壮,在《信息瓶颈》播客中聊了一个多小时。

几个核心判断值得每个做AI的人看一眼。

第一,架构选什么,没你想的重要。 只要把残差连接、自注意力、归一化层、线性层这四样做对,不管用ConvNet还是Transformer,最终都会落在同一条性能曲线上。

第二,数据集远没有我们以为的多样。 他和何恺明做了一个实验:训练模型判断图片来自哪个数据集。三个号称「多样化」的亿级数据集上,准确率超过80%。

第三,记忆才是当前最大瓶颈。 我们需要那么多智能体协作,恰恰是因为一个智能体记不住所有事情。


🔍 解读

刘壮在学术圈的位置很特殊。 他的每篇论文几乎都在质疑某个「理所当然」的假设。

从ConvNeXt质疑「ConvNet过时了」,到无归一化Transformer质疑「归一化层必须要有」。 这次他把矛头指向了整个AI社区的关注重心:我们是不是太执着于架构了?

他认为,过去十年真正推动AI进步的,是数据规模和算力,而不是架构创新。 GPT-1到GPT-3的故事就是最典型的例子——基本上是同一个模型,用更多数据、更多算力训练,就获得了更强的能力。

这个判断有数据支撑。 在ConvNeXt论文里,没有任何单一改动能大幅拉升性能。真正起作用的是把所有改动叠加在一起。 刘壮说:「这些小细节组合在一起,比那些看起来很核心的网络组件影响更大。」


💎 深挖

关于数据多样性,刘壮和何恺明的实验很说明问题。 他们训练了一个神经网络来判断一张图片来自哪个数据集。 在三个大型数据集上,模型的准确率超过80%,而随机猜测只有33%。 说明这些数据集在模型眼里仍然泾渭分明,距离「无偏的全球分布」还差得远。

对大语言模型是否有世界模型,刘壮给出了一个精妙的回答:有,但只在语言空间里。 LLM在高层次事件推理上表现出色,比如他让ChatGPT假设中国历史上的一个「如果当初」场景,模型的推理比小说家还合理。 但在视觉空间,由于视觉数据的信息密度太高,现有算力还处理不了。 好消息是——对于超过一半的工作场景,尤其是数字化的白领工作,根本不需要视觉世界模型。

关于记忆,刘壮在2026年4月的最新访谈中给出了尖锐观点。 Claude Code支持100万token上下文窗口,这很好。 但即使有无限上下文,如果它记错了事实,记忆力仍然不好。 「我们需要很多智能体,恰恰是因为一个智能体记不住所有事情。」

他亲自测试过让Claude Code独立做研究项目,从构思到实验到写论文。 结论:低层次任务还行,但提出好问题、设计实验、保持方向感——这些还做不到。 所以自主科研替代研究生,还远着呢。

什么情况不建议用? 如果你在做非常细分的场景优化,比如特定硬件的模型部署、低延迟场景,架构选择仍然重要。刘壮自己承认:「我不会说架构不重要,只是说数据更重要。」 另外他在学术圈做研究,资源和视角与产业界不同。工业界在架构上的投入,比如MoE、注意力机制改进,确实带来了实用价值。

对开发者的启发:如果你在选模型或者做模型优化,先把数据质量搞定,再去折腾架构。 刘壮的最后一句话可以当金句记着:「想让模型擅长什么,就在那件事上训练它。」

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来