Appearance
📰 概要
AI研究员Nick Levine、多伦多大学副教授David Duvenaud,以及真·GPT系列之父Alec Radford,联合发布了一款只有1930年知识的AI模型。
它被微调成软件工程师后,仅用250个训练样本就解决了第一个编程问题。
🔍 解读
跨越近百年的「过去之灵」开始学编程了。
这个AI的训练数据有条铁律:1931年1月1日之后的任何一个字,全部不准进。它连电视机都没见过,却开始跟Claude们「抢饭碗」。
💎 深挖
操盘手阵容
这款「老头AI」名为talkie-1930-13b,由三位核心人物打造:
AI研究员Nick Levine负责微调,多伦多大学副教授David Duvenaud负责架构设计,真·GPT系列之父Alec Radford负责核心设计。
训练数据铁律
项目最有趣的设计在于,训练数据有条铁律:1931年1月1日之后的任何一个字,全部不准进。
这意味着模型不知道汽车、飞机、电视、互联网为何物,知识停留在近一个世纪之前。
250样本解决问题
就是这么个老古董,当扔给它一道Python编程题时,这个跨越近百年的「过去之灵」,竟然写出了人生第一行Python代码。
Transformer的局限
论文指出,语言建模包含两种性质完全不同的任务:需要深度动态计算的组合推理,以及检索静态知识。
问题在于,Transformer把这两件事混在一起做。模型识别一个实体时,得消耗好几层注意力和前馈网络逐层拼凑特征。
为什么值得关注
这个实验揭示了当前AI架构的一个核心问题:大量计算资源浪费在重复推理已知事实。
Engram等记忆增强模块的出现,正是为了解决这个问题。
什么情况不建议用
如果你的应用需要处理包含现代知识的任务,这个模型的训练数据限制使其不适用。
