Appearance
📰 概要
一个连电视机都不知道的 AI,现在要来抢程序员饭碗了。
AI研究员 Alec Radford 等人发布了 talkie-1930-13b,只有1930年及之前知识。1931年1月1日之后的任何字不准进。不知互联网,不知二战。
经过250个训练样本微调后,它做出了第一个编程成果——给 xarray 库打了一个补丁。
🔍 解读
这事最反直觉的地方不是它能写代码,而是它用了多少数据。
talkie-1930-13b 用大约75K条 trajectory 训练后,在 SWE-bench-Verified 上达到 4.5% pass@1。
用互联网数据训练的 talkie-web 是 5.5%。
两种模型的知识储备相差将近一百年,但编程能力只差1%。这说明什么?编程能力的瓶颈,可能从来不在于模型「知道」多少,而在于它「理解」多少。
💎 深挖
在这个 demo 里,最有意思的观察不是结果,而是过程。
第12轮对话,老头尝试 apply patch,失败了。但它没有放弃,继续尝试。第44轮,给修好了。
研究者写道:「一个1930年的模型,也会试错,会反思,会自我修正。这个过程展示出的推理能力,跟我们在现代模型上看到的如出一辙。」
推理能力是涌现的,不是堆数据堆出来的。
「什么情况不建议用」:如果你需要的是精确的、需要最新库知识的编程任务,这个模型的能力上限还很低。它的强项是推理过程本身,不是知识储备。
当数据效率成为新瓶颈,降低数据依赖、提升推理能力的路线会越来越重要。一个连电视机都没见过的 AI 能学会编程,意味着你的下一个 AI 编程助手,可能不需要那么多训练数据。
