Appearance
📰 概要
OpenAI有个研究员,他的工作之一是修中文bug。
陈博远是GPT Image 2的主训工程师——也就是那个让AI图像生成支持中文字符的人。但他的故事比"修中文"更有意思:他主动站到台前,亲自发知乎、写博客、做示例图。
大多数研究员躲在论文后面,陈博远站出来做演示、写技术解读。这是OpenAI少有的"研究员直接面向你"的案例。
他的研究方向是"世界模型"——关心的不是"画得更像",而是"模型如何理解时间、空间和因果"。这是比图像生成更难的问题。
🔍 解读
陈博远的背景很有意思:MIT博士,曾在DeepMind工作,研究方向覆盖世界模型、具身智能、强化学习。
他的一项工作是Diffusion Forcing——一种让模型学会"预测未来多个时间步"的技术。
不是预测下一步,而是同时预测接下来N步的样子。这对机器人控制、自动驾驶、视频生成都有价值。
GPT Image 2只是他工作的一个出口。他真正关心的是:模型能否理解"现在发生了什么、接下来会发生什么"。
在这个框架下,"图像生成中文字符不准"不是技术bug,而是"模型缺乏对符号的系统性理解"这个更大问题的症状。修好中文,是他理解"符号与图像关系"的一个实验。
💎 深挖
他做了一件很少有人做的事:用图片做了整个博客。
GPT Image 2的技术博客,几乎每张配图都是AI生成的——不是截图,不是示意图,是用模型本身创作的可视化。这不是炫技,是在用模型的能力证明模型的能力。
这背后有一个隐含的判断:对于图像生成模型,"看图"比"看文字"更说明问题。一张生成图比一段描述更能让你相信模型能做什么。
「什么情况不建议用」:如果你只是想要一个"能画图的模型",GPT Image 2可能 overkill。它的价值在于"理解世界"而非"画一张图"。
但如果你在构建需要"理解时间、空间、因果"的AI系统——机器人、自动驾驶、视频生成——他的研究框架值得你关注。
