Skip to content

OpenAI那个修中文的人,自己也在追问更慢的问题

2026年5月5日

📰 概要

OpenAI有个研究员,他的工作之一是修中文bug。

陈博远是GPT Image 2的主训工程师——也就是那个让AI图像生成支持中文字符的人。但他的故事比"修中文"更有意思:他主动站到台前,亲自发知乎、写博客、做示例图。

大多数研究员躲在论文后面,陈博远站出来做演示、写技术解读。这是OpenAI少有的"研究员直接面向你"的案例。

他的研究方向是"世界模型"——关心的不是"画得更像",而是"模型如何理解时间、空间和因果"。这是比图像生成更难的问题。


🔍 解读

陈博远的背景很有意思:MIT博士,曾在DeepMind工作,研究方向覆盖世界模型、具身智能、强化学习。

他的一项工作是Diffusion Forcing——一种让模型学会"预测未来多个时间步"的技术。

不是预测下一步,而是同时预测接下来N步的样子。这对机器人控制、自动驾驶、视频生成都有价值。

GPT Image 2只是他工作的一个出口。他真正关心的是:模型能否理解"现在发生了什么、接下来会发生什么"。

在这个框架下,"图像生成中文字符不准"不是技术bug,而是"模型缺乏对符号的系统性理解"这个更大问题的症状。修好中文,是他理解"符号与图像关系"的一个实验。


💎 深挖

他做了一件很少有人做的事:用图片做了整个博客。

GPT Image 2的技术博客,几乎每张配图都是AI生成的——不是截图,不是示意图,是用模型本身创作的可视化。这不是炫技,是在用模型的能力证明模型的能力。

这背后有一个隐含的判断:对于图像生成模型,"看图"比"看文字"更说明问题。一张生成图比一段描述更能让你相信模型能做什么。

「什么情况不建议用」:如果你只是想要一个"能画图的模型",GPT Image 2可能 overkill。它的价值在于"理解世界"而非"画一张图"。

但如果你在构建需要"理解时间、空间、因果"的AI系统——机器人、自动驾驶、视频生成——他的研究框架值得你关注。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来