Skip to content

哈佛研究:OpenAI推理模型在急诊诊断超越人类医生,但仍有重要限制

2026年5月3日

📰 概要

2026年5月1日,《科学》期刊刊登哈佛医学院和贝斯以色列女执事医疗中心的重要研究:

OpenAI 的一款推理模型在真实临床病例中接受测试,在诊断患者和制定治疗方案方面达到人类医生水平,很多情况下甚至表现更好。

研究最大的亮点在于测试环境——不是标准化的基准考试,而是真实急诊科场景:信息不完整、数据不规整、情况不断变化。

模型在相同限制条件下,表现超过了两名经验丰富的医生。

🔍 解读

一个关键病例

一名患者因肺栓塞进入急诊科。治疗后一度好转,随后病情再次恶化。医生最初怀疑药物没有发挥作用。

AI 模型基于同样的电子健康记录,提示患者可能有狼疮病史——这是一种自身免疫性疾病,可能导致心脏炎症。后续结果证明,AI 给出的方向是正确的。

这个病例的潜台词是:AI 不是在"背诵"标准答案,而是在真正推理。

模型的核心优势

哈佛医学院助理教授拉杰·曼赖说了一句话很有分量:"模型表现超过了我们规模很大的医生基准组。"

研究团队在急诊分诊、住院阶段等多个环节都进行了测试,每一步模型只能使用当时已经掌握的信息——这模拟了真实临床中的时间压力和信息缺失。

鉴别诊断特别强

研究特别提到,模型在鉴别诊断中表现更突出——同时考虑多种可能疾病,再逐步排除和收窄范围。这是传统 AI 的弱点,却是推理模型的强项。

💎 深挖

重要限制:只有文本

研究指出,模型完全依赖文本病历,没有处理影像、声音和非语言线索。这些信息在真实临床中非常关键。

模型能读懂病历,但看不到 CT 片、听不到咳嗽声。

不代表 AI 要取代医生

研究作者强调:并没有证明 AI 应该取代医生。研究的核心结论是——AI 有机会成为临床决策支持工具,尤其适用于急诊这类节奏快、时间紧、信息不完整的场景。

外部专家怎么看

外部专家认为,这项进展确实重要,但真正落地仍有很多问题。把系统放进真实临床环境接受测试,是"非常有挑战性的过程"。

研究人员需要设计严谨试验,不只看模型答得准不准,还要看它是否真正改善患者结局。

什么情况不建议用

如果你是 AI 医疗投资人,需要保持清醒:目前模型只能处理文本,在影像诊断、实时监测、多模态问诊等场景完全无法使用。

大规模商用还需要更严格的真实世界验证。

什么时候值得跟进

关注 OpenAI 或其他大厂是否会将医疗诊断能力集成到 API 产品线。如果推理模型在医学诊断方向持续迭代,医疗 AI 赛道的格局可能再次被改写。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来