Appearance
📰 概要
2026年5月1日,《科学》期刊刊登哈佛医学院和贝斯以色列女执事医疗中心的重要研究:
OpenAI 的一款推理模型在真实临床病例中接受测试,在诊断患者和制定治疗方案方面达到人类医生水平,很多情况下甚至表现更好。
研究最大的亮点在于测试环境——不是标准化的基准考试,而是真实急诊科场景:信息不完整、数据不规整、情况不断变化。
模型在相同限制条件下,表现超过了两名经验丰富的医生。
🔍 解读
一个关键病例
一名患者因肺栓塞进入急诊科。治疗后一度好转,随后病情再次恶化。医生最初怀疑药物没有发挥作用。
AI 模型基于同样的电子健康记录,提示患者可能有狼疮病史——这是一种自身免疫性疾病,可能导致心脏炎症。后续结果证明,AI 给出的方向是正确的。
这个病例的潜台词是:AI 不是在"背诵"标准答案,而是在真正推理。
模型的核心优势
哈佛医学院助理教授拉杰·曼赖说了一句话很有分量:"模型表现超过了我们规模很大的医生基准组。"
研究团队在急诊分诊、住院阶段等多个环节都进行了测试,每一步模型只能使用当时已经掌握的信息——这模拟了真实临床中的时间压力和信息缺失。
鉴别诊断特别强
研究特别提到,模型在鉴别诊断中表现更突出——同时考虑多种可能疾病,再逐步排除和收窄范围。这是传统 AI 的弱点,却是推理模型的强项。
💎 深挖
重要限制:只有文本
研究指出,模型完全依赖文本病历,没有处理影像、声音和非语言线索。这些信息在真实临床中非常关键。
模型能读懂病历,但看不到 CT 片、听不到咳嗽声。
不代表 AI 要取代医生
研究作者强调:并没有证明 AI 应该取代医生。研究的核心结论是——AI 有机会成为临床决策支持工具,尤其适用于急诊这类节奏快、时间紧、信息不完整的场景。
外部专家怎么看
外部专家认为,这项进展确实重要,但真正落地仍有很多问题。把系统放进真实临床环境接受测试,是"非常有挑战性的过程"。
研究人员需要设计严谨试验,不只看模型答得准不准,还要看它是否真正改善患者结局。
什么情况不建议用
如果你是 AI 医疗投资人,需要保持清醒:目前模型只能处理文本,在影像诊断、实时监测、多模态问诊等场景完全无法使用。
大规模商用还需要更严格的真实世界验证。
什么时候值得跟进
关注 OpenAI 或其他大厂是否会将医疗诊断能力集成到 API 产品线。如果推理模型在医学诊断方向持续迭代,医疗 AI 赛道的格局可能再次被改写。
