Appearance
📰 概要
2026年4月24日,OpenAI发布GPT-5.5,官方定位「面向实际工作和智能体的新型智能」。
Terminal-Bench 2.0得分82.7%,比GPT-5.4涨了7.6个百分点。
这次没有奥特曼个人背书,换了一群早期测试者代言。英伟达工程师说:「失去GPT-5.5,就像被截肢。」OpenAI与英伟达GB200/GB300系统全程联合设计。
知识工作领域同样拉开差距。GDPval基准84.9%,比Claude高4.6个百分点。FrontierMath Tier 4达39.6%,几乎是对手的两倍。
🔍 解读
「被截肢」这话夸张了,但话糙理不糙。GPT-5.5确实在AI编程上迈过一道坎——Terminal-Bench用真实终端任务,从70%出头跳到82%。
和英伟达的深度绑定是另一个信号。过去模型和硬件各自迭代,现在从设计阶段就绑在一起。但要注意,价格可能翻倍,公开API体验也可能打折扣。
💎 深挖
来看关键数据对比:
| 模型 | Terminal-Bench 2.0 | 变化 |
|---|---|---|
| Claude Opus 4.7 | 69.4% | — |
| GPT-5.4 | 75.1% | +5.7pp |
| GPT-5.5 | 82.7% | +7.6pp |
从75%到82%,是「做成7.5个」变成「做成8个以上」的距离。
科研更惊人。FrontierMath Tier 4,GPT-5.5的39.6%几乎是对手两倍。有教授11分钟搭出代数几何可视化,免疫学教授一次处理62个样本。
关键突破在「Token经济」。完成相同任务,GPT-5.5消耗更少Token,用竞品一半成本达到SOTA水平。不是更贵更强,而是更聪明地省着用。
对写代码的人,这意味着什么?遇到复杂bug,扔给Codex,它自己调终端、跑命令、看报错、改代码,你只需检查结果。
但有两个风险:依赖AI调试的能力在提升,团队的代码审查能力可能没跟上。如果你主要写Java、Go或冷门语言,训练数据可能不够充分。
不妨试一次:挑个真实报错堆栈,看GPT-5.5能不能一次定位根因。能,可以认真考虑日常用了。什么情况不建议用:没有CI/CD、代码库文档缺失、或非主流语言栈。
