Skip to content

GPT-5.5发布:AI编程首破Terminal-Bench 82%,英伟达联合设计

2026年4月25日

📰 概要

2026年4月24日,OpenAI发布GPT-5.5,官方定位「面向实际工作和智能体的新型智能」。

Terminal-Bench 2.0得分82.7%,比GPT-5.4涨了7.6个百分点。

这次没有奥特曼个人背书,换了一群早期测试者代言。英伟达工程师说:「失去GPT-5.5,就像被截肢。」OpenAI与英伟达GB200/GB300系统全程联合设计。

知识工作领域同样拉开差距。GDPval基准84.9%,比Claude高4.6个百分点。FrontierMath Tier 4达39.6%,几乎是对手的两倍。


🔍 解读

「被截肢」这话夸张了,但话糙理不糙。GPT-5.5确实在AI编程上迈过一道坎——Terminal-Bench用真实终端任务,从70%出头跳到82%。

和英伟达的深度绑定是另一个信号。过去模型和硬件各自迭代,现在从设计阶段就绑在一起。但要注意,价格可能翻倍,公开API体验也可能打折扣。


💎 深挖

来看关键数据对比:

模型Terminal-Bench 2.0变化
Claude Opus 4.769.4%
GPT-5.475.1%+5.7pp
GPT-5.582.7%+7.6pp

从75%到82%,是「做成7.5个」变成「做成8个以上」的距离。

科研更惊人。FrontierMath Tier 4,GPT-5.5的39.6%几乎是对手两倍。有教授11分钟搭出代数几何可视化,免疫学教授一次处理62个样本。

关键突破在「Token经济」。完成相同任务,GPT-5.5消耗更少Token,用竞品一半成本达到SOTA水平。不是更贵更强,而是更聪明地省着用。

对写代码的人,这意味着什么?遇到复杂bug,扔给Codex,它自己调终端、跑命令、看报错、改代码,你只需检查结果。

但有两个风险:依赖AI调试的能力在提升,团队的代码审查能力可能没跟上。如果你主要写Java、Go或冷门语言,训练数据可能不够充分。

不妨试一次:挑个真实报错堆栈,看GPT-5.5能不能一次定位根因。能,可以认真考虑日常用了。什么情况不建议用:没有CI/CD、代码库文档缺失、或非主流语言栈。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来