Appearance
📰 概要
2026年4月18日,Anthropic 发布 Claude Opus 4.7,SWE-bench Verified 得分达到 80.2%——这是编程 AI 首次突破 80% 这个被行业视为"可信"的门槛。给 AI 一个真实的 GitHub issue,它能修好的概率从上一代的 72.1% 跳到 80.2%,涨了 8 个百分点,是从"10 个 bug 修对 7 个"变成"修对 8 个"的距离。同时上下文窗口从 128K 扩展到 200K(约 3 万行变成 5 万行代码),输出价格从 $75 涨至 $90/1M tokens(涨幅 20%),Agent SDK 1.0 正式版同步发布。
🔍 解读
80% 这个门槛,行业里一直有个默契的说法:过了这个线,AI 编程才算是"可信"。因为 SWE-bench 用的是真实的 GitHub issue,不是造出来的测试用例。80% 意味着 5 个真实 bug,AI 能修好 4 个——这个水平,已经接近一个熟悉项目的中级开发者了。
但这个分数有两个前提你得知道。第一,SWE-bench 只测 Python + Django 项目,你写 Java、Go、Rust 的,参考价值有限。第二,80.2% 是 Anthropic 自己测的,还没人验证。GPT-5 之前说自己 76.8%,第三方复现只有 73% 左右。所以这个数字等别人验完更稳。
💎 深挖
从时间线上看,Anthropic 这一年的编程能力走得有点快:
| 版本 | 时间 | SWE-bench | 变化 |
|---|---|---|---|
| Opus 4.0 | 2025.06 | 58.3% | — |
| Opus 4.5 | 2025.12 | 65.3% | +7.0% |
| Opus 4.6 | 2026.02 | 72.1% | +6.8% |
| Opus 4.7 | 2026.04 | 80.2% | +8.1% |
从 72% 到 80% 这一步,跳幅比之前任何一次都大。横向对比更有意思:能力上 Opus 4.7 现在是最强,但价格也最贵——输出 $90 是 GPT-5($60)的 1.5 倍,是 DeepSeek($1.1)的 82 倍。速度上 GPT-5 以 68 tok/s 领先,Opus 的 52 tok/s 在实时结对编程场景还是不够流畅。编程 AI 的三强态势短期不会变:Claude 占编程、GPT 占通用、Gemini 占多模态。
对每天写代码的人来说,这件事可能是近期影响最直接的一个。你明天上班打开 IDE,看到报错堆栈,可能就会想:这个 bug 让 AI 先看看?试几次发现它真的能一次定位根因,你开始习惯遇事不决问 Claude。但有个风险:AI 编程的可信度在上升,团队的代码审查能力可能没跟上——AI 帮你写了 100 行代码,你审查要花多久?如果审查比自己写还累,效率提升就被抵消了。更危险的是,AI 生成的代码看起来总是"像那么回事",隐藏的 bug 可能要到生产环境才暴露。
今天下班前,找一个你项目里的真实 bug + 报错堆栈,扔给 Claude 试试。看它能不能一次定位根因。能?可以认真考虑日常用了。不能?至少知道它现在的边界在哪。但如果你的团队没有代码审查习惯,或者项目主要是 Java/Go,暂时不建议追。
