Appearance
Kimi K2.6全量开源:编程能力国内天花板,价格只有Claude的六分之一
刚刚,Kimi突然扔出一个重磅炸弹:K2.6正式发布并开源。网页端、App、API、Kimi Code,全量上线。Hugging Face同步上架模型权重。开源编程模型这个赛道上,K2.6直接杀到了第一名。
三大考试,全部第一
考试1:HLE(人类最后一场考试)
博士级别的综合难题,上百个学科随机抽题,还得用工具辅助。
| 模型 | 正确率 |
|---|---|
| K2.6 | 54.0% ✅ |
| Claude Opus 4.6 | 53.0% |
| GPT-5.4 | 52.1% |
考试2:SWE-Bench Pro(真实编程能力)
给模型一个真实的GitHub issue,让它自己写代码、修bug、提PR。
| 模型 | 得分 |
|---|---|
| K2.6 | 58.6% ✅ |
考试3:多语言编程
SWE-bench Multilingual覆盖Rust、Go、Python、JS四种语言。
| 模型 | 得分 |
|---|---|
| K2.6 | 76.7% ✅ |
额外测试:BrowseComp搜索能力
给模型一个复杂问题,让它自己上网查、交叉验证、给答案。
| 模型 | 得分 |
|---|---|
| K2.6 | 83.2% ✅ |
编程能力大升级,价格还便宜
能力提升
| 维度 | K2.6 |
|---|---|
| Code Bench | 比K2.5提升近20% |
| Claw-bench(Agent长期可靠性) | 提升10% |
| 图表理解 | 86.7% |
| 视觉数学 | 93.2% |
核心参数
| 能力 | 数值 |
|---|---|
| 工具调用串联 | 4000次 |
| 单次代码修改 | 4000行 |
| 连续运行 | 12小时以上 |
| Agent集群 | 300个子Agent并行 |
| 协作步骤 | 4000个 |
| 常驻后台Agent | 连续5天自主运行 |
价格对比
| 模型 | SWE-Bench Pro | API价格 |
|---|---|---|
| K2.6 | 58.6% | 1x |
| Claude Opus 4.6 | 更低 | 6x |
K2.6的API价格只有Claude Opus 4.6的六分之一。
海外口碑炸裂
发布不到24小时冲上热搜榜第一,1.6万条讨论。
Artificial Analysis综合指数榜:K2.6评分54,开源模型第一。综合了GDPval、Terminal-Bench Hard、SciCode、HLE、GPQA Diamond等多个评测。
实战案例
案例1:独立香水品牌官网
提示词:虚构一个冰岛小众香水品牌"Corvus Lab",有三款香水。首页要4K视频背景,渡鸦在雾中起飞。
结果:Kimi自己生成视频素材,Hero区冰岛雾景+渡鸦,衬线字体,副标题打字机效果,右下角雷克雅未克坐标,三款香水各配主视觉图。9个步骤一次性搞定。
案例2:复刻网页
上传一张网页截图让Kimi照着做。
结果:1:1复刻+加料:Three.js光影干涉层,鼠标移动时晶格轻微扭曲;液态玻璃胶囊带底部光晕。原图静态,它给加上动态效果。
案例3:连续改需求
| 指令 | 结果 |
|---|---|
| 视频背景换雪景 | ✅ |
| 主色改深海蓝 | ✅ |
| 加地图模块显示雷克雅未克坐标 | ✅ Mapbox接上 |
案例4:生成全栈应用
播客厂牌预约系统:首页开盘机录音带动画,前端React+Tailwind,后端Next.js,数据库三张表,接入Kimi账号一键登录,会员可预约录音棚。13个开发步骤,设计到部署一气呵成。
一个月前的故事
3月19日,Cursor高调发布Composer 2,号称"最强自研编程模型"。结果不到24小时被开发者扒出来底层用的是Kimi K2.5。
月之暗面官方也认了:"我们很骄傲看到Kimi K2.5成为基础。"当时Cursor估值293亿美元。
一个月过去,底座升级到了K2.6。Composer 3会不会提前来?
总结
K2.6已全量上线:网页端、App、API、Kimi Code都能直接用。
开源地址:Hugging Face搜 moonshotai/Kimi-K2.6
核心卖点:
- 三大考试全部第一
- 价格只有Claude的六分之一
- 连续跑12小时以上
- 300个子Agent并行
一句话:你晚上睡觉,它干活。你早上醒来,代码写好了。这不就是打工人梦寐以求的"替我加班"吗?
