Skip to content

智谱公开GLM-5降智根因:Scaling定律的隐形代价

2026年5月4日

📰 概要

智谱官方发布技术复盘,披露GLM-5在日均数亿次Coding Agent调用中出现的「降智」现象。

团队排查数周后发现,真凶是Prefill与Decode的PD分离架构在高负载下产生的异常,属于Scaling定律推进过程中的隐形代价。


🔍 解读

Scaling不是一路坦途。

智谱公开承认,模型规模扩大后,原本在线下测试中从未出现的异常,在线上高并发场景中频繁触发。

这是大模型公司第一次用官方复盘方式,把Scaling的代价摆上台面。


💎 深挖

三类异常现象

自GLM-5发布以来,智谱通过观察用户的大规模Coding Agent推理过程,发现了三类异常:乱码、复读和罕见字符生成。

这些问题在线下测试中无法复现,只在日均数亿次调用的高压下暴露。

线下为何无法复现

工程师本地回放用户反馈、重复运行相同请求数百次,始终无法触发异常。

换言之,模型本身并非根本原因。真正的问题在线下测试环境与线上生产环境的差异。

线上复现率仍低于实际

模拟在线环境后,调整PD分离比例并提高系统负载,异常现象终于复现——每10000个请求约3到5个异常。

但线下复现率仍低于用户线上反馈的频率,说明检测方法存在遗漏。

投机采样成关键指标

智谱团队发现,投机采样(Speculative Decoding)指标可作为异常检测的重要参考。

投机采样原本用于提升推理性能,但它的异常信号成了排查问题的关键线索。

Prefill的锅

智谱将问题归因于Prefill阶段。当Prefill与Decode的调度比例在高并发下失衡时,系统会产生异常输出。

为什么值得关注

Scaling Laws是当前AI发展的核心驱动力,但这次复盘显示,规模扩大后会产生全新的工程难题。

智谱的这次「踩坑」,对所有推进Scaling的大模型公司都是一次有价值的参考。

什么情况不建议用

如果你使用的是小规模测试环境,这个Bug可能不会触发,不必过度担心。但如果你的应用涉及高并发的Coding Agent调用,需要关注PD分离架构的配置。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来