Appearance
📰 概要
智谱官方发布技术复盘,披露GLM-5在日均数亿次Coding Agent调用中出现的「降智」现象。
团队排查数周后发现,真凶是Prefill与Decode的PD分离架构在高负载下产生的异常,属于Scaling定律推进过程中的隐形代价。
🔍 解读
Scaling不是一路坦途。
智谱公开承认,模型规模扩大后,原本在线下测试中从未出现的异常,在线上高并发场景中频繁触发。
这是大模型公司第一次用官方复盘方式,把Scaling的代价摆上台面。
💎 深挖
三类异常现象
自GLM-5发布以来,智谱通过观察用户的大规模Coding Agent推理过程,发现了三类异常:乱码、复读和罕见字符生成。
这些问题在线下测试中无法复现,只在日均数亿次调用的高压下暴露。
线下为何无法复现
工程师本地回放用户反馈、重复运行相同请求数百次,始终无法触发异常。
换言之,模型本身并非根本原因。真正的问题在线下测试环境与线上生产环境的差异。
线上复现率仍低于实际
模拟在线环境后,调整PD分离比例并提高系统负载,异常现象终于复现——每10000个请求约3到5个异常。
但线下复现率仍低于用户线上反馈的频率,说明检测方法存在遗漏。
投机采样成关键指标
智谱团队发现,投机采样(Speculative Decoding)指标可作为异常检测的重要参考。
投机采样原本用于提升推理性能,但它的异常信号成了排查问题的关键线索。
Prefill的锅
智谱将问题归因于Prefill阶段。当Prefill与Decode的调度比例在高并发下失衡时,系统会产生异常输出。
为什么值得关注
Scaling Laws是当前AI发展的核心驱动力,但这次复盘显示,规模扩大后会产生全新的工程难题。
智谱的这次「踩坑」,对所有推进Scaling的大模型公司都是一次有价值的参考。
什么情况不建议用
如果你使用的是小规模测试环境,这个Bug可能不会触发,不必过度担心。但如果你的应用涉及高并发的Coding Agent调用,需要关注PD分离架构的配置。
