Appearance
📰 概要
2026年4月24日,阶跃星辰发布StepAudio 2.5 ASR。核心突破:首次将大模型MTP(多Token预测)推理加速引入语音识别领域。
实测数据:推理速度提升400%,延迟降低60%,峰值500 tokens/s,成本直降80%。5分钟音频几乎即时转写。
转写精度在中英文10个权威测试集上综合错误率低于竞品。支持端到端30分钟连续音频,无需切片拼接。
定价0.15元/小时,约为上一代Step ASR 2的十分之一。
🔍 解读
语音识别的瓶颈从来不只是准确率,更是速度和成本。传统ASR用自回归逐Token输出,慢且贵。把大模型的MTP加速搬过来,思路简单但执行难。
StepAudio做到了一次预测多个候选Token再并行验证,直接打破了逐个输出的效率瓶颈。400%提速不是微调优化,是架构级变化。
30分钟端到端不分段,这解决了长音频的痛点。之前切片再拼接会导致上下文割裂,后半段可能「忘了」前面说什么。32K上下文窗口复用大模型能力,简单粗暴有效。
💎 深挖
来看关键指标对比:
| 指标 | 传统ASR | StepAudio 2.5 |
|---|---|---|
| 推理方式 | 自回归逐Token | MTP多Token预测 |
| 推理速度 | 基准 | 4倍 |
| 延迟 | 基准 | -60% |
| 峰值速度 | ~125 tok/s | 500 tok/s |
| 长音频处理 | 切片拼接 | 30分钟端到端 |
| 价格 | 1.5元/小时 | 0.15元/小时 |
0.15元/小时意味着1块钱能转录6个多小时音频。
这个价格对会议转写、媒体处理、客服质检等场景是颠覆性的。之前用ASR的瓶颈不是技术,是账单——长音频处理费用能占到项目成本的大头。
MTP技术从大语言模型迁移到语音识别,这件事的信号意义大于单个产品。如果这个思路被验证,其他模态(图像、视频)也可能复制类似路径。
对开发者来说,0.15元/小时的定价已经低于很多自建Whisper的GPU成本。除非你有大量免费算力,否则自建的ROI可能不如直接调API。
什么情况不建议用:对实时性要求极高的场景(同声传译级延迟),500 tokens/s虽快但仍有处理延迟。
需要方言识别的场景,官方未提及方言支持,建议先测试。对隐私敏感音频,如果政策不允许走云API,需等本地部署方案。
