Appearance
📰 概要
2026年4月19日,月之暗面联合清华大学郑纬民院士团队发布 PrFaaS(Prefill-as-a-Service)架构。核心突破:KV Cache 可以跨数据中心传输,Prefill 和 Decode 完全解耦到不同异构集群。
实测数据(1T 参数混合注意力模型):相比同构 PD 部署,吞吐量提升 54%,P90 延迟降低 64%;跨数据中心带宽仅 13Gbps,远低于 100Gbps 以太网上限。
底层逻辑:线性注意力 + 全注意力混合架构把 KV 吞吐量从 RDMA 级别降到以太网级别,跨数据中心推理从不可能变成可能。这是推理架构的成本天花板刷新。
🔍 解读
PrFaaS 解决的是一个长期痛点:Prefill 和 Decode 必须绑定在单一集群内——因为 KV Cache 传输依赖 RDMA 高带宽。算力芯片(H200)和带宽芯片(H20)如果不在一个机房,干脆用不了。
这套架构把"必须绑定"变成"可以解耦":线性层只产出固定大小的循环状态,不随上下文膨胀;全注意力层才生成和长度相关的 KV Cache。32K 上下文下,KV 吞吐量从 60Gbps 降到 4-8Gbps,普通以太网就能扛。
商业模式的想象空间在哪?如果 Prefill 可以跨数据中心调度,那"算力即服务"就可以拆成"Prefill 即服务"和"Decode 即服务"——推理架构解构了,商业模式也解构了。
💎 深挖
对比一下主流推理架构:
| 架构 | KV Cache 传输 | 跨数据中心 | 成本 |
|---|---|---|---|
| PrFaaS | 以太网 | 支持 | 低 |
| 传统 PD 分离 | RDMA | 不支持 | 高 |
| 同构部署 | 本地 | 不支持 | 极高 |
PrFaaS 的三层子系统设计值得细看:
计算层:H200 集群只啃长上下文 Prefill,H20 集群专心做 Decode。术业有专攻,硬件独立扩容。
网络层:集群内 RDMA 保证低延迟,跨数据中心走 VPC 或专线。100Gbps 够用,800Gbps 的 RDMA 不再是必须。
存储层:混合前缀缓存池,prefix-cache 集群内复用,transfer-cache 传完即弃。两个层级各司其职。
对做大模型推理部署的人来说,PrFaaS 传递的信号很明确:跨数据中心推理的技术门槛被打下来了。如果你的业务有长上下文需求、异地多机房部署、异构硬件混用场景,这套方案值得认真研究。
但前提是:模型架构得是"线性注意力 + 全注意力"混合。如果是传统的 dense GQA 架构,KV Cache 的带宽墙还在。Kimi Linear、Qwen 3.5、MiMo-V2-Flash 这些模型天然适配,其他模型要先改架构。
论文一作秦若愚是 Mooncake 分布式推理系统的一作。Mooncake + PrFaaS,月之暗面在推理架构上的积累已经形成体系。对评估推理方案的人来说,这套体系比单点论文更有说服力。
