Skip to content

Kimi 把 KV Cache 玩成了新商业模式:Prefill 和 Decode 跨数据中心解耦,商用以太网就够了

2026年4月19日

📰 概要

2026年4月19日,月之暗面联合清华大学郑纬民院士团队发布 PrFaaS(Prefill-as-a-Service)架构。核心突破:KV Cache 可以跨数据中心传输,Prefill 和 Decode 完全解耦到不同异构集群。

实测数据(1T 参数混合注意力模型):相比同构 PD 部署,吞吐量提升 54%,P90 延迟降低 64%;跨数据中心带宽仅 13Gbps,远低于 100Gbps 以太网上限。

底层逻辑:线性注意力 + 全注意力混合架构把 KV 吞吐量从 RDMA 级别降到以太网级别,跨数据中心推理从不可能变成可能。这是推理架构的成本天花板刷新。


🔍 解读

PrFaaS 解决的是一个长期痛点:Prefill 和 Decode 必须绑定在单一集群内——因为 KV Cache 传输依赖 RDMA 高带宽。算力芯片(H200)和带宽芯片(H20)如果不在一个机房,干脆用不了。

这套架构把"必须绑定"变成"可以解耦":线性层只产出固定大小的循环状态,不随上下文膨胀;全注意力层才生成和长度相关的 KV Cache。32K 上下文下,KV 吞吐量从 60Gbps 降到 4-8Gbps,普通以太网就能扛。

商业模式的想象空间在哪?如果 Prefill 可以跨数据中心调度,那"算力即服务"就可以拆成"Prefill 即服务"和"Decode 即服务"——推理架构解构了,商业模式也解构了。


💎 深挖

对比一下主流推理架构:

架构KV Cache 传输跨数据中心成本
PrFaaS以太网支持
传统 PD 分离RDMA不支持
同构部署本地不支持极高

PrFaaS 的三层子系统设计值得细看:

计算层:H200 集群只啃长上下文 Prefill,H20 集群专心做 Decode。术业有专攻,硬件独立扩容。

网络层:集群内 RDMA 保证低延迟,跨数据中心走 VPC 或专线。100Gbps 够用,800Gbps 的 RDMA 不再是必须。

存储层:混合前缀缓存池,prefix-cache 集群内复用,transfer-cache 传完即弃。两个层级各司其职。

对做大模型推理部署的人来说,PrFaaS 传递的信号很明确:跨数据中心推理的技术门槛被打下来了。如果你的业务有长上下文需求、异地多机房部署、异构硬件混用场景,这套方案值得认真研究。

但前提是:模型架构得是"线性注意力 + 全注意力"混合。如果是传统的 dense GQA 架构,KV Cache 的带宽墙还在。Kimi Linear、Qwen 3.5、MiMo-V2-Flash 这些模型天然适配,其他模型要先改架构。

论文一作秦若愚是 Mooncake 分布式推理系统的一作。Mooncake + PrFaaS,月之暗面在推理架构上的积累已经形成体系。对评估推理方案的人来说,这套体系比单点论文更有说服力。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来