Prefill-as-a-Service: KVCache of Next-Generation Models Could Go Cross-Datacenter

framework 2604.15039 — Cross-paper Synthesis

PrfaaS vs 相关论文:跨篇综合 #

相关论文 #

本篇选取 8 个相关实体,覆盖 PD 分离架构下的 KV 传输优化、网络调度、prefill 执行策略、跨 DC 数据传输、以及 decode 端低延迟推理等维度,与 PrfaaS 形成多层次对比。

DualPath (2602.21548) — 与 PrfaaS 最直接可比。两者都解决 PD 分离架构下 KV-Cache 传输瓶颈,但路径完全相反:DualPath 在单集群内通过 DE 端空闲 SNIC + RDMA 计算网络做 dual-path loading,把 PE 的 I/O 负载分摊到 DE 端 [2602.21548];PrfaaS 把 compute-dense 的长上下文 prefill offload 到跨 DC 独立集群,通过 commodity Ethernet 回流压缩后的 KV [2604.15039]。两者都依赖层间 prefill pipelining 实现计算-传输重叠——DualPath 称之为 "layerwise streaming"(PE 端逐层加载/释放 KV-Cache)[2602.21548],PrfaaS 称之为 "layer-wise prefill pipelining" [2604.15039]。DualPath 硬件门槛极高(InfiniBand 双网 + 3FS),但对模型架构无要求;PrfaaS 硬件门槛低(commodity Ethernet),但要求混合注意力模型。Kind: related。

PPD (2603.13358) — 与 PrfaaS 共享"不是所有 prefill 都该走同一条路"的核心洞察,但路由维度正交。PPD 按 turn 维度路由——Turn 1 走传统 PD 路径,Turn 2+ 在 decode 节点本地执行 append-prefill(因为干扰仅 2% vs full prefill 的 48%)[2603.13358]。PrfaaS 按长度维度路由——增量长度 > 阈值 t 的送 PrfaaS 集群,短的留 PD-P [2604.15039]。两者的路由决策可叠加:先按 turn 分流(Turn 2+ 且增量短 → decode 本地),再按长度分流(Turn 1 或 Turn 2+ 增量长 → PrfaaS vs PD-P)。Kind: related。

MFS (2603.17456) — 都面对 disaggregated serving 的网络争用问题,但层次不同。MFS 解决单集群内三阶段通信(KV-cache 复用 + collective comm + P2D 传输)的争用,通过 RMLQ 实现 Defer-and-Promote 调度 [2603.17456]。PrfaaS 解决跨 DC 的 egress 带宽约束,通过长度阈值路由选择性 offload [2604.15039]。MFS 的 Earliness 控制(P2D flow 恰好在 deadline 前完成)[2603.17456] 与 PrfaaS 的 layer-wise pipelining(compute-transfer 重叠使 egress 恰好被计算覆盖)在设计哲学上相通——都追求"刚好用完但不浪费"的资源利用。Kind: related。

TensorHub (2604.09107) — 共享跨 DC 数据传输主题,但传输对象不同。TensorHub 传输 RL 训练中的模型权重(TB 级,trainer→rollout),PrfaaS 传输推理中的 KV-cache(GB 级/请求,PrfaaS→PD)。TensorHub 的 smart skipping + offload seeding 两阶段模式(仅 seeding replica 走 TCP,其余走本地 RDMA)[2604.09107] 与 PrfaaS 的 PrfaaS→PD 分层传输(跨 DC Ethernet + intra-cluster RDMA)在架构上高度类比。TensorHub 的 pipeline replication(partially-replicated peer 立即服务下游)[2604.09107] 可以为 PrfaaS 集群内部多实例共享同一请求的 KV 提供启发。Kind: related。

ZeRO-Prefill (2605.02960) — 都优化 MoE prefill serving,但切入角度正交。ZeRO-Prefill 反转 expert 数据流方向(weight streaming 替代 activation routing),在 execution level 消除 AllToAll 通信冗余 [2605.02960]。PrfaaS 反转 prefill 位置(跨 DC offload),在 architecture level 解耦 prefill 和 decode 的资源约束。ZeRO-Prefill 论文自己指出 PrfaaS(PrefillOnly)"首次定义 prefill-only serving 并优化 scheduler,但未触及 MoE 执行栈",两者互补——AsyncEP 后端 + PrfaaS 调度器可叠加 [2605.02960]。Kind: related。

TileRT Blog (tilert-speed-scaling-law) — PrfaaS 优化 prefill 端吞吐,TileRT 优化 decode 端延迟——两者位于 PD disaggregation 的两端。TileRT 用 AOT 编译将模型展开为单个 Persistent Engine Kernel,在 batch=1 下弥合理论 ~1000 tok/s 与实际几十 tok/s 的差距 [tilert-speed-scaling-law]。PrfaaS 的 PD 架构中,decode 侧可直接采用 TileRT 风格的低延迟引擎——PrfaaS 把 decode 端从 prefill 压力中解放出来,正好为 TileRT 提供了理想的运行环境(decode-only,无 prefill 干扰)。Kind: related。

KVServe (kvserve) — 与 PrfaaS 直接互补。KVServe 压缩 PD 间 KV-cache 传输(up to 10× 压缩、9× 通信降低)[kvserve],PrfaaS 的跨 DC Ethernet 传输正是 KV 压缩收益最大的场景。PrfaaS case study 的 egress 13 Gbps = 13% 链路 [2604.15039]——如果叠加 KVServe 的 10× 压缩,egress 可降至 ~1.3 Gbps,或在相同带宽下服务 7–10× 更多请求。但 KVServe 当前不支持 MLA 架构 [kvserve],而 PrfaaS 的 case study 模型使用 KDA:MLA=3:1 混合——MLA 部分无法压缩。Kind: related。

TileRT Code (tile-ai-tilert) — TileRT 代码实现的 decode 超低延迟(DeepSeek-V3.2 达 600 tok/s,8×B200)[tile-ai-tilert] 验证了 PrfaaS decode 端的一种极致路线。TileRT 通过 inject_cache() API 接受外部 prefill 系统的 KV cache [tile-ai-tilert]——这恰好是 PrfaaS 架构所需的接口:PrfaaS 集群完成 prefill 后,KV 通过 Ethernet 传输到 decode 集群,decode 集群的 TileRT 引擎通过 inject_cache 接收并开始高速 decode。Kind: related。

本篇 vs 相关论文的 delta #

PrfaaS 的核心 delta 是将 PD disaggregation 从"单集群 RDMA 岛"扩展到"跨 DC commodity Ethernet"——前提是混合注意力架构把 $\Phi_{\text{kv}}$ 压低 4–13×,使跨 DC KV 传输从 infeasible 变为 compute-bound。

维度PrfaaSDualPathPPDMFSTensorHubZeRO-PrefillKVServeTileRT
瓶颈定位Cross-DC egress BWStorage NIC BWMulti-turn KV retransmitMulti-stage flow contentionWeight transfer stallMoE AllToAll redundancyPD KV transfer BWDecode inter-kernel idle
核心手段长度阈值路由 + 跨 DC offloadDE SNIC 聚合 + CNIC QoSTurn-based append-prefill routingRMLQ defer-and-promoteROS + pipeline replicationWeight streaming (AsyncEP)Modular compression pipelinePersistent Engine Kernel
网络假设Commodity Ethernet (100 Gbps)InfiniBand 双网同节点 NVLink or 100GbECommodity switch w/ DSCPRDMA + TCP fallbackNVLink intra-node任意 (connector-based)NVLink intra-node
模型约束Hybrid attention 必须MoE + EPMoE + prefill-only非 MLAbatch=1 only
优化阶段Prefill offloadPrefill KV loadingTurn 2+ routingPrefill networkTraining weight xferPrefill executionPD KV transferDecode
规模验证96 GPU (32 H200 + 64 H20)1152 GPU4 GPU (H100)32 GPU (3090)1024 GPU8 GPU (A100/H100/H200)同节点测试8 GPU (B200)
开源是 (vLLM flag)部分

PrfaaS vs DualPath — "模型约束 vs 基础设施约束"的根本 trade-off。DualPath 在同一集群内聚合全部 SNIC 带宽(离线 1.87×,在线 1.96×)[2602.21548],但要求 InfiniBand 双网 + 3FS + RDMA NIC。PrfaaS 用 commodity Ethernet 实现 +54% 吞吐 [2604.15039],但要求模型是混合注意力架构。两者的 layer-wise pipelining 设计几乎相同——这不是巧合,而是 PD 分离架构下消除传输-计算串行的唯一正确做法。关键区别在于 DualPath 的 pipelining 针对 storage→HBM 路径(SNIC 读取与 attention compute 重叠),PrfaaS 的 pipelining 针对 compute→egress 路径(prefill compute 与 KV 发送重叠)。DualPath 适用于 agentic workload(高 KV-cache hit、短 append、I/O-bound),PrfaaS 适用于长上下文首次 prefill(低 KV-cache hit、长 input、compute-bound)。

PrfaaS vs PPD — 路由维度互补。PPD 证明 append-prefill 对 decode TPOT 的干扰仅 2%(vs full prefill 48%)[2603.13358],因此 Turn 2+ 可安全留在 decode 节点。PrfaaS 证明长增量请求可安全 offload 到跨 DC 集群(egress 仅占 13% 链路)[2604.15039]。两者组合:Turn 2+ 且增量短(PPD 路由到 decode 本地)→ Turn 2+ 且增量长(PrfaaS 路由到跨 DC)→ Turn 1(PrfaaS 长 / PD-P 短)。PPD 的 offline profiling lookup table 和 PrfaaS 的 grid-search 最优 t 都是 O(1) 运行时开销的决策机制,叠加不增加调度延迟。

PrfaaS vs ZeRO-Prefill — 全栈互补。ZeRO-Prefill 在执行栈底层消除 MoE AllToAll 冗余(backend: 1.35–1.37× throughput),PrfaaS 在架构顶层做 prefill 位置优化(architecture: +54% throughput)。ZeRO-Prefill 的 frontend co-design 概念(饱和阈值 T 由 backend 定义、frontend 强制)[2605.02960] 与 PrfaaS 的 throughput model(Eq.7–8 balance 条件由 backend profile 定义、scheduler 执行)[2604.15039] 在方法论上一致——都是 physics-grounded co-design 而非启发式调参。

PrfaaS vs KVServe — 乘性增益。PrfaaS 的 egress 13 Gbps 是在未压缩 KV 下的数字。KVServe 在 bandwidth-limited 场景下提供 up to 10× KV 压缩 [kvserve]。如果叠加,PrfaaS 的 egress 可从 13 Gbps 降至 ~1.3 Gbps——或者在相同链路上把 $N_{\text{prfaas}}$ 从 4 扩展到 ~30 实例(Eq.3 bandwidth 项上限放大 ~10×)。但存在兼容性障碍:KVServe 不支持 MLA [kvserve],PrfaaS 的 case study 模型 KDA:MLA=3:1 中 MLA 部分的 KV 无法用 KVServe 压缩——只有 KDA 部分(线性注意力产生的 recurrent state)可能适配。

PrfaaS 的独有增量

  1. 首次证明跨 DC PD disaggregation 的可行性——在此之前所有 PD 分离系统都假设同一 RDMA 域。PrfaaS 用 Table 3 的跨模型 $\Phi_{\text{kv}}$ 对比量化了"hybrid attention 把跨 DC 从 infeasible 变 feasible"的精确条件 [2604.15039]
  2. 唯一提供 closed-form 最优配置的 PD 调度系统——Eq.7 ∩ Eq.8 的 monotonicity 保证了 $(t^*, N_p/N_d)$ 的唯一性,且 case study 数字从模型一阶导出、非 sweep-fit [2604.15039]。PPD 用 offline profiling lookup table(近似但非解析),DualPath 的 Eq.1–9 是 feasibility 区间(非最优点)。
  3. 首次利用 heterogeneous GPU 的经济性做 PD serving——32×H200 做 compute-dense prefill + 64×H20 做 bandwidth-optimal decode,跨代际 GPU 混搭实现 cost-effective 异构。其他系统均假设同构集群。
  4. 可攻击面 #

    以下攻击针对 PrfaaS L2 论证链中的具体步骤。

    Attack 1: 混合注意力前提的时效性风险 (L2 §6 Step 2)

    PrfaaS 的存在前提是混合注意力(KDA:MLA=3:1 等)将 $\Phi_{\text{kv}}$ 压缩 4–13×。Table 3 展示 Kimi Linear 32K = 3.87 Gbps vs MiniMax-M2.5 32K = 59.93 Gbps,降低 15× [2604.15039]。但混合注意力比例是模型设计者的选择——如果下一代模型回归更高的 full-attention 比例(例如因 reasoning 任务对长距离 attention 的需求增加),$\Phi_{\text{kv}}$ 将回升,PrfaaS 的 egress 约束可能重新变为瓶颈。Table 3 中 Ring-2.5-1T (7:1 hybrid) 在 128K 仅 1.46 Gbps,但 Qwen3.5-397B 在 32K 达 8.25 Gbps——后者接近 100 Gbps 链路的 8%,4 实例聚合 33 Gbps 即达 33% 利用率。模型架构趋势稍一摇摆就可能使 PrfaaS 的 feasibility window 关闭。

    Attack 2: 层间 pipelining 的完美重叠假设 (L2 §6 Step 4, §7 核心技术壁垒)

    Eq.3 的 $\min$ 形式假设 compute 和 KV transfer 完美重叠——paper 自己承认这依赖 layer-wise prefill pipelining [2604.15039]。但 L2 §7.0 明确指出:如果没有 pipelining,实际吞吐退化为 harmonic mean,case study 的 3.24 req/s 直接砍半到约 1.6 req/s,+54% headline 失效。更关键的是,现有开源 PD 传输(vLLM kv_transfer/、SGLang disaggregation/)都是 "full prefill → then send",不支持 layer-wise streaming。DualPath 的 layerwise streaming 同样是核心壁垒 [2602.21548]。两个独立系统都把 layer-wise pipelining 列为"最难复现的工程决策"——这暗示 PrfaaS 的 Eq.3 $\min$ 形式在实际复现中极可能无法达到。

    Attack 3: 等成本校准的自我削弱 (L2 §6 Step 5)

    PrfaaS 的 headline 是 +54% throughput vs 同构 96×H20,但 §4.4 自己承认 H200 价格溢价后等成本口径仅 +15% [2604.15039]。15% 的经济增益是否值得引入跨 DC 架构的运维复杂度?DualPath 在同构硬件(Hopper 集群)上离线吞吐 1.87× [2602.21548],无跨 DC 运维成本。PPD 在 4×H100 同构设置下将不稳定配置变为 100% 成功率 [2603.13358],也无跨 DC 开销。PrfaaS 的 +15% 等成本增益必须与跨 DC 网络运维、故障域扩大、tail latency 恶化等成本对冲。

    Attack 4: 代表长度近似的尾部效应 (L2 §4 §4.4 简化假设 A1)

    Throughput model 用 $l_{\text{long}} = \mathbb{E}[L | L > t]$ 替代完整分布 [2604.15039]。Log-normal 分布有 fat tail——在 $\mu=9.9, \sigma=1.0$ 下,P99 长度可达 ~200K(远超 $l_{\text{long}} \approx 44K$)。这些极长请求的 prefill 耗时远超均值(128K = 7.4s vs 44K ≈ 2.6s),但 Eq.3 用 $T_{\text{prefill}}(l_{\text{long}})$ 做代表值——意味着一小部分极长请求实际消耗远超模型预期的 PrfaaS 计算资源,可能导致 PrfaaS 集群暂时过载。这种尾部效应在 Eq.7 的 balance 条件被平均掉了,实际中会表现为 P90 TTFT 恶化(paper 报告 P90 = 3.51s,但 P99 未报告)。

    Attack 5: 路由阈值的静态性 vs 动态 workload (L2 §6 Step 4)

    $t^* = 19.4K$ 由 Eq.7 在稳态分布下求解 [2604.15039]。但生产 workload 的输入长度分布是时变的——白天/夜间、工作日/周末、不同用户群体的分布差异显著。Paper 的 dual-timescale scheduler 只调整 $N_p/N_d$(长时间尺度),不动态调整 $t$ [2604.15039]。如果实际分布 $P(L > t)$ 从 0.5 漂移到 0.8(更多长请求),PrfaaS 集群过载而 PD-P 空闲——整个 Eq.7 balance 被打破。ZeRO-Prefill 的饱和阈值 T 虽然也是静态标定,但其 frontend 三规则提供了运行时 fallback(不满足 T 时退回同步执行)[2605.02960]。PrfaaS 缺少类似的 graceful degradation 机制。

    Attack 6: Naive Het PD baseline 的 straw-man 可能 (L2 §6 Step 3, Step 5)

    Table 6 的 Naive Heterogeneous PD(4H200 + 8H20,无调度)仅达 1.16× 同构,PrfaaS-PD 达 1.54× [2604.15039]。但 Naive Het 配置是 "4 H200 做 prefill + 8 H20 做 decode,无选择性 offload"——这是一个几乎没有工程投入的 straw-man。如果在 Naive Het 基础上仅加入长度阈值路由(不跨 DC),就可能达到接近 PrfaaS-PD 的效果,因为 PrfaaS-PD 的 +38% 增量(1.16→1.54)被归因于 scheduling,而 scheduling 的核心(长度阈值 t + P/D rebalancing)在同一 DC 内也可实现。Paper 在 Table 6 中未包含"同 DC 异构 + 长度路由"这一中间 baseline——缺少这个 baseline 使读者无法区分"调度贡献"和"跨 DC 贡献"。

    生态位 #

    范式定位:PrfaaS 代表 LLM serving 从"单集群绑定"到"跨 DC 弹性调度"的范式扩展——但这个范式扩展有一个关键前提条件:模型架构必须是混合注意力。这不是一个通用 serving 框架,而是一个"架构-系统 co-design"产物——hybrid attention 降低 KV 吞吐 → 跨 DC 可行 → 异构 GPU 混搭 → 成本优化。如果模型架构不配合(dense MHA/GQA),整条链条失效。

    Moonshot AI 生态绑定:PrfaaS 来自 Moonshot AI(Kimi),case study 使用内部 1T Kimi-Linear 风格模型,实现基于 in-house vLLM fork,核心未开源 [2604.15039]。三项核心贡献(dual-timescale scheduler、layer-wise prefill pipelining、cross-cluster cache transfer)均未公开。与 DualPath(DeepSeek 内部系统)类似,PrfaaS 的可复现性极低——但对外部研究者的价值在于其 throughput model(Eq.1–8)提供了跨 DC PD 架构的设计空间分析框架。

    采纳信号

    • 正面:throughput model 全部可一阶导出,case study 数字与模型预测一致 [2604.15039],说明方法论可信。混合注意力趋势(Kimi-Linear、MiMo-V2-Flash、Ring-2.5)正在加速——更多混合模型意味着更大的 PrfaaS 适用范围。
    • 障碍:(1) 代码未开源;(2) layer-wise pipelining 需要深入修改 vLLM execution engine——DualPath 和 PrfaaS 独立确认了这是多人月工程 [2602.21548] [2604.15039];(3) 等成本增益仅 +15%,可能不足以证明跨 DC 运维成本合理;(4) KVServe 的 MLA 不支持限制了 KV 压缩叠加的收益。

    竞争方案生态位对比

    场景推荐方案PrfaaS 的相对位置
    同集群 agentic serving (I/O-bound)DualPathPrfaaS 不适用(非跨 DC 场景)
    跨 DC 长上下文 prefill + 混合注意力PrfaaS唯一选项
    Multi-turn PD 优化(短 append)PPDPrfaaS 优势不大(短增量不走 PrfaaS)
    MoE prefill-only 吞吐优化ZeRO-PrefillPrfaaS 正交,可叠加在 ZeRO-Prefill 上
    PD KV 传输压缩KVServePrfaaS 可受益,但 MLA 兼容性是障碍
    Batch=1 decode 低延迟TileRTPrfaaS decode 端可直接采用
    PD 间网络争用调度MFSPrfaaS 不解决 intra-cluster 争用

    定位判断:PrfaaS 是第一个严肃论证跨 DC PD disaggregation 的工作,其 throughput model 对该设计空间的分析有持久价值。但其实用性高度依赖"混合注意力成为主流 + 跨 DC 网络成本低于同构扩展"这两个条件同时满足。如果未来 MoE 持续主导(DeepSeek-V3/V4 仍以 MLA 为主),PrfaaS 的适用范围可能局限于 Kimi-Linear 一系。

    未探索方向 #

    方向 1: PrfaaS + PPD + KVServe 三层叠加。PrfaaS 按长度路由、PPD 按 turn 路由、KVServe 压缩传输——三者攻击不同维度,理论上可叠加。具体组合:Turn 2+ 且增量 < t 的 append-prefill 在 decode 本地执行(PPD 路径,零传输);Turn 2+ 且增量 > t 或 Turn 1 长请求走 PrfaaS 集群(cross-DC offload);跨 DC 传输的 KV 用 KVServe 压缩 10×。组合后 PrfaaS egress 从 13 Gbps 降至 <2 Gbps(压缩 + PPD 分流减少 ~80% 跨 DC 流量),同时 decode TPOT 仅 +2%(PPD 的干扰上界)。关键挑战是三层路由决策的联合优化:当前每层独立决策,联合搜索空间是 $(t, w_{\text{tpot}}, \text{compression\_profile})$ 的笛卡尔积。

    方向 2: 动态 t 与 workload distribution tracking。PrfaaS 的 $t^$ 由稳态分布求解,不适应分布漂移。一个自适应机制:用滑动窗口跟踪实际 $P(L > t)$,当 offload 比例 $p$ 偏离 Eq.7 balance 条件超过阈值时,在 long-term scheduler 的周期内重解 $t^$。这与 dual-timescale scheduler 的 Eq.8 rebalancing 机制自然集成——当前 long-term 只调 $N_p/N_d$,扩展为同时调 $(t, N_p/N_d)$ 的二维优化。ZeRO-Prefill 承认静态 T 标定在 workload 剧变时有短暂不匹配窗口 [2605.02960]——PrfaaS 面临同样问题但更严重,因为跨 DC 的资源调整延迟远大于单集群内 P↔D role swap。

    方向 3: 跨 DC KV 传输 + CNIC-centric 混合路径。DualPath 的 CNIC-centric 流量隔离 [2602.21548] 解决同集群内 I/O-compute 争用,PrfaaS 的 layer-wise pipelining 解决跨 DC 的 compute-egress 重叠。两者可以在 PD 集群内部组合:PrfaaS 的 KV 到达 PD 集群后,从 PD-P 到 PD-D 的传输走 DualPath 的 CNIC-centric dual-path loading(如果 KV-cache hit 高则走 DE read path 加速加载)。这使得 PrfaaS 的 intra-cluster 环节也获得 DualPath 的 I/O 优化——当前 PrfaaS §3.4.1 假设 "intra-cluster RDMA bandwidth is not a bottleneck"(Eq.4 无 BW 项),但在极高 $\Lambda_{\max}$ 下这个假设可能失效。

    方向 4: 混合注意力比例作为可调旋钮。PrfaaS 将 KDA:MLA 比例视为固定的模型属性。但如果 hybrid attention 比例在推理时可动态调整(例如 early exit 某些 MLA 层、或训练时设计多种 ratio 的 adapter),$\Phi_{\text{kv}}$ 就变成了运行时可调旋钮——高 egress 压力时增大 KDA 比例(降低 $\Phi_{\text{kv}}$),低 egress 压力时增大 MLA 比例(提高模型质量)。这需要模型端和系统端的 co-design:PrfaaS 的 throughput model 提供了 $\Phi_{\text{kv}}$ → $\Lambda_{\max}$ 的解析映射 [2604.15039],可直接作为 attention ratio 的 utility function。

    方向 5: MFS-style 网络调度应用于 PrfaaS 跨 DC 传输。MFS 的 Defer-and-Promote 策略(P2D flow 初始低优先级、deadline 临近才 promote)[2603.17456] 可直接应用于 PrfaaS 的 cross-cluster egress 管理。PrfaaS 当前的 BW-scarce/abundant 二态路由 [2604.15039] 是粗粒度的——MFS 的 MLU 指标可以提供 per-request 级别的精确 defer 时机:egress 带宽充裕时 defer(让 compute 先跑完更多层以积累更多可发送的 KV),deadline 临近时 promote(提升传输优先级)。这在多租户 PrfaaS 集群中尤其有价值——不同租户的 TTFT SLO 不同,需要差异化的 egress 调度。