| 相关论文 | 关联类型 | 关联原因 |
|---|---|---|
| 2309.06180 (vLLM) | 互补并行 | vLLM 解决内存管理,FastServe 解决调度;v3 FastServe 集成了 PagedAttention |
| 2502.13965 (Autellix) | 后继扩展 | 将 FastServe 的 per-request MLFQ 思想扩展到 per-program 级别,解决 agent workload |
| 2510.17015 (Justitia) | 后继扩展 | 在 vLLM 之上实现 task-parallel LLM 的公平调度,增加 DRF 风格资源分配 |
| 2504.20068 (JITServe) | 后继扩展 | SLO-aware 调度考虑 imprecise request info(output length 预测不准),与 FastServe 的 semi information-agnostic 设定互补 |
| 2603.17456 (MFS) | 后继扩展 | 将调度问题扩展到 disaggregated MoE serving 的网络层,解决 multi-stage flow 争用 |
FastServe 的核心贡献是识别 LLM serving 的 "semi information-agnostic" 特性——input length 已知(决定 prefill time)但 output length 未知(决定 decode time)——并设计了利用这一中间状态的 skip-join MLFQ 调度器 [2305.05920]。
vs vLLM (2309.06180):两篇论文攻击 LLM serving 的不同瓶颈:
| 维度 | vLLM | FastServe |
|---|---|---|
| 核心问题 | KV cache 内存碎片 | Head-of-line blocking |
| 优化目标 | 最大化 batch size(吞吐) | 最小化 JCT(延迟) |
| 技术手段 | Paged memory management | Preemptive MLFQ scheduling |
| 调度策略 | FCFS | Skip-join MLFQ |
| 互补性 | FastServe v3 集成 PagedAttention | — |
关键洞察:vLLM 实测中 ShareGPT 仅 20.4%–38.2% 内存利用率 [2309.06180],FastServe 实测中 ShareGPT 98% 延迟来自排队 [2305.05920]。两者攻击不同的 98% / 20%——但 FastServe 的 98% 更能解释用户感知延迟。
vs Autellix (2502.13965):Autellix 发现 FastServe 的 per-request MLFQ 在 agentic workload 下失效 [2502.13965]。原因:agent program 的每次新 call 进入 MLFQ 最高优先级队列(因为是"新请求"),但其 program 累计已消耗大量服务时间——长 program 通过频繁提交新 call 反复"重生"为高优先级。Autellix 的 PLAS 将优先级绑定到 program 而非 request,新 call 继承 program 累计服务时间。
矛盾分析:FastServe 假设每个请求是独立的(single-turn chatbot),Autellix 假设请求之间有结构依赖(multi-turn agent)。两者在各自假设下都正确,冲突根源是workload model 不同。
vs JITServe (2504.20068):JITServe 攻击 FastServe 的另一个假设弱点——FastServe 的 skip-join 依赖精确的 prefill time 预测,但未利用 output length 的任何预估。JITServe 引入 imprecise output length prediction(即使不准也有信息价值),结合 SLO-aware goodput optimization。FastServe 是 "agnostic about output",JITServe 是 "imprecise about output"。
vs MFS (2603.17456):MFS 将调度问题从 compute scheduling 扩展到 network scheduling [2603.17456]。在 disaggregated MoE serving 中,三阶段通信(KV-cache 复用 + collective comm + P2D 传输)的网络争用导致 TTFT 膨胀 50%。MFS 用 Reverse Multi-Level Queue(与 FastServe 的 MLFQ 对偶的结构——新 flow 从低优先级开始,随 deadline 逼近逐步提升)解决网络层调度。FastServe 和 MFS 的共同思想:MLFQ 变体适配特定的 information structure。
FastServe 确立了 preemptive iteration-level scheduling 作为 LLM serving 的关键设计维度——之前的 Orca 虽有 iteration-level scheduling 但仍是 FCFS,FastServe 证明 FCFS 是 LLM serving 延迟的主要来源。
Paradigm shift:从"如何更快地执行一个请求"(vLLM/FlashAttention 的方向)转向"如何更智能地排序请求"。FastServe 的实测表明后者对用户感知延迟的影响远大于前者。
Adoption evidence:FastServe 的核心思想(iteration-level preemption)已被多个后续系统采纳——Autellix 的 PLAS 基于 LAS(MLFQ 的连续版本),Justitia 在 vLLM 上实现类似的 priority-based preemption。