GORGO: Maximizing KV-Cache Reuse While Minimizing Network Latency in Cross-Region LLM Load Balancing

algorithm 2602.11688 — Cross-paper Synthesis

GORGO — L3 Cross-Paper Synthesis #

§1 相关论文 #

相关实体关系类型关联理由
BalanceRoute (2605.06113)同赛道同属 LLM serving 负载均衡,但 BalanceRoute 解决单 DC 内 DP decode 路由而非跨区域路由;两者的 cost model 思路相似(additive latency decomposition)但粒度不同
Parallax (2509.26182)互补场景同处理异构/分散 GPU 上的 LLM serving,但 Parallax 面向 volunteer GPU 集群的 pipeline parallelism,GORGO 面向 geo-distributed 生产集群的 request-level routing
MARLIN (2605.13496)上层扩展MARLIN 用 multi-agent RL 在 geo-distributed DC 间调度 LLM inference,考虑 carbon/water/cost/latency 四目标;GORGO 仅优化 TTFT 但包含 prefix-cache 感知——两者可互补
MFS (2603.17456)正交补充MFS 解决 disaggregated MoE serving 中三阶段通信的网络争用,GORGO 解决跨区域路由的网络-cache tradeoff;两者分别在 intra-DC 和 inter-DC 层面处理网络延迟问题

§2 本篇 vs 相关论文的 delta #

GORGO vs BalanceRoute #

维度GORGOBalanceRoute
路由粒度跨地理区域 (RTT 10–300ms)同 DC 内 DP groups (RTT <1ms)
核心信号Network RTT + prefix overlap + queue depthToken-level load balance + barrier sync cost
Cost modelAdditive: $\text{Net} + t_p \cdot \text{Prefill} + \hat{q}_s \cdot \text{Queue}$ [2602.11688]Piecewise-linear F-score 捕获 barrier sync 的 $(G{-}1)$ 倍不对称 [2605.06113]
核心发现Centralized proxy 优于 distributed LB (2.5× TTFT) [2602.11688]Centralized stateful proxy 同样关键 (F-score 需 global view) [2605.06113]
成熟度3 regions, Mistral-7B, 60s benchmarkvllm-ascend 生产部署, 华为 910B, $G$=4/8/16

共识: 两者都发现 centralized routing 优于 distributed heuristics——GORGO-proxy vs distributed GORGO 的 2.5× 差距 [2602.11688],和 BalanceRoute 的 stateful proxy 设计 [2605.06113],共同指向"LLM serving 路由需要 global state visibility"的结论。

GORGO vs Parallax #

维度GORGOParallax
GPU 环境同构 (每区域 8×A100)异构 volunteer GPUs (不同代、不同 VRAM)
调度策略Per-request additive cost modelTwo-phase DP: offline model allocation + online chain selection [2509.26182]
KV-cache 考量Prefix trie 用于 routing 决策无 KV-cache awareness(focus on layer placement)
动态适应Peer summary 定期交换DHT metrics + DAG shortest path per-request [2509.26182]

Delta: Parallax 的 DP 层分配解决了 GORGO 完全未考虑的问题——异构 GPU 间的模型切分。但 Parallax 缺乏 KV-cache awareness,而 GORGO 的 prefix trie 正好补充这一缺失。

GORGO vs MARLIN #

MARLIN 在更高抽象层面运作——四个 SAC agent 分别优化 TTFT/carbon/water/cost,通过 game-theoretic consensus 产出 Pareto-optimal 调度 [2605.13496]。GORGO 的 additive cost model 可被视为 MARLIN 中 TTFT agent 的一个简化实例 [2602.11688]。两者的关键差异:

§3 可攻击面 #

  1. Evaluation 统计功效不足: GORGO 的 P99 claim 基于 57–141 requests(取决于方法),P99 of 100 samples = 单个最差请求 [2602.11688]。BalanceRoute 的评估同样有限但至少在多种 $G$ 下验证了 scaling trend [2605.06113]
    1. Distributed GORGO 反而降低 throughput: GORGO (distributed) 仅 0.93 req/s vs least-load 1.65 req/s [2602.11688]。论文将此归因于 rate limiting,但更可能是 prefix trie maintenance + peer synchronization 的 overhead。GORGO-proxy 解决了此问题,但这说明 distributed variant 在设计上存在根本性 overhead 问题。
      1. Prefix-cache savings 对 TTFT 贡献有限: $t_p$ = 0.0938 ms/tok 意味着 1000-token cache savings 仅值 94ms,常不及单次跨区 RTT(如 US→Germany 281ms)[2602.11688]。在短 prompt 场景下,cache-aware routing 的收益被网络开销完全抵消——GORGO 的 cost model 虽能正确捕捉这一点,但也意味着其 cache-aware 机制在 short-prompt workload 中几乎无用。
        1. 模型规模不匹配: 使用 Mistral-7B 在 8×A100 上——单节点 compute 能力远超 7B 模型需求。更大模型(70B+)或更高 QPS 下,cost model 中 queue 项的权重会急剧上升,当前标定可能失效。MFS 的多阶段通信分析显示大模型 serving 的网络行为质性不同 [2603.17456]
        2. §4 生态位 #

          GORGO 在 LLM serving 路由的技术栈中定位为 geo-distributed TTFT optimizer

          层次系统优化目标
          Intra-DC networkMFS三阶段通信争用 → TTFT SLO
          Intra-DC DP routingBalanceRouteBarrier sync 均衡 → decode throughput
          Inter-DC request routingGORGONetwork + prefix + queue → TTFT
          Inter-DC multi-objectiveMARLINTTFT + carbon + water + cost
          Decentralized heterogeneousParallaxLayer placement + chain selection → throughput

          GORGO 填补了 "prefix-cache-aware geo-routing" 的特定空白,但其 centralized proxy variant (GORGO-proxy) 实际上更接近于一个 enhanced geo-load-balancer 而非 distributed system innovation。

          §5 未探索方向 #

          1. GORGO + MARLIN 融合: 将 GORGO 的 prefix-aware cost model 作为 MARLIN 的 TTFT agent 的内部策略——MARLIN 提供 multi-objective Pareto 框架,GORGO 提供 fine-grained cache-aware TTFT 估计。这需要将 GORGO 的 additive cost model 转化为 MARLIN SAC agent 的 reward signal。
            1. MFS 与 GORGO 的 cross-layer 协调: MFS 管理 intra-DC 三阶段通信 [2603.17456],GORGO 管理 inter-DC routing。当 cross-region KV transfer 与 intra-DC collective communication 共享网络 fabric 时,两层调度需要协调。方向:unified cost model 同时考虑 intra-DC 争用和 inter-DC RTT。
              1. Adaptive $t_p$ 标定: GORGO 假设 $t_p$ 静态 [2602.11688],但 batch composition 会动态改变 per-token prefill time。方向:online learning of $t_p(batch\_size, seq\_len)$,类似 BalanceRoute 的 termination classifier 思路 [2605.06113]
                1. Heterogeneous GPU 扩展: GORGO 假设各区域 per-token timing 相近。结合 Parallax 的异构 GPU 处理能力 [2509.26182],可扩展 cost model 为 $\text{Cost}(\text{region}) = \text{Net} + t_p(\text{gpu\_type}) \cdot \text{Prefill} + \hat{q}_s \cdot \text{Queue}$,支持混合 A100/H100/MI300X 集群。