GORGO 通过 additive cost model 联合优化 network latency、KV-cache prefix overlap 和 queue depth 来路由跨区域 LLM 请求,其集中式 proxy 变体实现 median TTFT 2.5× 优于 baseline。
跨地理区域部署的 LLM 推理面临路由抉择:现有方案要么纯负载均衡(忽略 prefix cache),要么纯 prefix-similarity 路由(忽略跨区网络延迟)。当远端区域有更高 cache hit 但 RTT 达 281ms 时,追逐 cache overlap 反而恶化 TTFT。核心冲突:network latency 和 KV-cache similarity 不可独立优化。
GORGO 提出 additive cost model(因各组件时序串行发生):
$$\mathrm{Cost}(\text{region}) = \mathrm{NetworkLatency}(\text{peer}) + t_p \cdot \mathrm{PrefillCost}(\text{peer}) + \hat{q}_s \cdot \mathrm{QueueWaitTime}(\text{local})$$
| 组件 | Before (Prefix-only routing) | After (GORGO) |
|---|---|---|
| 路由信号 | 仅 prefix overlap | Network RTT + prefix overlap + admission/queue state |
| 架构 | 分布式 LB,无网络感知 | Per-region LB + peer summary exchange; 或 centralized HTTP proxy |
| 目标 | 最大化 cache hit rate | 最小化 estimated TTFT |
核心技术壁垒: 将 prefix overlap 转换为时间量 $L_\text{hit} \cdot t_p$,使三个异构信号(ms 单位)可直接相加。$t_p$ 通过线性回归精确标定($R^2 = 0.9863$),且 additive 结构对应真实串行 pipeline。
| 符号 | 含义 | 单位/范围 |
|---|---|---|
| $t_p$ | Per-token prefill time | 0.0938 ms/tok |
| $L_\text{hit}$ | Cached prefix length | tokens |
| $L_p$ | Total prefill length | tokens |
| $\hat{q}_s$ | Queue weight | tunable |
| RTT | Round-trip time to peer | ms |
| $R^2$ | Linear regression fit | 0.9863 |
Cost model additive: network forwarding、residual prefill、queueing 在 serving pipeline 中串行发生,因此 TTFT ≈ 三者之和。Minimizing sum 直接最小化 TTFT。
Saved time = $L_\text{hit} \cdot t_p$: 已缓存的 prefix tokens 无需重新计算,节省的时间与 token 数线性相关。
Linear regression $\text{TTFT} = 150.72 + 0.0938x$: 验证 prefill 对 TTFT 的贡献是线性的($R^2 = 0.9863$, N=87),证明 cost model 的 additive 假设成立。
无形式化作者证明 — 仅实证(作者明确声明 "not intended to perfectly predict per-request latency")
| 维度 | 配置 |
|---|---|
| 区域 | 3: US West Coast, Germany, Israel |
| 硬件 | 每区域 8×A100 |
| 模型 | Mistral-7B-Instruct-v0.3 |
| 运行时 | SGLang (RadixAttention) |
| 工作负载 | WildChat + GuideLLM (concurrent, 10 in-flight, 60s) |
| LB 实现 | Go (loadbalancer.go) |
GORGO-proxy vs baselines (median TTFT):
| 方法 | Median TTFT | P99 TTFT | Throughput |
|---|---|---|---|
| Least-load | 568 ms | 18,115 ms | 1.65 req/s |
| Prefix-trie | 564 ms | 20,595 ms | 1.40 req/s |
| GORGO (distributed) | 539 ms | 1,207 ms | 0.93 req/s |
| GORGO-proxy | 224 ms | 436 ms | 2.33 req/s |
线性回归标定: $t_p$ = 0.0938 ms/tok, base latency = 150.72 ms, $R^2$ = 0.9863 (N=87)。
| Step | 论据 | 证据 | 结论 |
|---|---|---|---|
| 1 | 纯 cache-overlap 路由忽略网络代价 | §2.4 motivating example: Israel 有 15% cache hit 但 TTFT = 378ms > Germany 0% hit 但 281ms | Cache hit 不等于 TTFT 最优 |
| 2 | 三信号可转换为同一单位 (ms) | $t_p$ linear regression $R^2=0.9863$; RTT directly measurable; queue × $t_p$ | Additive cost model 物理合理 |
| 3 | 集中式 proxy 优于分布式 | GORGO-proxy 224ms vs GORGO 539ms; proxy 有全局信息优势 | Coordination overhead 被 centralization 消除 |
| 4 | P99 TTFT 改进更显著 | GORGO-proxy P99 = 436ms vs least-load 18,115ms | 避免 pathological cross-region forwarding |
开源状态: 论文描述了实现但未明确给出开源 repo。
关键实现细节:
基础设施: SGLang status endpoint 暴露 queue state + KV-cache capacity + per-token compute time; GuideLLM 用于 benchmark workload generation; WildChat dataset 提供地理分布的用户 prompt。
[实现未公开]