Harli: SLO-Aware Co-location of LLM Inference and PEFT-based Finetuning on MaaS Platforms vs 7 peers in category framework
Harli 占据 framework 类别中一个独特的生态位:inference-training 同 GPU 共存。现有 framework 几乎全部聚焦于"inference 内部怎么拆"(PD 分离、agentic 调度)或"training 内部怎么传"(RL 权重传输),而 Harli 是唯一系统性解决"inference 和 training 能否共享同一块 GPU"的工作。以下 7 个 peer 从不同维度与之关联:
| 相关实体 | 关系类型 | 关联原因 |
|---|---|---|
| DynaServe (2504.09285) | 竞争/互补 | 同为 co-location vs disaggregation 决策系统,但 DynaServe 在 inference 两阶段间做 co-location,Harli 在 inference-finetune 间做 co-location [2504.09285] |
| JITServe (2504.20068) | 正交 | SLO-aware 调度的不同维度:JITServe 在请求间做 goodput 最大化,Harli 在 workload 间做 SM 分配最大化 [2504.20068] |
| DualPath (2602.21548) | 互补 | 同发现 decode 结构性 underutilization,但 DualPath 收割闲置 SNIC 带宽,Harli 收割闲置 SM 算力 [2602.21548] |
| PPD (2603.13358) | 方法论同源 | 均基于"干扰低于预期"的 profiling 洞察做 co-location 决策——PPD 发现 append-prefill 干扰仅 2%,Harli 发现 PEFT co-location 干扰可线性预测 [2603.13358] |
| MFS (2603.17456) | 正交 | SLO-aware 资源调度的不同资源维度:MFS 调度网络带宽(RMLQ 三阶段流),Harli 调度 SM 算力(GreenContext 分区)[2603.17456] |
| TensorHub (2604.09107) | 互补/对照 | 同在 training-serving 边界创新:TensorHub 解决分离式 RL 训练的权重传输,Harli 解决共置式 PEFT 微调的资源隔离 [2604.09107] |
| Scepsy (2604.15186) | 竞争 | 均用 SM 分区实现 GPU 共享——Scepsy 用 MPS 做多 LLM 分数 GPU,Harli 用 GreenContext 做 inference+finetune 分数 SM [2604.15186] |
DynaServe 的 micro-request 抽象统一了 prefill 和 decode 的 co-location/disaggregation 决策空间 [2504.09285],但 co-location 的两端仍然是同质的推理任务。Harli 的根本创新在于跨越了 workload 类型边界:将 compute-bound 的 PEFT finetuning 与 memory-bandwidth-bound 的 decode 共置在同一 GPU 上 [2511.11729]。这不是简单的推广——两种异构 workload 的资源瓶颈正交性(SM idle vs DRAM bandwidth saturation)创造了比同质 co-location 更高的理论增益上限。DynaServe 在 co-location 模式下的增益受制于 prefill-decode 同为 GPU-bound 的事实;Harli 利用结构性互补关系获得 46% 平均额外吞吐 [2511.11729]。
三种 SLO-aware 调度系统采用了截然不同的预测/决策策略:
Harli 的 LR 方法是三者中最轻量的(5 μs vs DynaServe 的查表 vs JITServe 的 7ms QRF),但其适用性强依赖 PEFT 的 batch-size 稳定性这一前提。如果 co-location 对象换成 variable-batch 的 full finetuning 或另一个推理实例,线性假设将崩塌——这正是 DynaServe/JITServe 不做此假设的原因。
Harli 和 Scepsy 都在 SM 粒度做 GPU 共享,但隔离机制和适用场景不同:
Harli 的动态调整频率远高于 Scepsy(每个 decode step ~50ms vs Scepsy 分钟级重新搜索),因为 inference 负载的 batch size 波动需要实时响应。代价是 Harli 不能像 Scepsy 那样做全局多 LLM 拓扑优化——它被限制在单 GPU 范围内。
Harli 的 CUDA VMM 统一分配器(2,500 LoC C++)是其最重要的工程创新,在 KB 现有 framework 论文中没有对标 [2511.11729]。DualPath 用双路径 KV-Cache 加载解决 I/O 带宽问题 [2602.21548],KVServe 用压缩解决传输带宽问题,但没有系统解决过"两种不同生命周期的 workload 如何共享同一 GPU 的物理内存"这一问题。Harli 的 2D block pool + virtual address remapping + window-based swap 是第一个完整方案。
TensorHub 和 Harli 都工作在 training-serving 边界,但分别代表了这个连续体的两个极端:
两者的适用场景不重叠:TensorHub 面向大规模 RL 训练(1024 GPU standalone rollout, TB 级权重),Harli 面向 MaaS 平台的轻量级 PEFT 微调(单 GPU LoRA, <0.3% 额外参数)。但在"MaaS 平台同时承载推理和定制化微调"的场景下,Harli 的内存统一方案可以与 TensorHub 的权重分发方案组合——TensorHub 负责跨节点权重同步,Harli 负责单节点内的 inference-finetune 资源协调。
Harli 的整个预测-调度框架建立在"PEFT finetuning 使用固定 batch size,因此干扰稳定且可线性化"这一前提上 [2511.11729]。但实际 MaaS 平台上:
如果干扰非线性成分超过 LR 捕获范围,5% 预测误差可能爆增至 20%+,使 QoS 调度器失效。论文没有展示任何鲁棒性测试。
Harli 在 Ada6000(48GB, 142 SM, Ada Lovelace)和 A100(40GB, 108 SM)上评估 [2511.11729]。但 MaaS 平台的生产推理集群通常使用 H100/H200/B200。关键问题:
论文声称所有配置下均为零 QoS violation [2511.11729],但实验条件值得审视:
Harli-TP(多 GPU tensor parallelism 扩展)仅获得 +10.2% 额外增益 [2511.11729],论文自己承认"单 GPU Harli 已捕获大部分空闲容量"。这意味着 Harli 的收益天花板受限于单 GPU 的 decode idle capacity——当 decode batch size 足够大使 SM 接近饱和时(如 H100 上 batch ≥ 256),co-location 的增益空间将急剧缩小甚至归零。论文没有分析这一临界点。
在 framework category survey 的 taxonomy 中 [2511.11729],Harli 占据了一个目前空白的格子:Stage=hybrid (serving+training) × Workload=batch (PEFT) × Layer=execution+scheduling。现有 category survey §8 的 Gap 分析已指出"Agentic Training (Stage=training × Workload=agentic)"是未探索组合,但 Harli 代表的"Inference + Training 同 GPU 共存"是更基础的技术前提——先解决资源共享,才能谈 workload 融合。
Framework category survey §9 没有"inference + finetune co-location"场景的推荐 [2511.11729]。Harli 填补了此空白:如果你的 MaaS 平台同时承载 decode-heavy 推理和小规模 PEFT 微调,且 decode 实例的 SM 利用率 < 50%,Harli 的方法论(SM profiling → LR prediction → GreenContext partitioning → CUDA VMM unified allocation)是当前唯一完整方案。 但前提是:(1) finetune 是 PEFT(非 full finetuning),(2) GPU 是 Ampere/Ada 架构,(3) decode batch size 不持续 >64。
Harli 的线性干扰模型依赖 PEFT 的固定 batch size [2511.11729]。Full finetuning 的 variable batch + larger memory footprint 将打破线性假设。但 DynaServe 的 micro-request 思路 [2504.09285]——将 finetuning iteration 拆分为 micro-steps,在任意边界暂停/恢复——可能将 Harli 的方法扩展到 full finetuning。需要的关键创新:用非线性预测器(如 JITServe 的 QRF [2504.20068])替代 LR,并将 finetuning 的 gradient checkpoint 与 inference 的 KV cache 统一到同一 VMM 池。
DualPath 收割 decode 的闲置 SNIC 带宽 [2602.21548],Harli 收割 decode 的闲置 SM 算力 [2511.11729]——两者攻击同一现象(decode underutilization)的不同资源维度。将两者组合:在 PD 分离架构中,decode 实例同时运行 (1) DualPath 的 KV-Cache relay(利用闲置 SNIC)和 (2) Harli 的 PEFT finetuning(利用闲置 SM),可以三重收割 decode 的闲置资源(SM + SNIC + HBM 空闲区间)。挑战在于三方争夺的 DRAM 带宽的统一调度——需要将 MFS 的 RMLQ 优先级调度 [2603.17456] 从网络层扩展到内存带宽层。
Harli 只处理单个 finetune 任务与单个 inference 实例的 co-location [2511.11729]。MaaS 平台上同时有数十个不同用户的 PEFT 微调任务排队。Scepsy 的 Aggregate Pipeline 思路 [2604.15186]——将多个异构 workload 的相对份额建模为稳定统计量——可以扩展 Harli 到 multi-tenant 场景:用 $(n_{ft_i}, p_{ft_i})$ 聚合每个 PEFT 任务的 SM 需求,统一搜索 (SM_infer, SM_{ft_1}, ..., SM_{ft_k}) 的最优分配。需要将 Scepsy 的分钟级搜索加速到 Harli 的 decode-step 级响应。
PPD 发现 append-prefill 与 full prefill 的 decode 干扰差一个数量级 [2603.13358],Harli 发现 PEFT finetuning 与 decode 的干扰可线性化 [2511.11729]。将两个 profiling 洞察统一:在 PD 分离架构的 decode 节点上,同时考虑 (1) 是否接受 append-prefill co-location(PPD 的决策)和 (2) 是否接受 PEFT co-location(Harli 的决策)。Joint scoring function 需要建模三方干扰(decode × append-prefill × PEFT),但如果各干扰项近似独立,可以用 PPD 的 $S$ 函数与 Harli 的 $Latency_{colo}$ 简单相乘。
TileRT/TokenSpeed 的 persistent Engine Kernel 将整个模型编译为单个长时间运行的 GPU kernel [2511.11729]。在此模式下 GreenContext 的 SM 分区机制是否仍然有效——或者是否需要 kernel 内部的 tile-level 资源让渡——是一个开放问题。如果 persistent kernel 可以在 tile boundary 暂停让出 SM(类似 GPUOS 的 preemptive scheduling),则 Harli 的 finetuning co-location 思路可以扩展到超低延迟推理引擎,填补 category survey §8 Gap 5(Persistent Kernel + Batching)的相邻空白。