| ID | 名称 | 关联理由 |
|---|---|---|
| 2603.04428 | Agent Memory Q4 | 同一平台 (Apple Silicon M4) 的深度互补工作:vllm-mlx 做 serving + batching,Agent Memory Q4 做 persistent cross-session KV 以 4-bit 格式 |
| 2506.03296 | APEX | CPU-GPU hybrid inference for constrained GPUs;与 Apple Silicon 的 UMA 形成对比——discrete GPU + CPU offload vs unified memory |
| 2411.01142 | NEO | APEX 的 baseline;Asymmetric Pipelining for CPU-GPU LLM inference,与 UMA 的 zero-copy 形成根本架构对比 |
vllm-mlx vs Agent Memory Q4 [2603.04428]:两者在 Apple Silicon 上形成完美的上下层互补。vllm-mlx 提供 serving layer (continuous batching, OpenAI API, content-based prefix caching);Agent Memory Q4 提供 persistence layer (Q4 KV cache 写入 SSD,跨 session 恢复)。vllm-mlx 的 prefix cache 是 in-memory ephemeral (进程退出即丢失),而 Agent Memory Q4 实现 disk-persistent KV [2603.04428]。
矛盾点: Agent Memory Q4 报告 "vs vllm-mlx: 4K 下 Q4 warm TTFT (290 ms) 与 FP16 prefix cache (290 ms) 完全持平" [2603.04428]——即在短 context 下 Q4 持久化没有 TTFT 优势。但在 16K+ context 下 FP16 prefix 因内存不足失败,而 Q4 仍可工作。这说明两者的适用区间不同:vllm-mlx prefix cache 优于 short context + high concurrency;Agent Memory Q4 优于 long context + cross-session persistence。
vllm-mlx vs APEX [2506.03296]:APEX 在 constrained discrete GPUs (T4 16GB, A10 24GB) 上通过 CPU-GPU Asynchronous Overlap 将 decode attention offload 到 CPU,实现 96% throughput gain over vLLM。其核心挑战是 CPU-GPU 性能 gap (18×) 和 PCIe 传输延迟。Apple Silicon UMA 从根本上消除了这两个问题:(1) GPU 和 CPU 共享物理内存,zero-copy;(2) 无需显式 data transfer over PCIe。vllm-mlx 无需 APEX 的复杂异步调度——UMA 让所有 tensor 对所有处理器即时可见 [2601.19139]。
然而 APEX 在 datacenter 场景支持 multi-tenant serving (vLLM continuous batching baseline),而 vllm-mlx 限于单设备 (最多 16 concurrent requests on M4 Max)。Scale 上存在根本差异。
vllm-mlx vs NEO:NEO 的 Asymmetric Pipelining 将 batch 切分为 CPU 和 GPU sub-batches 并行执行。APEX 已论证此方案在 decode-heavy 下失败。在 Apple Silicon 上,NEO 式 split 完全不必要——UMA 消除了 data movement 成本,所有计算直接访问共享内存。NEO 对 Apple Silicon 的启示不在于其方法,而在于其失败模式:任何依赖 CPU-GPU split 的方案在 UMA 架构上都过度设计。
vllm-mlx 填补了一个精确的市场空白:Apple Silicon 上的 unified text+multimodal serving with vision caching。其对标不是 datacenter 系统 (vLLM, SGLang) 而是 edge serving alternatives (llama.cpp, mlx-lm, vLLM-metal)。
采纳信号:开源 (github.com/waybarrios/vllm-mlx),OpenAI-compatible API 使迁移成本为零。适合 developer-facing 的本地 AI agent 部署 (LangChain/CrewAI 直接接入)。
局限:macOS-only, model support 依赖 MLX community, 不支持 tensor parallelism。Agent Memory Q4 的 persistent cache 是其自然的下一步集成目标。