| 相关实体 | 关系类型 | 关联维度 |
|---|---|---|
| RouteLLM (2406.18665) | 直接 baseline | 二元路由(strong/weak);preference-based vs. difficulty-based 的对比 |
| OI-MAS (2601.04861) | Concurrent work | 同期提出的 confidence-aware 路由;hierarchical role+model 路由 vs. CASTER 的 flat dual-signal |
| Qualixar OS (2604.06392) | 上层编排 | 三层 meta-learning 路由(bandit + POMDP)—— 提供 CASTER 可嵌入的更广泛系统框架 |
| vLLM Semantic Router | System-level routing | 20+ 信号类型布尔表达式树驱动,运维级路由层 vs. CASTER 的应用级 per-step 路由 |
| Claude Code (2604.14228) | Agent architecture context | "1.6% 决策逻辑 + 98.4% 基础设施"范式——routing 在整体 agent 系统中的位置 |
| Autellix (2502.13965) | Serving-level scheduling | Program-level 调度(PLAS/ATLAS)——与 CASTER 互补:一个优化"选哪个模型",一个优化"选哪个请求先服务" |
| Scepsy (2604.15186) | Multi-LLM serving | Aggregate LLM Pipeline 利用相对份额稳定性做 GPU 分配——CASTER 的路由决策是其上层客户 |
| Orla (2603.13605) | Workflow-level serving | OneBitStageMapper(simple/complex 二分路由)与 CASTER 的 dual-signal router 直接可比 |
关联逻辑: CASTER 位于 "model routing for multi-agent systems" 这一子领域。其上游是 agent 编排系统(Qualixar OS, Claude Code 式 agent loop)提供 workflow context, 其下游是 serving 引擎(Autellix, Scepsy)负责实际调度和资源分配。RouteLLM 和 OI-MAS 是最直接的算法竞品, Orla 的 OneBitStageMapper 是最近的功能等价物。
| 维度 | RouteLLM | CASTER | Delta |
|---|---|---|---|
| 路由粒度 | Per-query (single-shot, stateless) | Per-step (context-aware, within cyclic graph) | CASTER 在多轮 workflow 中逐步路由, 而非一次性决定 |
| 训练信号 | Human preference (Chatbot Arena 80K battles) | Synthetic cold-start + on-policy negative feedback | CASTER 不依赖人工偏好数据, 用自身失败作为训练信号 |
| 路由特征 | Query text only (via embedding) | Semantic embedding + 6-dim meta-vector (role, context length, keywords) | CASTER 加入结构化元信息, 但信息量很小 (6-dim vs. 1536-dim) |
| 适用场景 | 独立 single-turn queries | 循环图内多 agent multi-turn workflows | CASTER 针对 MAS 中的 cascading failure 问题 |
| 验证规模 | MT-Bench, MMLU, GSM8K (标准 NLP benchmarks) | 4 domain-specific agent tasks (custom) | RouteLLM 在标准 benchmark 上更可比, CASTER 在 agent 场景但缺乏标准化 |
| 跨模型迁移 | ✓ 无需重训练 (GPT-4 → Claude 3 / Llama 3.1) | ✗ 未验证跨模型迁移 | RouteLLM 的关键优势: 学习 query-intrinsic complexity |
| 开源状态 | ✓ 开源 (github.com/lm-sys/RouteLLM) | ✗ 未公开 | RouteLLM 可复现性远优 |
核心 delta: CASTER 将 RouteLLM 的二元路由从 per-query 扩展到 per-step within cyclic agent graphs, 加入 role/context 结构信号, 并用 on-policy 方法替代 preference 依赖。但代价是丧失了 RouteLLM 的跨模型迁移能力和可复现性。
| 维度 | OI-MAS | CASTER | Delta |
|---|---|---|---|
| 路由架构 | Hierarchical: Role Router → Model Router (两步) | Flat: Dual-Branch → binary strong/weak decision (一步) | OI-MAS 同时选择 "做什么" 和 "用什么", CASTER 只选 "用什么" |
| Difficulty signal | Token log-prob confidence (runtime, from model output) | Semantic embedding + meta features (pre-execution prediction) | OI-MAS 在执行后获取信号, CASTER 在执行前预测——互为 pre/post decision |
| Model pool | N-way: 4 models (3B/7B/8B/70B) | Binary: strong vs. weak | OI-MAS 粒度更细, 但搜索空间更大 |
| Training | RL with confidence-modulated cost penalty | Supervised BCE + on-policy negative feedback relabeling | OI-MAS 端到端 RL, CASTER 两阶段监督 |
| 可变角色集 | ✓ 9 roles, EarlyStop, variable per-turn | ✗ 固定 agent graph topology | OI-MAS 的动态性远高于 CASTER |
| 成本模型 | API pricing proxy with power-law extrapolation | Direct token cost measurement | 两者都依赖 API 定价, 非真实计算成本 |
| Benchmark | MATH, GSM8K, MedQA, GPQA, MBPP (标准化) | Custom 4-domain agent tasks | OI-MAS 可比性优于 CASTER |
核心 delta: CASTER 和 OI-MAS 是 concurrent works (2026-01) 攻击同一问题但路径不同。CASTER 更简单 (binary decision, supervised learning), OI-MAS 更 expressive (hierarchical, RL, N-way)。CASTER 的独特贡献是 "在执行前预测难度" (predictive), 而 OI-MAS 是 "在执行后用 confidence 校正" (reactive)——两者理论上可组合。
Qualixar OS 的三层路由 (ε-greedy bandit → 5 strategies → POMDP belief) 远比 CASTER 的 dual-branch sigmoid 复杂 [2604.06392]。但 Qualixar OS 的路由是 per-task 而非 per-step; 在 workflow execution 期间不会重新路由各 agent node。CASTER 的 per-step granularity 可作为 Qualixar OS 的 strategy layer 下的一个 execution-time 补充。
矛盾点: Qualixar OS 的自改进循环统计不显著 ($p=0.578$) [2604.06392], 而 CASTER 声称 on-policy training 有效但缺乏 ablation。两者都未能令人信服地证明自适应训练循环在小数据量下收敛。
Orla 的 OneBitStageMapper 是最近在 workflow-level serving 中实现的功能等价物: 用轻量 LLM 将请求分为 simple/complex 再路由到不同规模模型 [2603.13605]。结果: SWE-bench Lite 上 -38% wall-clock time, -35% cost。与 CASTER 的差异:
vLLM Semantic Router 是基础设施级路由 (Envoy ExtProc sidecar), 关注 20+ 异构信号 (jailbreak, PII, domain, complexity, authz 等) 的可组合布尔表达式路由 [vllm-project-semantic-router]。与 CASTER 的定位差异:
两者是互补的: Semantic Router 处理合规/安全/多模态路由, CASTER 处理 cost-quality optimization within a single agent workflow。
CASTER 的 "72.4% cost reduction" 来自单一最佳单元格 (OpenAI/Software, Table 1) [2601.19793]。实际跨域分布为 6.2%–72.4%, Security/Qwen 仅 6.2%。论文的 headline 选择了最极端的数据点, 而非报告中位数或几何平均值。对比之下, RouteLLM 报告 "2× cost savings" 使用的是中位操作点 [2406.18665]。
根源: CASTER 的价值主张完全依赖于 strong/weak 模型的价格差距。当差距消失 (DeepSeek R1/V3 同价), 系统价值归零甚至为负 (-12.4%)。这不是一个 robust 的 efficiency claim。
论文声称 "on-policy negative feedback outperforms random exploration" (§3.3, Contribution #3) [2601.19793], 但从未在任何结果表中展示 random-exploration 对照组。OI-MAS 至少提供了完整的 ablation (removing confidence: −2.52% to −4.20%) [2601.04861]。CASTER 对其最独特贡献的实证支撑是声明式的而非定量的。
CASTER 在 Science (95.3 vs 95.2) 和 Security (86.2 vs 85.5) 上超过 Force Strong [2601.19793]。论文将此归因于"避免 strong model over-thinking on simple sub-tasks"。但:
GPT-4o 同时用作 (1) Dynamic Task Generator 生成训练数据, (2) Agent 执行中的 Strong Model, (3) LLM-as-a-Judge 评审 [2601.19793]。三重角色的循环偏差:
RouteLLM 使用独立的 human preference data (Chatbot Arena) 训练, MT-Bench 评估 [2406.18665] ——source separation 更清洁。OI-MAS 使用独立 benchmark (MATH, MBPP 等) 评估 RL-trained policy, 不涉及生成训练数据的同一模型做 evaluation [2601.04861]。
CASTER 强调 "Dual-Signal" (semantic + structural) 是核心创新 [2601.19793], 但 semantic branch ($D_{in}=1536$) 提供的信息量远超 meta branch ($D_{meta}=6$: 4-dim one-hot + 1 scalar + 1 binary)。无 ablation 表明移除 meta branch 后性能变化多大。对比 OI-MAS 的 ablation 清晰展示了每个组件的边际贡献 [2601.04861]。
CASTER 在 4 个自建 domain 的 20 tasks/domain 上评估, 无一个标准 benchmark (SWE-bench, HumanEval, MATH, MMLU)。对比:
CASTER 的结果无法与任何已有系统直接对比, 严重限制了其 claims 的外部效度。
Per-query routing Per-step routing (within workflow)
───────────────── ──────────────────────────────────
Binary (2-model) RouteLLM CASTER, Orla OneBitStageMapper
N-way (multi-model) Qualixar OS (task-level) OI-MAS (multi-turn)
Signal-driven vLLM Semantic Router (unexplored)
Serving-level — Autellix (PLAS), Scepsy (pipeline)
CASTER 占据 "binary per-step routing for MAS" 这一 niche——比 RouteLLM 的 per-query 更细粒度, 比 OI-MAS 的 hierarchical RL 更简单, 比 Qualixar OS 的 multi-strategy 更轻量。
Adoption barriers:
Paradigm-shift assessment: CASTER 是 incremental refinement 而非 paradigm shift。RouteLLM 建立了 "binary strong/weak routing" 范式 [2406.18665]; CASTER 将其从 single-query 扩展到 multi-step, 这是 scope expansion 而非方法论革新。真正的 paradigm shift 来自:
CASTER (pre-execution prediction) 和 OI-MAS (post-execution confidence calibration) 是互补信号 [2601.04861] [2601.19793]。未被探索的组合:
CASTER 的路由决策完全不考虑下游 serving 状态 (GPU 负载, KV cache occupancy, queue depth)。结合 Autellix 的 program-level scheduling [2502.13965] 和 Scepsy 的 aggregate pipeline 预测 [2604.15186]:
Binary (strong/weak) 过于粗糙; OI-MAS 的 4-model pool 是进步但仍人工选定。未探索方向:
vLLM Semantic Router 证明 safety signals (jailbreak, PII) 应是路由一等公民 [vllm-project-semantic-router]。Agent workflow 中的安全路由需求:
Claude Code 的 5 层上下文压缩管道 [2604.14228] 意味着 router 看到的 "context" 随 compaction 程度变化。未探索:
Scepsy 证明 "relative LLM time share is stable across workflow instances" [2604.15186]。这意味着: