OI-MAS: Orchestrating Intelligence — Confidence-Aware Routing for Efficient Multi-Agent Collaboration across Multi-Scale Models

agent 2601.04861 — Cross-paper Synthesis

OI-MAS: Cross-Paper Comparative Analysis — L3 #

§1 相关论文 #

相关实体关系关联维度
RouteLLM (2406.18665)直接前驱OI-MAS 将 RouteLLM 的二元 strong/weak 路由扩展为多尺度、多角色、状态依赖的联合路由
CASTER (2601.19793)并行工作同期提出的 step-level neural routing,但面向 LangGraph 图结构 agent,用语义+元特征双分支网络
Qualixar OS (2604.06392)架构扩展三层 meta-learning 模型路由(bandit → strategy → POMDP),将路由嵌入 OS 级编排流水线
Claude Code (2604.14228)设计验证"1.6% 决策 + 98.4% 基础设施"范式验证了 OI-MAS "大模型做核心推理、小模型做结构操作"的分配逻辑
Kimi K2.6 (kimi-k2-6)异构编排Claw Groups 在产品级实现了异构 agent 编排,K2.6 做 coordinator 分发 task 到不同模型/设备
Kimi K2.5 (2602.02276)训练方法PARL 框架冻结子 agent + RL 训练编排器,与 OI-MAS 的 conductor RL 训练思路高度相似
Scepsy (2604.15186)系统层互补解决"给多 LLM workflow 分配 GPU 资源"的 serving 层问题——OI-MAS 决定选什么模型,Scepsy 决定怎么高效服务
Autellix (2502.13965)调度层互补program-level PLAS/ATLAS 调度确保 OI-MAS 这类多 call agent 不被 HoL blocking 阻塞
vLLM Semantic Router部署层实现Signal-driven 路由引擎在系统层实现了多信号布尔表达式树决策,是 OI-MAS 学术思想的产品级落地方向

§2 本篇 vs 相关论文的 delta #

2.1 相对 RouteLLM:从二元到多尺度、从 query-level 到 state-level #

RouteLLM 训练轻量路由器将请求二元分派到 strong/weak 模型,threshold $\alpha$ 作为 cost-quality 旋钮 [2406.18665]。OI-MAS 在三个维度做了本质扩展:

  1. 从 2 模型到 N 模型:RouteLLM 是 $P(\text{win}_s \mid q) \geq \alpha$ 的二元门;OI-MAS 的 Model Router $\mathcal{G}_\psi$ 对每个候选模型 $m_j$ 输出适配分数,从 4 模型池中 argmax 选择 [2601.04861]
  2. 从 query-level 到 state-level:RouteLLM 在 inference 前一次性决定,不随推理展开调整 [2406.18665]。OI-MAS 在每个 reasoning turn $t$ 重新评估 $s_t = (q, c_t)$ 并动态调整 [2601.04861]
  3. 联合角色+模型路由:RouteLLM 不涉及角色选择(single-agent setting);OI-MAS 引入 Role Router $\mathcal{F}_\phi$ 实现 "what to do" 与 "how much capacity" 的解耦 [2601.04861]
  4. 但 RouteLLM 保有的优势:(a) 更轻量(MF router 155 req/s,6.4ms overhead)[2406.18665];(b) 已开源、已集成到 serving stack;(c) 跨模型族迁移能力强(GPT-4/Mixtral → Claude/Llama 无需重训)。OI-MAS 的路由网络需要在 target task 上 RL 训练,迁移仅限 MBPP→HumanEval 单一验证 [2601.04861]

    2.2 相对 CASTER:结构对位但训练信号不同 #

    CASTER 同样做 step-level 路由,但路径截然不同:

    维度OI-MASCASTER
    路由粒度per-turn, 多角色多模型联合per-node, 纯 strong/weak 二元
    训练信号confidence (token log-prob) + RL reward合成难度标签 + on-policy negative feedback
    路由网络双阶段 embedding similarity ($\mathcal{F}_\phi$, $\mathcal{G}_\psi$)双分支 fusion (semantic 1536d + meta 6d)
    环境benchmark reasoning tasksLangGraph 工具调用 cyclic graph
    最大 cost reduction79.78%72.4%

    CASTER 的 on-policy negative feedback(路由失败时自动 relabel 为 Strong)是一个自改进飞轮 [2601.19793],而 OI-MAS 的 confidence-modulated cost penalty 是一个更优雅的连续信号。但 CASTER 在真实工具调用环境中验证(5 provider × 4 domain),OI-MAS 仅在学术 benchmark 上评测。

    2.3 相对 Qualixar OS:从 routing 到 full OS #

    Qualixar OS 将模型路由嵌入一个 12-step 编排流水线,三层路由($\epsilon$-greedy bandit → 5 strategy → POMDP belief)[2604.06392] 比 OI-MAS 的双阶段路由在层次设计上更深。但 Qualixar OS 的自改进循环未达统计显著($p=0.578$)[2604.06392],而 OI-MAS 的 RL 训练能可靠地学到 difficulty-capacity 映射(Figure 5 单调性)。

    核心差异:OI-MAS 聚焦"学出"最优路由策略,Qualixar OS 聚焦"工程覆盖"所有路由场景(cascade/cheapest/quality/balanced/POMDP)。前者研究深度优于后者,后者系统完整性优于前者。

    2.4 相对 Claude Code / Kimi K2.6:产品级验证 #

    Claude Code 的架构分析揭示了一个关键范式:frontier model 处理决策和核心推理,确定性基础设施处理 98.4% 的执行 [2604.14228]。OI-MAS 的实验数据与此一致——Generator 角色(核心推理)偏好 Llama3.1-70B,而 Programmer/Ensembler(结构化操作)集中在中小模型 [2601.04861]

    Kimi K2.6 的 Claw Groups 在工业规模实现了异构 agent 编排:K2.6 做 coordinator,子 agent 可跑不同模型/不同设备 [kimi-k2-6]。这验证了 OI-MAS 的理论方向在产品落地中是可行的,但 K2.6 通过长程 agentic RL(4000+ tool calls)实现 coordinator 能力,远超 OI-MAS 的 $L=4$ turns 设定。

    2.5 相对 PARL (K2.5):训练思路同源,规模悬殊 #

    K2.5 的 PARL 框架冻结子 agent + RL 训练编排器 [2602.02276],与 OI-MAS 的 "conductor" 概念直接对应——两者都把 sub-agent 视为固定环境,只训练 routing/orchestration 层。区别在规模:PARL 训练 100 sub-agent × 1500 步的 orchestrator RL,OI-MAS 仅路由 9 角色 × 4 模型 × 4 turns。OI-MAS 的学术 formalization 更清晰(Eq. 2-5 完整),PARL 的工程实现更强(产品部署级)。


    §3 可攻击面 #

    3.1 Confidence 信号的脆弱性 #

    OI-MAS 使用平均 token log-probability 作为唯一的 complexity proxy [2601.04861]。但 token log-prob 有已知陷阱:

    • Overconfident wrong answers:模型在错误推理路径上可以产生非常高的 token 概率(fluent but wrong),导致系统误判为"简单"并分配小模型。
    • 未与 entropy/consistency 等替代信号对比:sampling-based consistency(多次采样后的一致性)是更鲁棒的 complexity estimator,论文未做消融。
    • 跨模型 calibration 不可靠:Appendix B 的 percentile normalization 假设 per-model log-prob 分布稳定,但在分布偏移下(OOD 输入)校准可能崩溃。

    CASTER 的做法更务实:直接从 routing 失败中学习(on-policy negative feedback),不依赖任何 confidence proxy 的准确性 [2601.19793]

    3.2 Cost 模型的粗糙性 #

    OI-MAS 用 API token pricing 做 cost proxy,且用跨模型族幂律外推($\alpha = 0.73$ from Llama 8B/70B pricing → Qwen 3B/7B estimation)[2601.04861]。这有三个问题:

    1. 经济成本 ≠ 计算成本:local inference 的真实成本取决于 GPU utilization、batching、KV cache overhead——与 API pricing 完全不同。
    2. 跨族外推无效:Llama 和 Qwen 的 architecture efficiency 不同(MLA vs GQA, MoE vs dense),pricing ratio 不可迁移。
    3. 忽略调度效应:Scepsy 的实验表明,同一模型在不同 TP/fraction/replica 配置下吞吐-延迟曲线差异巨大 [2604.15186]——"cost per model" 是部署配置的函数,不是固定常数。
    4. 3.3 Scale 的局限性 #

      • $L=4$ turns 远低于真实 agentic workload(Claude Code 会话数百 turn,K2.6 rollout 4000+ tool calls)。OI-MAS 未证明其路由策略在更长 horizon 下是否稳定。
      • 9 角色 × 4 模型 的组合空间极小。Qualixar OS 支持 236+ 模型 × 12 种拓扑 [2604.06392]。OI-MAS 的方法在模型池扩大到几十个时可能遇到 embedding space 拥挤问题。
      • 无 tool-use:所有 benchmark 都是纯文本推理(GSM8K/MATH/MedQA/GPQA/MBPP),不涉及工具调用。CASTER 和 Qualixar OS 都在 tool-calling 环境中验证。

      3.4 "Slightly worse than all-large" 的诚实问题 #

      OI-MAS 的消融承认:移除 Model Router 后全用大模型,accuracy 反而略升(MedQA +2.52%, MBPP +1.69%),cost 翻倍 [2601.04861]。这意味着 OI-MAS 的 accuracy 改善相对 uniform-large 基线实际上为,其价值纯粹在 cost-accuracy trade-off。论文标题中 "outperforms baseline multi-agent systems" 的表述是基于 cost-unaware baselines 的比较。


      §4 生态位 #

      4.1 范式定位 #

      OI-MAS 处于 "model routing for multi-agent" 这一新兴交叉领域的早期学术探索位置:

      
                          Query-level routing          State-level routing
                          (inference 前决策)           (reasoning 中动态调整)
                          
      Single-agent:       RouteLLM, FrugalGPT          —
                          
      Multi-agent:        MasRouter                    OI-MAS, CASTER
                          
      Full OS:            —                            Qualixar OS (三层 meta-learning)
                          
      Product-level:      vLLM Semantic Router         Claw Groups (K2.6)
      

      OI-MAS 占据 "multi-agent + state-level" 象限的学术代表位置,但尚未跨越到产品级部署。

      4.2 采纳证据与障碍 #

      无采纳证据:论文无开源代码 [2601.04861],无 serving 集成,无第三方复现。相比之下,RouteLLM 已开源并集成到 lm-sys serving stack [2406.18665],vLLM Semantic Router 有 4.2k stars [vllm-project-semantic-router]

      产品化路径:若要落地,OI-MAS 需要与 Autellix 类调度器集成(解决 program-level HoL blocking [2502.13965])+ Scepsy 类资源分配器(解决 multi-LLM GPU scheduling [2604.15186])+ vLLM Semantic Router 类网关(解决 signal-driven 路由部署)。当前是纯学术原型。

      4.3 时间线评估 #

      • 2024.06: RouteLLM — binary routing with preference data
      • 2026.01: OI-MAS — multi-scale state-dependent routing (本文)
      • 2026.01: CASTER — dual-signal step-level routing for LangGraph
      • 2026.04: Qualixar OS — three-layer routing in full agent OS
      • 2026.04: Kimi K2.6 Claw Groups — product-level heterogeneous orchestration

      OI-MAS 发表时间与 CASTER 并行(都是 2026-01),方法独立发展但问题意识趋同。Qualixar OS 和 K2.6 在 3 个月后推出更完整的产品级方案,可能已吸收了 OI-MAS/CASTER 的思想。


      §5 未探索方向 #

      5.1 Confidence signal 多源融合 #

      OI-MAS 只用 token log-prob,CASTER 用 semantic embedding + meta feature,Qualixar OS 用 POMDP belief state。未来方向:融合多种 uncertainty signal(token entropy、sampling consistency、attention pattern divergence、external verifier feedback)构建更鲁棒的 complexity estimator。从 vLLM Semantic Router 的 20+ signal types 布尔表达式树设计 [vllm-project-semantic-router] 可获得工程参考。

      5.2 Long-horizon 路由策略 #

      OI-MAS 的 $L=4$ turns 远不够。结合 K2.6 的长程 RL(4000+ tool calls, 12-13 小时)[kimi-k2-6],能否训练在数百甚至数千步 horizon 上的 routing policy?关键挑战:routing decision 的 credit assignment 在长序列上极其困难。PARL 的 annealed auxiliary reward [2602.02276] 提供了一种分层 reward 设计参考。

      5.3 路由与 serving 的联合优化 #

      OI-MAS 假设模型随叫随到、延迟恒定。现实中模型 serving 有 batching delay、preemption、KV cache eviction 等因素。将 OI-MAS 的 model selection 与 Scepsy 的 GPU scheduling [2604.15186] 或 Autellix 的 program-aware scheduling [2502.13965] 联合优化,能实现 routing-aware serving + serving-aware routing 的闭环。

      5.4 自改进的路由策略 #

      OI-MAS 的路由策略在训练后固定。CASTER 的 negative feedback loop [2601.19793] 和 Qualixar OS 的 Forge→Judge→RL 循环 [2604.06392] 都尝试了在线自改进。但 Qualixar OS 的循环未达统计显著。如何设计一个既能在线学习又不会 Goodhart collapse 的路由自改进机制,是重要的开放问题。

      5.5 异构硬件感知路由 #

      K2.6 Claw Groups 已支持"子 agent 部署在 laptop/手机/云"[kimi-k2-6]。当模型选择不仅取决于 task complexity 还取决于 available hardware(edge GPU vs cloud GPU)、网络延迟、隐私约束时,路由问题变成一个 context-dependent multi-objective optimization。Claude Code 的 graduated trust model(7 modes × 7 security layers)[2604.14228] 在安全维度提供了类似的分层决策框架参考。