| 相关实体 | 关系 | 关联维度 |
|---|---|---|
| RouteLLM (2406.18665) | 直接前驱 | OI-MAS 将 RouteLLM 的二元 strong/weak 路由扩展为多尺度、多角色、状态依赖的联合路由 |
| CASTER (2601.19793) | 并行工作 | 同期提出的 step-level neural routing,但面向 LangGraph 图结构 agent,用语义+元特征双分支网络 |
| Qualixar OS (2604.06392) | 架构扩展 | 三层 meta-learning 模型路由(bandit → strategy → POMDP),将路由嵌入 OS 级编排流水线 |
| Claude Code (2604.14228) | 设计验证 | "1.6% 决策 + 98.4% 基础设施"范式验证了 OI-MAS "大模型做核心推理、小模型做结构操作"的分配逻辑 |
| Kimi K2.6 (kimi-k2-6) | 异构编排 | Claw Groups 在产品级实现了异构 agent 编排,K2.6 做 coordinator 分发 task 到不同模型/设备 |
| Kimi K2.5 (2602.02276) | 训练方法 | PARL 框架冻结子 agent + RL 训练编排器,与 OI-MAS 的 conductor RL 训练思路高度相似 |
| Scepsy (2604.15186) | 系统层互补 | 解决"给多 LLM workflow 分配 GPU 资源"的 serving 层问题——OI-MAS 决定选什么模型,Scepsy 决定怎么高效服务 |
| Autellix (2502.13965) | 调度层互补 | program-level PLAS/ATLAS 调度确保 OI-MAS 这类多 call agent 不被 HoL blocking 阻塞 |
| vLLM Semantic Router | 部署层实现 | Signal-driven 路由引擎在系统层实现了多信号布尔表达式树决策,是 OI-MAS 学术思想的产品级落地方向 |
RouteLLM 训练轻量路由器将请求二元分派到 strong/weak 模型,threshold $\alpha$ 作为 cost-quality 旋钮 [2406.18665]。OI-MAS 在三个维度做了本质扩展:
但 RouteLLM 保有的优势:(a) 更轻量(MF router 155 req/s,6.4ms overhead)[2406.18665];(b) 已开源、已集成到 serving stack;(c) 跨模型族迁移能力强(GPT-4/Mixtral → Claude/Llama 无需重训)。OI-MAS 的路由网络需要在 target task 上 RL 训练,迁移仅限 MBPP→HumanEval 单一验证 [2601.04861]。
CASTER 同样做 step-level 路由,但路径截然不同:
| 维度 | OI-MAS | CASTER |
|---|---|---|
| 路由粒度 | per-turn, 多角色多模型联合 | per-node, 纯 strong/weak 二元 |
| 训练信号 | confidence (token log-prob) + RL reward | 合成难度标签 + on-policy negative feedback |
| 路由网络 | 双阶段 embedding similarity ($\mathcal{F}_\phi$, $\mathcal{G}_\psi$) | 双分支 fusion (semantic 1536d + meta 6d) |
| 环境 | benchmark reasoning tasks | LangGraph 工具调用 cyclic graph |
| 最大 cost reduction | 79.78% | 72.4% |
CASTER 的 on-policy negative feedback(路由失败时自动 relabel 为 Strong)是一个自改进飞轮 [2601.19793],而 OI-MAS 的 confidence-modulated cost penalty 是一个更优雅的连续信号。但 CASTER 在真实工具调用环境中验证(5 provider × 4 domain),OI-MAS 仅在学术 benchmark 上评测。
Qualixar OS 将模型路由嵌入一个 12-step 编排流水线,三层路由($\epsilon$-greedy bandit → 5 strategy → POMDP belief)[2604.06392] 比 OI-MAS 的双阶段路由在层次设计上更深。但 Qualixar OS 的自改进循环未达统计显著($p=0.578$)[2604.06392],而 OI-MAS 的 RL 训练能可靠地学到 difficulty-capacity 映射(Figure 5 单调性)。
核心差异:OI-MAS 聚焦"学出"最优路由策略,Qualixar OS 聚焦"工程覆盖"所有路由场景(cascade/cheapest/quality/balanced/POMDP)。前者研究深度优于后者,后者系统完整性优于前者。
Claude Code 的架构分析揭示了一个关键范式:frontier model 处理决策和核心推理,确定性基础设施处理 98.4% 的执行 [2604.14228]。OI-MAS 的实验数据与此一致——Generator 角色(核心推理)偏好 Llama3.1-70B,而 Programmer/Ensembler(结构化操作)集中在中小模型 [2601.04861]。
Kimi K2.6 的 Claw Groups 在工业规模实现了异构 agent 编排:K2.6 做 coordinator,子 agent 可跑不同模型/不同设备 [kimi-k2-6]。这验证了 OI-MAS 的理论方向在产品落地中是可行的,但 K2.6 通过长程 agentic RL(4000+ tool calls)实现 coordinator 能力,远超 OI-MAS 的 $L=4$ turns 设定。
K2.5 的 PARL 框架冻结子 agent + RL 训练编排器 [2602.02276],与 OI-MAS 的 "conductor" 概念直接对应——两者都把 sub-agent 视为固定环境,只训练 routing/orchestration 层。区别在规模:PARL 训练 100 sub-agent × 1500 步的 orchestrator RL,OI-MAS 仅路由 9 角色 × 4 模型 × 4 turns。OI-MAS 的学术 formalization 更清晰(Eq. 2-5 完整),PARL 的工程实现更强(产品部署级)。
OI-MAS 使用平均 token log-probability 作为唯一的 complexity proxy [2601.04861]。但 token log-prob 有已知陷阱:
CASTER 的做法更务实:直接从 routing 失败中学习(on-policy negative feedback),不依赖任何 confidence proxy 的准确性 [2601.19793]。
OI-MAS 用 API token pricing 做 cost proxy,且用跨模型族幂律外推($\alpha = 0.73$ from Llama 8B/70B pricing → Qwen 3B/7B estimation)[2601.04861]。这有三个问题:
OI-MAS 的消融承认:移除 Model Router 后全用大模型,accuracy 反而略升(MedQA +2.52%, MBPP +1.69%),cost 翻倍 [2601.04861]。这意味着 OI-MAS 的 accuracy 改善相对 uniform-large 基线实际上为负,其价值纯粹在 cost-accuracy trade-off。论文标题中 "outperforms baseline multi-agent systems" 的表述是基于 cost-unaware baselines 的比较。
OI-MAS 处于 "model routing for multi-agent" 这一新兴交叉领域的早期学术探索位置:
Query-level routing State-level routing
(inference 前决策) (reasoning 中动态调整)
Single-agent: RouteLLM, FrugalGPT —
Multi-agent: MasRouter OI-MAS, CASTER
Full OS: — Qualixar OS (三层 meta-learning)
Product-level: vLLM Semantic Router Claw Groups (K2.6)
OI-MAS 占据 "multi-agent + state-level" 象限的学术代表位置,但尚未跨越到产品级部署。
无采纳证据:论文无开源代码 [2601.04861],无 serving 集成,无第三方复现。相比之下,RouteLLM 已开源并集成到 lm-sys serving stack [2406.18665],vLLM Semantic Router 有 4.2k stars [vllm-project-semantic-router]。
产品化路径:若要落地,OI-MAS 需要与 Autellix 类调度器集成(解决 program-level HoL blocking [2502.13965])+ Scepsy 类资源分配器(解决 multi-LLM GPU scheduling [2604.15186])+ vLLM Semantic Router 类网关(解决 signal-driven 路由部署)。当前是纯学术原型。
OI-MAS 发表时间与 CASTER 并行(都是 2026-01),方法独立发展但问题意识趋同。Qualixar OS 和 K2.6 在 3 个月后推出更完整的产品级方案,可能已吸收了 OI-MAS/CASTER 的思想。
OI-MAS 只用 token log-prob,CASTER 用 semantic embedding + meta feature,Qualixar OS 用 POMDP belief state。未来方向:融合多种 uncertainty signal(token entropy、sampling consistency、attention pattern divergence、external verifier feedback)构建更鲁棒的 complexity estimator。从 vLLM Semantic Router 的 20+ signal types 布尔表达式树设计 [vllm-project-semantic-router] 可获得工程参考。
OI-MAS 的 $L=4$ turns 远不够。结合 K2.6 的长程 RL(4000+ tool calls, 12-13 小时)[kimi-k2-6],能否训练在数百甚至数千步 horizon 上的 routing policy?关键挑战:routing decision 的 credit assignment 在长序列上极其困难。PARL 的 annealed auxiliary reward [2602.02276] 提供了一种分层 reward 设计参考。
OI-MAS 假设模型随叫随到、延迟恒定。现实中模型 serving 有 batching delay、preemption、KV cache eviction 等因素。将 OI-MAS 的 model selection 与 Scepsy 的 GPU scheduling [2604.15186] 或 Autellix 的 program-aware scheduling [2502.13965] 联合优化,能实现 routing-aware serving + serving-aware routing 的闭环。
OI-MAS 的路由策略在训练后固定。CASTER 的 negative feedback loop [2601.19793] 和 Qualixar OS 的 Forge→Judge→RL 循环 [2604.06392] 都尝试了在线自改进。但 Qualixar OS 的循环未达统计显著。如何设计一个既能在线学习又不会 Goodhart collapse 的路由自改进机制,是重要的开放问题。
K2.6 Claw Groups 已支持"子 agent 部署在 laptop/手机/云"[kimi-k2-6]。当模型选择不仅取决于 task complexity 还取决于 available hardware(edge GPU vs cloud GPU)、网络延迟、隐私约束时,路由问题变成一个 context-dependent multi-objective optimization。Claude Code 的 graduated trust model(7 modes × 7 security layers)[2604.14228] 在安全维度提供了类似的分层决策框架参考。