SkillRouter 处于 agent skill lifecycle 的 retrieval/selection 阶段 [2605.07358],解决 ~80K-skill pool 中的 upstream routing 问题 [2603.22455]。以下四篇论文从不同角度与其形成关联:
| 论文 | 关系类型 | 关联理由 |
|---|---|---|
| SkillsInjector (2605.29794) | 直接竞争 + 下游扩展 | 同样解决 skill selection,但将问题重定义为 per-task context construction 而非 retrieval。在 tau2-telecom 和 SkillsBench 上直接以 SkillRouter 作为 baseline [2605.29794] |
| SkillReducer (2603.29919) | 正交互补 | 解决 skill 文本本身的 token 效率问题。SkillRouter 依赖 full skill text 进行 routing [2603.22455];SkillReducer 压缩该文本并声称 less-is-more [2603.29919] |
| MOCHA (2605.19330) | 上游互补 | 在 lifecycle 上游优化 skill 文本本身(correctness vs compliance),其输出可直接改变 SkillRouter 的检索输入质量 [2605.19330] |
| Survey (2605.07358) | 框架定位 | 提供 4-stage lifecycle taxonomy (representation → acquisition → retrieval/selection → evolution),将 SkillRouter 定位为 retrieval 阶段的 dense retrieval paradigm [2605.07358] |
这四篇与 SkillRouter 共同覆盖了 skill pipeline 的选取-注入-优化-压缩四个维度,形成一个可以端到端审视的 cluster。
SkillRouter 的核心假设是 full-text retrieval 信号足以完成 routing——用 bi-encoder embedding similarity + listwise cross-encoder reranking 实现 74.0% Hit@1 [2603.22455]。SkillsInjector 则直接挑战这一假设:它的 Context Planner 使用 execution-grounded utility $\Delta(t,s)$ 而非表面相似性进行打分 [2605.29794]。关键证据——surface-similar skills 可以具有负 $\Delta$(如 insurance keyword distractor $\Delta = -0.20$)[2605.29794]——表明 embedding similarity 在 topically homogeneous pool 中可能系统性地选错 skill。
量化 delta:SkillsInjector 在 SkillsBench 上 22.6% vs SkillRouter 的 16.5% (+6.1pp) [2605.29794]。但代价不对称:SkillRouter 是一个 1.2B 参数的推理-only 管线(496ms 延迟),而 SkillsInjector 需要 execution rollout 数据生成(~240 H200 GPU-hours)[2605.29794] 加 8B renderer inference。SkillRouter 的优势在于 zero execution-data dependency——它在新 domain 上即时部署,而 SkillsInjector 需要从头重做 $\Delta$ 标注。
SkillRouter 的 motivational anchor 是 full-text access 的必要性:隐藏 skill body 导致 31–44pp Hit@1 下降 [2603.22455]。SkillReducer 则发现 body 中 61.5% 的内容是 non-actionable 的(background, example, template, redundant),压缩 39% 后反而提升 agent performance 2.8% [2603.29919]。
矛盾根源: 两者测量的是不同的东西。SkillRouter 测量 routing accuracy(retrieval 阶段需要 full text 作为 embedding 信号),SkillReducer 测量 execution quality(agent 推理阶段不需要冗余 context)。两者在各自实验范围内都正确,但 SkillRouter 隐含地将 "routing 需要 full text" 推广为 "agent 需要 full text",这个推广不成立。一个自然推论:routing 阶段用 full text embedding,injection 阶段用 compressed text,可以同时获益。
SkillRouter 将 skill pool 视为静态输入 [2603.22455];MOCHA 将 skill text 视为可优化对象,在 correctness vs compliance 的 Pareto front 上搜索 [2605.19330]。MOCHA 的实验显示 skill 优化可以带来 +7.5% relative correctness gain,同时 body compliance 从 .83 降到 .33 [2605.19330]。
这对 SkillRouter 构成一个 upstream constraint:如果 MOCHA 优化后的 skill body 超出 SkillRouter 的 truncation budget(encoder 2,500 chars, reranker 2,000 chars),routing 准确率可能下降。反过来,如果 SkillRouter 的 truncation 不影响 MOCHA-optimized skills 的 discriminative signal,则两者可以无缝组合。目前缺乏交叉验证数据。
Survey 将 skill selection 细分为 context-aware / composition / cost-utility / feedback-driven 四种范式 [2605.07358]。SkillRouter 是纯 context-aware retrieval——它不考虑 skill 之间的组合效应、token 成本、或执行反馈。SkillsInjector 的 planner 属于 cost-utility 范式(execution-grounded scoring),其 renderer 属于 composition-aware(co-injection adaptation)。Survey 的分类揭示 SkillRouter 覆盖了 selection space 的一个象限,而非全面方案。
SkillRouter 的 bi-encoder + cross-encoder pipeline 本质上是 semantic similarity maximization,即使使用了 listwise loss。SkillsInjector 提供了直接反证:在 tau2-bench 的 telecom domain,SkillRouter 作为 baseline 被超过 4.2pp [2605.29794]。根本原因是 embedding similarity 无法区分 "topically related but execution-harmful" 的 skill——false-negative filtering [2603.22455] 处理的是 functionally equivalent skills(应该都是正例),而非 topically similar but functionally harmful skills(应该是负例但 embedding 认为是正例)。
SkillRouter 的 downstream task success gain 仅为 +1.78pp(27.56% vs 25.78%)[2603.22455]。Gold-skill ceiling 为 32.67%,意味着 routing 改进能带来的最大 delta 约为 7pp,而 SkillRouter 只兑现了其中 25%。此外,top-1 和 top-10 retrieval 产生几乎相同的 downstream success(27.56% vs 27.78%),暗示 downstream agent 本身是瓶颈而非 routing 精度。这削弱了 "better routing → better agent" 的论证链条。
SkillRouter 的 primary benchmark(75 queries, ~80K pool)和 SkillBench-Supp(256 queries, 77K pool)均为作者自建 [2603.22455]。两个 benchmark 使用不同 LLM/prompt 生成但共享相同的 pool 构建方法论。SkillsBench(SkillReducer 和 SkillsInjector 共用的 external benchmark)上 SkillsInjector 的优势更为显著(22.6% vs 16.5%),暗示 SkillRouter 在自建 benchmark 上可能享有 home-field advantage。
Listwise cross-entropy 优化 top-1 discrimination,代价是 multi-skill recovery(FC@10)[2603.22455]。在 multi-skill FC@10 上 16B base (.382) > SkillRouter (.353)。对于需要多个 complementary skills 的复杂任务,这个 trade-off 可能是致命的——SkillsInjector 的 adaptive budget mechanism 天然支持 variable-size injection [2605.29794],而 SkillRouter 的 pipeline 设计上就是 top-K retrieval。
SkillRouter 未公开代码 [2603.22455]。考虑到 false-negative filtering 的 3 个阈值(exact name match, trigram Jaccard > 0.6, cosine > 0.92)均未做独立消融,且 truncation budget 的 asymmetry(encoder 2,500 chars vs reranker 2,000 chars)没有 sensitivity analysis,replication 需要重新寻找这些超参数。
SkillRouter 在 agent skill lifecycle 中占据 retrieval stage 的一个精确位置——它是 full-text IR pipeline 在 large-pool regime 下的 engineering optimization,而非对 routing 问题的重新定义。核心贡献——listwise reranking for homogeneous pools [2603.22455]——是对 existing IR methodology 的 task-specific adaptation,并非新的范式。
与之对比,SkillsInjector 提出了 paradigm-level shift:从 "retrieve most similar" 到 "construct most useful context" [2605.29794]。SkillReducer 提出了另一个 shift:从 "inject as-is" 到 "compress and disclose progressively" [2603.29919]。SkillRouter 的贡献在这两者之间是 incremental——它不改变 routing 的本质(similarity-based selection),只改进了 similarity 的计算方式(full-text, listwise, false-negative-filtered)。
SkillRouter 的 deployment barrier 极低:1.2B 参数,496ms latency,单 GPU [2603.22455]。这使其成为 production skill registry 的 drop-in routing component——相比 SkillsInjector 需要 per-domain execution rollouts,SkillRouter 的 zero-data-dependency 特性在快速迭代的 agent 平台上更具实用价值。
Survey 记录的 ecosystem scale(SkillsMP 700k+, SkillNet 300k+)[2605.07358] 验证了 large-pool routing 是真实需求。SkillRouter 的 ~80K pool 实验规模与主流平台量级接近,但仍有一个量级的差距需要验证。
SkillRouter 作为独立方法的生存周期可能有限。SkillsInjector 已经在 accuracy 上超越,且其 execution-grounded supervision signal 更能扩展到 multi-skill 场景。但 SkillRouter 的 bi-encoder retrieval stage 极有可能被吸收为 SkillsInjector 或类似系统的 first-pass recall layer——SkillsInjector 自身也使用 frozen 0.6B encoder 进行初步 embedding,其架构与 SkillRouter 的 Stage 1 高度同构。
SkillRouter 的 bi-encoder recall + SkillsInjector 的 execution-grounded reranking 构成一个自然组合:用 SkillRouter 的 SR-Emb-0.6B(R@20 = 75.4%)做 first-pass recall [2603.22455],然后用 SkillsInjector 的 MLP scorer(with $\Delta$-based supervision)替代 SR-Rank [2605.29794]。这可以同时保留 SkillRouter 的低延迟 recall 和 SkillsInjector 的 execution-aware selection,且 bi-encoder recall 不需要 execution data。目前两篇论文各自独立评估,缺乏交叉消融。
SkillReducer 的 taxonomy-driven compression(38.5% core rule, 40.7% background, 12.9% example)[2603.29919] 暗示一个实验:用 compressed core rules 而非 full body 作为 SkillRouter 的 embedding 输入。如果 core rules 保留了 96.5% 的 discriminative signal(SkillRouter 发现 body 占 96.5% skill tokens [2603.22455],但 SkillReducer 发现仅 38.5% 是 actionable),则可以在 embedding 阶段就减少 60% 的 token 处理量而不损失 routing accuracy。这是 routing 效率的 low-hanging fruit。
MOCHA 的 Chebyshev scalarization 用于 skill 优化 [2605.19330],但同样的 multi-objective framework 可以应用于 routing selection:目标从 (correctness, compliance) 变为 (relevance, token-cost, execution-utility)。当前 SkillRouter 的 listwise loss 隐含地是单目标的(maximize top-1 Hit),而多目标 routing 可以在 "retrieve fewer but more useful skills" 和 "retrieve more for coverage" 之间提供 Pareto front,解决 SkillRouter 在 FC@10 上的弱点 [2603.22455]。
Survey 强调 skill lifecycle 是 closed-loop 的:execution outcomes → revision → re-indexed retrieval [2605.07358]。当前 SkillRouter 将 skill pool 视为 static snapshot。一个未探索的方向是 online routing adaptation:用 downstream execution feedback 动态调整 bi-encoder embeddings 或 reranker weights,使 routing model 随着 skill evolution 持续学习。SkillsInjector 的 $\Delta$ signal 提供了一种 offline 版本,但 online continuous learning 在 large-pool regime 下的可行性尚未验证。
SkillRouter 的 attention diagnostic 发现 reranker 在 layer 19 将 26.3% attention 分配给仅占 3% tokens 的 name field [2603.22455],最终 layer 返回 98.1% body attention。这种 body → name → body 的注意力轨迹如果可以被用于指导 SkillReducer 的压缩——保留 reranker 最终 layer 高 attention 的 body tokens,删除低 attention tokens——可能实现 routing-aware compression,比 taxonomy-driven 分类更精确地保留 routing signal。