MOCHA(2605.19330)与三篇论文构成 agent skill 生命周期的四个阶段:
| 阶段 | 论文 | 核心功能 | 与 MOCHA 的关系 |
|---|---|---|---|
| 内容优化 | MOCHA | 多目标 Pareto 搜索产出多个 skill 变体 | — |
| 表示压缩 | SkillReducer (2603.29919) | 构建时压缩 description (48%) 和 body (39%),保质减 token | MOCHA 输出的 skill 变体可作为 SkillReducer 的输入 |
| 检索路由 | SkillRouter (2603.22455) | 1.2B 全文 retrieve-and-rerank,80K 库 74.0% Hit@1 | MOCHA 优化后的 skill 需通过 routing 才能被 agent 使用 |
| 注入渲染 | SkillsInjector (2605.29794) | 基于执行反馈的自适应选择 + 集合感知渲染 | MOCHA 关注单个 skill 内容,SkillsInjector 关注多 skill 组合 |
关联理由: 四篇论文共享 "agent skill" 这一核心抽象——结构化 NL artifact(description 用于路由,body 用于执行)。它们分别解决创建后优化(MOCHA)、表示效率(SkillReducer)、大规模检索(SkillRouter)、运行时选择与适配(SkillsInjector)。任何一个阶段的改进都需要与其他阶段兼容才能在端到端 pipeline 中生效。
多变体输出 vs 单输出: MOCHA 是四篇中唯一产出 Pareto front(平均 3.6 个 non-dominated 变体)的工作 [2605.19330]。SkillReducer 对每个 skill 产出单一压缩版本 [2603.29919];SkillRouter 不修改 skill 内容 [2603.22455];SkillsInjector 修改 description 但不产出永久变体(渲染是 per-task 临时的)[2605.29794]。
显式多目标建模: MOCHA 将 correctness 和 compliance 形式化为独立目标,用 Chebyshev scalarization 保证可达 non-convex Pareto 区域 [2605.19330]。其他三篇隐式处理多维质量——SkillReducer 的 retention metric 将质量塌缩为 $\min(\text{score}_C/\text{score}_A, 1.0)$ [2603.29919];SkillsInjector 的 $\Delta(t,s)$ 是单标量执行成功率 [2605.29794];SkillRouter 以 Hit@1 为单一优化目标 [2603.22455]。
Exploration-exploitation 分离: HVC 探索 + Chebyshev 利用的双阶段架构在 skill optimization 文献中首见 [2605.19330]。SkillReducer 的 ddmin 是纯消融式搜索(只删不增)[2603.29919];SkillsInjector 的规划器是单次评分无迭代搜索 [2605.29794]。
Mutation 不是贡献: MOCHA 使用与 baselines 相同的 SkillMdProposer mutation 接口 [2605.19330]——区别纯粹在选择策略。这使其贡献更窄但更可控。
评估 backbone 单一: MOCHA 仅在 Claude Haiku 4.5 上评估 [2605.19330]。对比之下 SkillReducer 验证 5 个模型 / 4 个家族(cross-model retention 0.965)[2603.29919],SkillsInjector 在 3 个 benchmark 上评估(tau2, SkillsBench, ALFWorld)[2605.29794],SkillRouter 测试 4 个下游 agent(Claude/Opus/glm/Kimi)[2603.22455]。
Compliance 的方向相反: MOCHA 为 correctness gain 牺牲 body compliance(从 .83 降至 .33)[2605.19330]。SkillReducer 的核心价值恰恰相反——压缩 body token 同时保持或提升质量(retention 0.987,less-is-more +2.8%)[2603.29919]。
矛盾根源: 两者优化方向不同。MOCHA 允许 body 膨胀以换取 correctness(优化内容丰富度),SkillReducer 删除冗余以换取效率(优化信息密度)。两者在各自框架内都正确,但串联使用时存在张力:MOCHA 产出的高 correctness/低 compliance 变体正是 SkillReducer 最需要压缩的对象。
MOCHA 全部实验基于 Claude Haiku 4.5 [2605.19330]。SkillReducer 证明不同 backbone 对 skill 内容的敏感度差异显著(Qwen2.5-7B retention 0.939 vs GPT-OSS-120B 0.982)[2603.29919]。SkillsInjector 发现 planner 是 supervision-bottlenecked 而非 representation-bottlenecked(encoder 0.6B → 8B 增益 ≤1.9pp)[2605.29794]。若 MOCHA 的 Pareto front 是 backbone-specific 的,优化出的变体在其他模型上可能退化。
MOCHA 的 best-correctness 变体 body compliance 仅 .33 [2605.19330]。在实际平台中,skill body 有硬性字符限制(≤5000 chars)[2605.19330]。如果 compliance 是硬约束而非软目标,Pareto front 上 2/3 的变体可能无法部署。论文将 compliance 建模为可 trade-off 的软目标,但平台通常执行硬截断——这使得 Pareto front 的有效覆盖面积被大幅压缩。
SkillRouter 的核心发现是 skill body 文本对路由至关重要——去除 body 导致 Hit@1 下降 31–44pp [2603.22455]。MOCHA 的 mutation 改写 body 内容以提升 correctness,但从未验证优化后的 body 是否保持可路由性。如果 mutation 引入的表述偏离了 routing encoder 训练分布,高 correctness 变体可能在 80K 库中无法被检索到。
MOCHA 在 HotpotQA 上 correctness 反降 3.5% [2605.19330]。论文坦承低冲突任务上多目标机制是 overhead [2605.19330]。但论文未提供预判冲突程度的方法——即不知道对一个新 skill 是否值得启用 MOCHA。SkillsInjector 的自适应预算机制(threshold $\tau^\star_d$ 可让 budget = 0)[2605.29794] 比 MOCHA 的"全量 1000 rollout 后发现无改进"更经济。
MOCHA 每个 skill 消耗 1000 rollout [2605.19330]。SkillReducer 的 empirical study 覆盖 55,315 个 wild skills [2603.29919];SkillRouter 的 pool 达 ~80K [2603.22455]。在这些规模下,MOCHA 需要 5500 万到 8000 万次 rollout——即使每次 rollout 仅 $0.001,总成本也达 $55K–$80K。论文仅在 6 个 task 上演示,未讨论 skill 库级别的扩展策略。
MOCHA 填补的生态位是 skill 内容的 quality-diversity 优化——在 skill lifecycle 中处于"创建/迭代"阶段,位于 seed skill 编写之后、压缩/路由/注入之前。
| 维度 | MOCHA 的位置 | 替代方案 |
|---|---|---|
| 修改对象 | Skill 文本内容 | SkillReducer(压缩)、SkillsInjector renderer(临时改写) |
| 时机 | 离线批量优化 | SkillsInjector(在线 per-task)、SkillRouter(在线检索) |
| 输出 | 多个 Pareto 变体 | 所有 related 论文均为单输出 |
| 理论基础 | Chebyshev + HVC(MOO 理论) | SkillReducer(delta debugging)、SkillRouter(InfoNCE) |
MOCHA 的采纳面临三个先决条件:
MOCHA 与三篇 related 论文不存在竞争关系,而是潜在的 pipeline 上下游:
但目前无任何集成实验验证这些组合的端到端效果。
MOCHA 产出高 correctness / 低 compliance 变体 [2605.19330],SkillReducer 擅长在压缩中提升质量(less-is-more +2.8%)[2603.29919]。串联 pipeline:先用 MOCHA 扩展 Pareto front 获取 correctness-maximized 变体,再用 SkillReducer 的 taxonomy-driven 压缩恢复 compliance。关键假设:SkillReducer 的 taxonomy classifier 能否正确分类 MOCHA mutation 产生的非标准文本——MOCHA 的 mutation 可能产出 SkillReducer 训练分布外的 body 结构。
MOCHA 的 correctness/compliance 指标是静态评估的 [2605.19330]。SkillsInjector 的 $\Delta(t,s)$ 证明了执行反馈(actual agent rollout success)是更可靠的优化信号 [2605.29794]。将 MOCHA 的目标函数从 proxy metric 替换为 execution-grounded utility,可使 Pareto front 直接反映实际部署效果。挑战:$\Delta$ 的计算成本(20,500 rollout for 82 skills × 50 tasks × 5 seeds [2605.29794])与 MOCHA 的 1000 rollout/skill budget 叠加后可能不可行。
SkillRouter 证明 body 文本对路由准确率至关重要(去除 body → -31–44pp Hit@1)[2603.22455]。可将 routing accuracy 作为 MOCHA 的第四个目标($M=4$: correctness, body compliance, description compliance, routability)。实现方式:将 SkillRouter 的 encoder 作为 routing oracle,在 MOCHA 的 acceptance criterion 中加入 routability gate——只接受仍可被 top-K 检索到的变体。HVC 在 $M=4$ 下的计算复杂度 $O(n^{M/2} \log n)$ 仍可控。
MOCHA 的 gain 与 objective conflict 正相关(FEVER +14.9% vs HotpotQA -3.5%)[2605.19330]。借鉴 SkillsInjector 的自适应阈值机制 [2605.29794],设计冲突预判器:对每个 skill 先用少量 rollout(~50)估算 correctness-compliance 梯度方向的对齐度,仅对冲突显著的 skill 分配完整 MOCHA budget。这可将 skill 库级别的总 rollout 成本降低一个数量级。
MOCHA 在单 backbone 上搜索 Pareto front [2605.19330]。SkillReducer 证明 cross-model retention 存在差异(0.939–0.986)[2603.29919]。可将 cross-model transferability 作为第三维度:在 Pareto front 中不仅平衡 correctness × compliance,还要求变体在多个 backbone 上都保持增益。这需要在搜索过程中对每个候选用 2–3 个 backbone 评估——计算成本线性增长但 Pareto front 的实际可部署性大幅提升。