MOCHA: Multi-Objective Chebyshev Annealing for Agent Skill Optimization

algorithm 2605.19330 — Cross-paper Synthesis

MOCHA: Multi-Objective Skill Optimization — L3 Per-Paper Synthesis #

§1 相关论文 #

MOCHA(2605.19330)与三篇论文构成 agent skill 生命周期的四个阶段:

阶段论文核心功能与 MOCHA 的关系
内容优化MOCHA多目标 Pareto 搜索产出多个 skill 变体
表示压缩SkillReducer (2603.29919)构建时压缩 description (48%) 和 body (39%),保质减 tokenMOCHA 输出的 skill 变体可作为 SkillReducer 的输入
检索路由SkillRouter (2603.22455)1.2B 全文 retrieve-and-rerank,80K 库 74.0% Hit@1MOCHA 优化后的 skill 需通过 routing 才能被 agent 使用
注入渲染SkillsInjector (2605.29794)基于执行反馈的自适应选择 + 集合感知渲染MOCHA 关注单个 skill 内容,SkillsInjector 关注多 skill 组合

关联理由: 四篇论文共享 "agent skill" 这一核心抽象——结构化 NL artifact(description 用于路由,body 用于执行)。它们分别解决创建后优化(MOCHA)、表示效率(SkillReducer)、大规模检索(SkillRouter)、运行时选择与适配(SkillsInjector)。任何一个阶段的改进都需要与其他阶段兼容才能在端到端 pipeline 中生效。

§2 本篇 vs 相关论文的 delta #

2.1 MOCHA 的独有贡献 #

多变体输出 vs 单输出: MOCHA 是四篇中唯一产出 Pareto front(平均 3.6 个 non-dominated 变体)的工作 [2605.19330]。SkillReducer 对每个 skill 产出单一压缩版本 [2603.29919];SkillRouter 不修改 skill 内容 [2603.22455];SkillsInjector 修改 description 但不产出永久变体(渲染是 per-task 临时的)[2605.29794]

显式多目标建模: MOCHA 将 correctness 和 compliance 形式化为独立目标,用 Chebyshev scalarization 保证可达 non-convex Pareto 区域 [2605.19330]。其他三篇隐式处理多维质量——SkillReducer 的 retention metric 将质量塌缩为 $\min(\text{score}_C/\text{score}_A, 1.0)$ [2603.29919];SkillsInjector 的 $\Delta(t,s)$ 是单标量执行成功率 [2605.29794];SkillRouter 以 Hit@1 为单一优化目标 [2603.22455]

Exploration-exploitation 分离: HVC 探索 + Chebyshev 利用的双阶段架构在 skill optimization 文献中首见 [2605.19330]。SkillReducer 的 ddmin 是纯消融式搜索(只删不增)[2603.29919];SkillsInjector 的规划器是单次评分无迭代搜索 [2605.29794]

2.2 增量而非突破的部分 #

Mutation 不是贡献: MOCHA 使用与 baselines 相同的 SkillMdProposer mutation 接口 [2605.19330]——区别纯粹在选择策略。这使其贡献更窄但更可控。

评估 backbone 单一: MOCHA 仅在 Claude Haiku 4.5 上评估 [2605.19330]。对比之下 SkillReducer 验证 5 个模型 / 4 个家族(cross-model retention 0.965)[2603.29919],SkillsInjector 在 3 个 benchmark 上评估(tau2, SkillsBench, ALFWorld)[2605.29794],SkillRouter 测试 4 个下游 agent(Claude/Opus/glm/Kimi)[2603.22455]

2.3 矛盾点 #

Compliance 的方向相反: MOCHA 为 correctness gain 牺牲 body compliance(从 .83 降至 .33)[2605.19330]。SkillReducer 的核心价值恰恰相反——压缩 body token 同时保持或提升质量(retention 0.987,less-is-more +2.8%)[2603.29919]

矛盾根源: 两者优化方向不同。MOCHA 允许 body 膨胀以换取 correctness(优化内容丰富度),SkillReducer 删除冗余以换取效率(优化信息密度)。两者在各自框架内都正确,但串联使用时存在张力:MOCHA 产出的高 correctness/低 compliance 变体正是 SkillReducer 最需要压缩的对象。

§3 可攻击面 #

3.1 单 backbone 的泛化风险 #

MOCHA 全部实验基于 Claude Haiku 4.5 [2605.19330]。SkillReducer 证明不同 backbone 对 skill 内容的敏感度差异显著(Qwen2.5-7B retention 0.939 vs GPT-OSS-120B 0.982)[2603.29919]。SkillsInjector 发现 planner 是 supervision-bottlenecked 而非 representation-bottlenecked(encoder 0.6B → 8B 增益 ≤1.9pp)[2605.29794]。若 MOCHA 的 Pareto front 是 backbone-specific 的,优化出的变体在其他模型上可能退化。

3.2 body compliance 崩塌的实用性问题 #

MOCHA 的 best-correctness 变体 body compliance 仅 .33 [2605.19330]。在实际平台中,skill body 有硬性字符限制(≤5000 chars)[2605.19330]。如果 compliance 是硬约束而非软目标,Pareto front 上 2/3 的变体可能无法部署。论文将 compliance 建模为可 trade-off 的软目标,但平台通常执行硬截断——这使得 Pareto front 的有效覆盖面积被大幅压缩。

3.3 未验证路由兼容性 #

SkillRouter 的核心发现是 skill body 文本对路由至关重要——去除 body 导致 Hit@1 下降 31–44pp [2603.22455]。MOCHA 的 mutation 改写 body 内容以提升 correctness,但从未验证优化后的 body 是否保持可路由性。如果 mutation 引入的表述偏离了 routing encoder 训练分布,高 correctness 变体可能在 80K 库中无法被检索到。

3.4 低冲突场景下的 overhead #

MOCHA 在 HotpotQA 上 correctness 反降 3.5% [2605.19330]。论文坦承低冲突任务上多目标机制是 overhead [2605.19330]。但论文未提供预判冲突程度的方法——即不知道对一个新 skill 是否值得启用 MOCHA。SkillsInjector 的自适应预算机制(threshold $\tau^\star_d$ 可让 budget = 0)[2605.29794] 比 MOCHA 的"全量 1000 rollout 后发现无改进"更经济。

3.5 1000 rollout 的可扩展性 #

MOCHA 每个 skill 消耗 1000 rollout [2605.19330]。SkillReducer 的 empirical study 覆盖 55,315 个 wild skills [2603.29919];SkillRouter 的 pool 达 ~80K [2603.22455]。在这些规模下,MOCHA 需要 5500 万到 8000 万次 rollout——即使每次 rollout 仅 $0.001,总成本也达 $55K–$80K。论文仅在 6 个 task 上演示,未讨论 skill 库级别的扩展策略。

§4 生态位 #

范式定位 #

MOCHA 填补的生态位是 skill 内容的 quality-diversity 优化——在 skill lifecycle 中处于"创建/迭代"阶段,位于 seed skill 编写之后、压缩/路由/注入之前。

维度MOCHA 的位置替代方案
修改对象Skill 文本内容SkillReducer(压缩)、SkillsInjector renderer(临时改写)
时机离线批量优化SkillsInjector(在线 per-task)、SkillRouter(在线检索)
输出多个 Pareto 变体所有 related 论文均为单输出
理论基础Chebyshev + HVC(MOO 理论)SkillReducer(delta debugging)、SkillRouter(InfoNCE)

采纳门槛 #

MOCHA 的采纳面临三个先决条件:

  1. 冲突可度量: 必须能量化 correctness 与 compliance 间的冲突程度。论文未提供冲突预判工具。
  2. 多变体可管理: 平均 3.6 个 Pareto 变体需要 skill 管理系统支持版本选择——现有 skill 平台(Cursor rules、Claude Code skills)均假设每个 skill 只有一个版本。
  3. Rollout 可负担: 1000 rollout/skill 的成本仅在高价值、高频使用的 skill 上合理。
  4. MOCHA 与三篇 related 论文不存在竞争关系,而是潜在的 pipeline 上下游:

    • MOCHA → SkillReducer: 优化后压缩
    • MOCHA → SkillRouter: 优化后需可路由
    • MOCHA → SkillsInjector: 优化后的多变体可供 planner 按 task 选择

    但目前无任何集成实验验证这些组合的端到端效果。

    §5 未探索方向 #

    5.1 MOCHA × SkillReducer: 优化-压缩联合流水线 #

    MOCHA 产出高 correctness / 低 compliance 变体 [2605.19330],SkillReducer 擅长在压缩中提升质量(less-is-more +2.8%)[2603.29919]。串联 pipeline:先用 MOCHA 扩展 Pareto front 获取 correctness-maximized 变体,再用 SkillReducer 的 taxonomy-driven 压缩恢复 compliance。关键假设:SkillReducer 的 taxonomy classifier 能否正确分类 MOCHA mutation 产生的非标准文本——MOCHA 的 mutation 可能产出 SkillReducer 训练分布外的 body 结构。

    5.2 执行反馈驱动的目标函数 #

    MOCHA 的 correctness/compliance 指标是静态评估的 [2605.19330]。SkillsInjector 的 $\Delta(t,s)$ 证明了执行反馈(actual agent rollout success)是更可靠的优化信号 [2605.29794]。将 MOCHA 的目标函数从 proxy metric 替换为 execution-grounded utility,可使 Pareto front 直接反映实际部署效果。挑战:$\Delta$ 的计算成本(20,500 rollout for 82 skills × 50 tasks × 5 seeds [2605.29794])与 MOCHA 的 1000 rollout/skill budget 叠加后可能不可行。

    5.3 路由感知的优化约束 #

    SkillRouter 证明 body 文本对路由准确率至关重要(去除 body → -31–44pp Hit@1)[2603.22455]。可将 routing accuracy 作为 MOCHA 的第四个目标($M=4$: correctness, body compliance, description compliance, routability)。实现方式:将 SkillRouter 的 encoder 作为 routing oracle,在 MOCHA 的 acceptance criterion 中加入 routability gate——只接受仍可被 top-K 检索到的变体。HVC 在 $M=4$ 下的计算复杂度 $O(n^{M/2} \log n)$ 仍可控。

    5.4 冲突预判 + 自适应预算分配 #

    MOCHA 的 gain 与 objective conflict 正相关(FEVER +14.9% vs HotpotQA -3.5%)[2605.19330]。借鉴 SkillsInjector 的自适应阈值机制 [2605.29794],设计冲突预判器:对每个 skill 先用少量 rollout(~50)估算 correctness-compliance 梯度方向的对齐度,仅对冲突显著的 skill 分配完整 MOCHA budget。这可将 skill 库级别的总 rollout 成本降低一个数量级。

    5.5 cross-model Pareto front #

    MOCHA 在单 backbone 上搜索 Pareto front [2605.19330]。SkillReducer 证明 cross-model retention 存在差异(0.939–0.986)[2603.29919]。可将 cross-model transferability 作为第三维度:在 Pareto front 中不仅平衡 correctness × compliance,还要求变体在多个 backbone 上都保持增益。这需要在搜索过程中对每个候选用 2–3 个 backbone 评估——计算成本线性增长但 Pareto front 的实际可部署性大幅提升。