MOCHA 将 agent skill 优化形式化为多目标问题(correctness vs. compliance),用 Chebyshev scalarization 覆盖 non-convex Pareto front,结合 HVC 探索与指数退火,6 任务上 +7.5% correctness,baselines 4/6 任务零进展。
Agent skill 是结构化多字段 NL artifact(description ≤1024 chars for routing, body ≤5000 chars for execution, 共享 context budget)。现有 prompt optimizer(TextGrad、ProTeGi、GEPA)将多目标折叠为单标量或启发式选择,无法进入 non-convex Pareto 区域。实证表现:在 4/6 任务上 1000 rollout 后 baselines 返回原始 seed skill 不变——选择策略成为瓶颈。
MOCHA 每轮迭代包含两阶段:
核心技术壁垒: Chebyshev scalarization 的完备性(Proposition 3.1, Miettinen 1999)保证可触达完整 Pareto front(线性加权无法到达 non-convex 区域),而 HVC 严格单调性(唯一满足 Pareto dominance monotonicity 的 unary indicator)使探索阶段的 accept 判据具有理论最优性。两者结合解决了有限 budget 下的 front 覆盖问题——这是纯 Chebyshev 或纯 HVC 各自无法单独达到的。

Paper's Figure 1, verbatim (caption: "(a) Skill optimization produces a correctness–compliance trade-off: the optimized skill p gains correctness but may violate compliance limits. (b) MOCHA navigates this trade-off via two phases: exploration (green) expands the Pareto front, then exploitation (purple) refines the extremes.").*
Figure 1(a) 展示 skill optimization 的核心张力:单目标优化器将 correctness gain 与 compliance violation 视为不可调和,因此 reject 所有 improvement candidate。Figure 1(b) 展示 MOCHA 的解法:exploration 阶段(绿色)通过 HVC gating 无方向扩展 front,exploitation 阶段(紫色)通过 Chebyshev acceptance 沿特定方向精炼。指数退火连接两阶段。
| 符号 | 含义 | 范围 | ||
|---|---|---|---|---|
| $p \in \mathcal{P}$ | skill definition(NL 文本) | 所有候选 skill 集合 | ||
| $M$ | 目标数量 | 本文 $M=3$ | ||
| $m_j(p)$ | skill $p$ 在 metric $j$ 上的值 | $[0, 1]$ | ||
| $\mathbf{w} \in \Delta^{M-1}$ | 权重向量 | 单纯形 | ||
| $s_{\mathbf{w}}(p)$ | Chebyshev scalarization | $\max_j [w_j \cdot | m_j(p) - 1 | ]$ |
| $\mathrm{HVC}(p, \mathcal{P})$ | hypervolume contribution | $\mathrm{HV}(\mathcal{P} \cup \{p\}) - \mathrm{HV}(\mathcal{P})$ | ||
| $\tau(b)$ | 阈值 | $\tau_0 \cdot \exp(-\lambda b/B)$ | ||
| $B$ | 总 budget(rollout 数) | 实验中 1000 | ||
| $\lambda$ | 退火速率 | 实验中 10 |
Eq. (1) $\mathcal{P}^{*} = \{p \in \mathcal{P} : \nexists p' \text{ s.t. } \mathbf{m}(p') \succ \mathbf{m}(p)\}$ — 优化目标:找到不被任何其他 skill 在所有 metric 上同时 dominate 的完整集合(a-posteriori MOO)。
Eq. (3) $s_{\mathbf{w}}(p) = \max_{j \in [M]} [w_j \cdot |m_j(p) - z_j^*|]$ — 最小化最大加权偏差,天然倾向平衡各目标(penalize 最弱维度),且由 Proposition 3.1 保证完备性。
Eq. (5) $\mathrm{HVC}(p, \mathcal{P}) = \mathrm{HV}(\mathcal{P} \cup \{p\}) - \mathrm{HV}(\mathcal{P})$ — 候选的独占贡献体积——$> 0$ 当且仅当 $p$ 是 non-dominated,为探索提供方向无关的 quality signal。
Eq. (7) $\tau(b) = \tau_0 \cdot \exp(-\lambda \cdot b/B)$ — 指数衰减将 acceptance gate 从"任何方向都接受"平滑过渡到"只接受 Chebyshev improvement",mid-budget 后 $\tau \approx 0$。
| # | 检查项 | 结果 |
|---|---|---|
| 1 | 形式化声明是否有证明或引用 | Proposition 3.1 引用 Miettinen 1999 定理,HVC 单调性引用 Zitzler 2003 |
| 2 | 实验是否覆盖声明的全部条件 | 6 task × 5 seeds × 4 methods + 2 ablation variants, 但仅 1 backbone (Claude Haiku 4.5) |
| 3 | 负面结果是否被报告 | 是: HotpotQA 上 MOCHA 略低于 ProTeGi (.600 vs .622); body compliance 大幅下降 (.33 mean) |
| 4 | 消融实验是否隔离贡献 | 是: w/o HVC 和 w/o Annealing 清晰隔离探索/利用两个贡献 |
| 5 | 实验设计是否公平 | 是: 所有方法共享 identical SkillMdProposer mutation interface,唯一变量是选择策略 |
| 6 | 限制条件是否被明确声明 | 是: 3 条 limitations(低冲突任务、固定退火、平台特定 compliance) |

Paper's Figure 2, verbatim (caption: correctness over optimization budget for all six skills). MOCHA 在 budget 前半段快速爬升(exploration 阶段 HVC 驱动),后半段趋于稳定(exploitation 阶段 Chebyshev 精炼)。Baselines 在 GPQA/HoVer/FEVER/DebugBench 上全程平坦——选择策略 reject 了所有 mutation candidate。

Paper's Figure 3, verbatim (caption: "2D Pareto fronts (correctness vs. body compliance) for two representative tasks. MOCHA discovers diverse non-dominated skill variants while baselines remain near the initial prompt."). 关键观察:MOCHA 变体分散于 Pareto front 的不同区域(correctness 0.65–0.76 × body compliance 0.2–0.5),而三个 baseline 聚集在 seed skill 附近单一点。这可视化了核心论点——单目标选择器无法离开初始 prompt。

Paper's Table 1 (aggregated across 6 skills, 5 seeds). 核心数据点:MOCHA correctness .675 vs GEPA .619 / ProTeGi .628;hypervolume .483 vs .454;Pareto points 3.6 vs 1.7。值得注意的是 MOCHA 的 body compliance 从 .83 降到 .33——这是 correctness gain 的显式代价。

Paper's Figure 14, verbatim (caption: ablation heatmap showing correctness delta over GEPA for each MOCHA variant across six skills). 关键发现:w/o HVC(纯 exploitation)在 TheoremQA/FEVER 上 correctness gain 最高;w/o Annealing(纯 exploration)在 HoVer 上表现更好;full MOCHA 在 aggregated metrics 上最平衡。这印证了 exploration-exploitation spectrum 的设计合理性。
| 任务 | GEPA | MOCHA | Δ relative |
|---|---|---|---|
| FEVER | .632 | .726 | +14.9% |
| TheoremQA | .690 | .762 | +10.4% |
| DebugBench | .615 | .666 | +8.3% |
| GPQA | .592 | .636 | +7.4% |
| HoVer | .618 | .660 | +6.8% |
| HotpotQA | .622 | .600 | −3.5% |
Gain 与 objective conflict 程度正相关:FEVER/TheoremQA 中 correctness improvement 需要更长 instruction(body 超限),MOCHA 能接受此 trade-off;HotpotQA 无显著冲突,multi-objective machinery 反而成为 overhead。
| Step | 论点 | 证据来源 | 推理方式 |
|---|---|---|---|
| 1 | Agent skill 优化本质上是多目标的:correctness 与 platform compliance 不可避免冲突 | §1 platform constraints (1024/5000 char limits), §4 FEVER case study (correctness +11% 伴随 body compliance 从 .99→.38) | 定义性论证 + 实证 |
| 2 | 单目标选择策略是现有方法失败的根本原因(非 mutation 质量问题) | §4.2 baselines 使用相同 multi-objective mutation feedback 仍在 4/6 tasks 返回 seed unchanged; §C.1 identical SkillMdProposer 接口 | 控制变量实验 |
| 3 | Chebyshev scalarization 可达完整 Pareto front(含 non-convex 区域),线性加权不行 | Proposition 3.1 (Miettinen 1999 定理); §A.2 形式对比 | 定理引用 |
| 4 | 有限 budget 下纯 Chebyshev 前沿覆盖不足,需要 HVC 探索 | §4.3 ablation: w/o HVC 的 Pareto points (2.8) < full MOCHA (3.6); HoVer 上 w/o Annealing(.614) 崩塌说明纯探索也不够 | 消融实验 |
| 5 | 指数退火连接两种模式,实现 correctness × diversity 的最佳 trade-off | §4.3 Table 3: full MOCHA HV .483 > both ablations (.477/.478); §C.7 HoVer 上 w/o Ann 退化 -4.6pp | 消融实验 |
| 6 | MOCHA gain 与 objective conflict 强度正相关,低冲突任务无优势 | §4.2 Table 2: FEVER(+14.9%) vs HotpotQA(-3.5%); §5 Discussion 明确归因 | 对比分析 + 作者声明 |
[实现未公开]
作者未公开 MOCHA 的代码实现。论文描述了统一优化框架(reimplements TextGrad/ProTeGi within same framework),但无公开仓库链接。