本篇与以下三篇构成 "agent skill library lifecycle" 集群,共同回答同一核心问题:自生成 skill 库如何在长期运行中保持或提升 agent 性能。
| 论文 | 关系 | 关联维度 |
|---|---|---|
| MUSE-Autoskill (2605.27366) | 互补:Library Drift 专注退化诊断与治理,MUSE 专注创建质量与全生命周期工程 | 两者分别从 "skill 退出端" 和 "skill 进入端" 解决同一问题 |
| SLIM (2605.10923) | 竞争+互补:两者都使用贡献度驱动的 retain/retire 机制,但 SLIM 联合优化 RL policy + skill set,Library Drift 假设 frozen LLM | 贡献度估计方法、evidence floor 设定存在矛盾 |
| Experience Compression Spectrum (2604.15877) | 上游动机:Library Drift L2 显式引用此篇为 motivation;Experience Compression 的 "curated $L_2$ >> self-gen $L_2$" 发现直接驱动了 meta-skill authoring prior 的设计 | 理论框架 → 具体实例 |
Library Drift 的独特定位是诊断优先:它首先给出 library drift 的操作性定义(Eq. 1)和可复现触发条件(A1/A4 ablation),然后才提出修复方案 [2605.19576]。相比之下,MUSE 和 SLIM 都是 solution-first。
Library Drift 的 Ratchet 和 MUSE-Autoskill 从 skill 生命周期的两端入手解决退化问题,形成清晰的互补关系:
| 维度 | Library Drift (Ratchet) | MUSE-Autoskill |
|---|---|---|
| 质量门控位置 | 出口端:退役贡献度 < $-\tau$ 的 skill | 入口端:unit-test gating,test 不通过不注册 |
| 创建约束 | Meta-skill authoring prior(风格一致性) | 结构化 skill 包(SKILL.md + scripts/ + tests/) |
| 知识积累 | 无 per-skill memory | Per-skill .memory.md 跨任务经验积累 |
| 容量控制 | 硬上限 active-cap $C = 50$ | Catalog progressive disclosure(无硬上限) |
| 转移能力 | 未测试 | Cross-agent 零修改迁移(+10.51pp → Hermes) |
关键增量:Library Drift 提供了 MUSE 所缺的三个能力——(1) 退化的形式化定义和可复现诊断 [2605.19576],(2) 贡献度追踪和退役机制,(3) Prop 1 的非发散保证。反过来,MUSE 提供了 Library Drift 所缺的——(1) 测试驱动的入口质量门控 [2605.27366],(2) per-skill 经验积累使 skill 随使用而改善,(3) cross-agent 迁移验证。
Library Drift 和 SLIM 都使用贡献度驱动的 lifecycle 管理,但运行在根本不同的设定下:
增量判断:Library Drift 在 frozen-LLM inference-only 场景下提供了更简单、更有保证的治理方案(Prop 1);SLIM 在 RL fine-tuning 场景下提供了更精细的信号。两者的 deployment assumption 不同,不直接可比。
Library Drift 是 Experience Compression 所预言的 "missing diagonal" 的一个具体但不完整的实现。Experience Compression 识别出四层压缩光谱($L_0 \to L_3$)和跨层自适应压缩的缺失 [2604.15877]。Library Drift 的 Ratchet 在 $L_2$(procedural skill)层内实现了完整 lifecycle,但不跨层——不支持 skill 降级回 $L_1$ episodic memory,也不支持多个 skill 升维为 $L_3$ declarative rule。
关键联系:Experience Compression 的核心发现——curated $L_2$ +16.2pp vs self-gen $L_2$ +0.0pp [2604.15877]——正是 Library Drift meta-skill authoring prior 的直接动机。Meta-skill 通过约束 synthesizer 的输出风格来提升自生成 skill 质量,A3 ablation 证实其贡献 43% 的增益 [2605.19576]。
Library Drift 的最强实验论点是 A4:将 $N_{\min}$ 从 100 降至 20 导致 bank 崩溃到 2 active skills,性能跌至 no-skill baseline 以下($-0.019$)[2605.19576]。作者据此断言 evidence floor 是"load-bearing design choice"。
然而 SLIM 在 ALFWorld 上使用 $n_{\min} = 20$-30 且 $\tau_{\text{retire}} = 0.001$(远低于 Library Drift 的 $\tau = 0.10$),不仅未崩溃,还达到 87.5% 的最佳成绩 [2605.10923]。
矛盾根源:不是 $N_{\min}$ 本身,而是 statistical protection 的总量不同。SLIM 用三重保护——(1) EMA 平滑 $\bar{\Delta}_t(s)$ 降低噪声,(2) patience $p = 3$ 要求连续低于阈值,(3) 极低 $\tau_{\text{retire}} = 0.001$ 几乎只退役净负贡献 skill。这三层保护的等效统计强度可能高于 Library Drift 仅靠 $N_{\min} = 100$ 提供的 Hoeffding bound。此外 SLIM 的 RL policy 可以适应性补偿误退役的 skill(policy 吸收该 skill 的能力),而 Library Drift 的 frozen LLM 无此缓冲。
攻击向量:Library Drift 的 A4 使用了 $\tau = 0.0$(即要求严格正贡献),这比 Default 的 $\tau = 0.10$ 严格得多——A4 实际上同时改变了 $N_{\min}$ 和 $\tau$ 两个变量。一个仅降低 $N_{\min}$ 到 20 但保持 $\tau = 0.10$ 的 ablation 缺失,削弱了"$N_{\min}$ 是 load-bearing"这一归因的因果清晰度。
Library Drift 全部实验在 MBPP+ hard-100(coding task)× Claude Opus 4.7 上运行 [2605.19576]。SLIM 测试了 ALFWorld + SearchQA [2605.10923],MUSE 测试了 SkillsBench 51 task × 4 super-domain [2605.27366]——都比 Library Drift 覆盖更广。
Coding task 有独特属性:skill 可被精确验证(通过 test case),retrieval 精度高(代码模式匹配比自然语言更确定)。在更模糊的领域(planning、reasoning),meta-skill 的风格约束是否仍然 subsume explicit dedup(A5/A6 的结论)存疑。
A8 (meta-skill refresh every 10 rounds) 达到了最高 peak(0.725),但 55% wall-time 增加使作者判定"不值得" [2605.19576]。但 100 轮的实验规模较小——在 1000+ 轮的长期部署中,meta-skill 不刷新可能导致其风格指导与 skill bank 的实际内容逐渐脱节。MUSE 的 per-skill memory 机制提供了一种分布式替代方案(每个 skill 独立积累经验而非依赖全局 meta-skill) [2605.27366],可能在大规模下更可持续。
Default 中 router 仅在 73% 的 task 上注入 skill——27% 被 LLM gate 拒绝。这被解读为"选择性注入是 drift prevention" [2605.19576]。但这也可能说明 bank 中 50 个 skill 的覆盖率不足——在理想状态下,一个成熟的 skill bank 应该对大部分 task 都有相关 skill。Experience Compression 指出 coverage(而非质量)是自生成 skill 的瓶颈 [2604.15877],MUSE 也发现 16/51 task 因无成功轨迹可蒸馏而缺少 skill [2605.27366]。
Library Drift 在 agent skill 领域引入了一个此前缺失的关注点:退化诊断。四篇论文可定位在 skill lifecycle 的不同范式象限:
| Frozen LLM (inference-only) | Trainable policy (RL) | |
|---|---|---|
| Lifecycle 在 skill 端 | Library Drift (Ratchet) | SLIM |
| Lifecycle 在 creation 端 | MUSE-Autoskill | (空缺) |
Experience Compression 横跨上方,作为统一框架。
Library Drift 的范式贡献是将 "skill 退化是可被诊断和治愈的" 这一认识注入社区。此前 Voyager、ExpeL 等系统默认假设 skill 积累单调有益——Library Drift 用 A1/A4 两个极端 ablation 系统性反驳了这一假设 [2605.19576]。
Library Drift 实质上是 Experience Compression 所定义的 $L_2$ 层内的完整 lifecycle 管理实现——填补了 Table 2 中 "Lifecycle: ✓" 列的空白 [2604.15877]。但它未触及跨层级的 "missing diagonal",这使得它是一个有价值的 building block 而非最终解。
Library Drift 的退役机制(出口端)和 MUSE 的 unit-test gating(入口端)从未被组合验证。一个 hybrid 方案:新 skill 必须通过 bundled test(MUSE 式),运行中 skill 按贡献度退役(Ratchet 式),退役 skill 的 .memory.md(MUSE 式)保留到 inactive bank 以供未来参考。预测:入口 gating 降低 "harmful birth" 率,减轻退役机制的负担,可能允许更低的 $N_{\min}$。
Library Drift 用简单经验比 $\hat{c}(s)$,SLIM 用反事实 $\Delta_t(s)$。未尝试的组合:在 frozen-LLM 设定下使用 leave-one-skill-out 反事实信号,但保留 Hoeffding evidence floor 作为决策门控。这应能提供比 $\hat{c}(s)$ 更精确的信号(区分 "skill 被选中但不帮忙" 和 "skill 确实有害")同时保持 Prop 1 的非发散保证。成本:每次 audit $M$ 次额外 LLM 调用(SLIM 的 $M = 4$–12),在 frozen-LLM 下可并行化。
Experience Compression 的 $L_1 \to L_2 \to L_3$ 框架 + Library Drift 的 $L_2$-内 lifecycle → 自然延伸为跨层级 lifecycle:(1) 多个相关 skill 被频繁共同检索时,自动上推为 $L_3$ declarative rule("这类 task 总是需要先 X 再 Y");(2) 当 $L_3$ rule 在某子域 fail 时,降级回 $L_2$ 具体 skill。Library Drift 的贡献度追踪可作为上推/降级的触发信号。Experience Compression 的 negative constraint 发现($L_3$ 负约束 +7–14pp vs 正指令反而损害)[2604.15877] 提示自动 $L_3$ 生成应优先提取 "don't do X" 模式。
所有四篇论文的实验规模有限(Library Drift 100 轮 × 100 task,SLIM 120–180 RL steps,MUSE 51 task)。真实 agent 部署(如 Cursor 代码 agent、customer-facing copilot)可能累积数千 skill 并运行数月。在此规模下:(a) meta-skill 是否仍能 subsume explicit dedup?(b) $C = 50$ 的 cap 是否需要自适应调节?(c) SLIM 的 non-monotonic trajectory 是否收敛到稳态还是持续振荡?这些问题需要长程实验或 production telemetry。
MUSE 证明了 cross-agent skill 迁移的可行性(同 backbone 不同 agent runtime)[2605.27366],但所有论文都假设单一 backbone。如果 skill bank 被不同 backbone 的 agent 共享(如 Claude 生成的 skill 被 GPT agent 使用),Library Drift 的贡献度追踪需要 per-backbone 分桶——同一 skill 对不同 backbone 的 $\hat{c}$ 可能完全不同。这也是 Experience Compression 尚未分析的维度。