MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation

agent 2605.27366 — Cross-paper Synthesis

MUSE-Autoskill vs Peers: Skill Lifecycle 闭环的竞争格局 #

§1 相关论文 #

Entity关系关联理由
2605.10923 (SLIM)complementary同期解决 skill lifecycle 问题但路径相反:SLIM 用 RL 驱动的 leave-one-out MEC 做 contribute-aware 的 retain/retire/expand;MUSE 用 unit-test gating + per-skill memory 做 creation-first lifecycle [2605.10923]
2605.19576 (Library Drift)diagnostic complement提供了 MUSE 未明确解决的 failure mode 诊断框架——library drift 的三阶段退化模型和 Hoeffding-calibrated evidence floor [2605.19576]
2604.15877 (Experience Compression Spectrum)theoretical framing将 MUSE 的 skill 生命周期定位于 $L_2$ procedural skill 层级,指出 MUSE 缺少 $L_1 \to L_2$ 自适应路由和 $L_3$ 抽象能力 [2604.15877]
2602.02474 (MemSkill)mechanism overlap共享 "可学习 skill bank + 从 hard cases 进化" 的设计范式;MemSkill 的 RL controller 选择 memory skills,MUSE 的 ReAct loop 选择 task skills [2602.02474]

Cluster 主题:这五篇论文共同探索一个核心问题——如何让 LLM agent 的可复用知识(skill/memory/rule)从静态一次性产物进化为有完整生命周期的动态资产。它们在 lifecycle 的不同阶段各有侧重:MUSE 覆盖创建→评估→迭代,SLIM 覆盖价值估计→淘汰→扩展,Library Drift 覆盖退化诊断→治理,Experience Compression Spectrum 提供统一框架,MemSkill 专注 memory 维度的 skill 化。

§2 本篇 vs 相关论文的 delta #

MUSE vs SLIM (2605.10923) #

新增:MUSE 将 skill 创建嵌入 ReAct runtime loop(而非 SLIM 的离线 o3 生成),使 skill 生成利用实时推理上下文 [2605.27366]。MUSE 引入 per-skill .memory.md 作为经验积累机制,而 SLIM 仅有 lifecycle logs 追踪 MEC history [2605.10923]

SLIM 独有的优势:SLIM 提供了形式化的 capacity-constrained allocation(Eq. 2)和基于 Hoeffding bound 的 local guarantees,而 MUSE 缺乏任何理论框架解释 skill bank 何时应缩减 [2605.10923]。SLIM 的 retire 机制基于可量化的 MEC signal,MUSE 的 management 则依赖未详细说明的 "合并/裁剪" heuristic。

增量:两者都使用 test/evaluation 作为 skill 质量信号——MUSE 用 bundled unit tests,SLIM 用 leave-one-out validation。但 MUSE 在 creation-time 做 binary pass/fail,而 SLIM 在 runtime 做 continuous MEC estimation,后者提供更细粒度的 lifecycle signal。

MUSE vs Library Drift (2605.19576) #

互补方向:Library Drift 精确诊断了 skill library 的三种退化模式(stagnation、bloat、erosion),并证明 governance 需要 Hoeffding-calibrated evidence floor ($N_{\min} = 100$) 才安全 [2605.19576]。MUSE 的 unit-test gating 只解决了 creation-quality(相当于 Library Drift 的 meta-skill authoring prior),但对已注册 skill 的退化(Drift Eq. 1 定义的 $\mathbb{E}[\text{pass@1} \mid \mathcal{S}_t] < \mathbb{E}[p_0]$ 条件)缺乏监测 [2605.27366]

潜在矛盾:MUSE 声称 skill bank 可持续扩展("catalog 式 progressive disclosure + 合并/裁剪"),但 Library Drift 的 A7 实验表明即使有 cap=100,variance 也会膨胀至 ±0.110 [2605.19576]。MUSE 对 bank 规模无上限的设计是否会触发 library drift 是未验证的风险点。

MUSE vs Experience Compression Spectrum (2604.15877) #

定位:在 Compression Spectrum 的框架中,MUSE 的 skill 创建输出为 $L_2$(结构化 SKILL.md + scripts),per-skill memory 为 $L_1$(episodic 级),context compression 为 $L_1$ 内的 intra-level 操作(原位摘要)。MUSE 不涉及 $L_3$ declarative rule 层级 [2604.15877]

填补 missing diagonal 的程度:MUSE 的 skill 从 ReAct trace 中自动蒸馏($L_0 \to L_2$ 跳跃压缩),是 Compression Spectrum 指出的 "missing diagonal" 的部分实现。但缺少 meta-controller 判断 "这段经验应该压缩到哪个层级" 的能力——MUSE 一律将成功 trace 生成 skill(强制走 $L_2$),没有自适应分流到 $L_1$ memory 或 $L_3$ rule [2604.15877]

MUSE vs MemSkill (2602.02474) #

设计范式重叠:两者都采用 "bank of skills + closed-loop evolution" 架构——MemSkill 从 hard-case buffer 进化 memory skills [2602.02474],MUSE 从 test failure 触发 update_skill 修补。但作用域不同:MemSkill 的 skill 指导 memory 操作(how to remember),MUSE 的 skill 指导 task 执行(how to do)。

MUSE 独有:cross-agent transfer 验证——MUSE 证明 skill 可零修改迁移至 Hermes agent(+10.51pp)[2605.27366]。MemSkill 的 cross-model transfer(LLaMA→Qwen)是 backbone 级迁移而非 agent 级迁移 [2602.02474]

MemSkill 独有:RL-trained controller(PPO + Gumbel-Top-K)做 skill selection,提供 reward-driven 的选择信号。MUSE 的 skill retrieval 靠 catalog + agent 自主 read_skill,缺乏 learned routing [2602.02474]

§3 可攻击面 #

3.1 Self-generated skill 的 evaluation bias #

MUSE 报告自生成 skill 在 35-task subset 达 87.94%,超越人工 skill ceiling [2605.27366]。但这 35 task 是 Phase 1 成功生成 skill 的子集(68.6% coverage),天然偏向 MUSE 擅长的 task 类型。人工 skill 在全 51 task 上达 68.40%——在 MUSE 无法生成 skill 的 16 task 上,人工 skill 仍可能有效。该 87.94% 不可与 68.40% 直接对比。

3.2 Unit-test gating 的 verifier 问题 #

MUSE 用 bundled tests 作为 skill 注册 gate,但 tests 是 skill creator 同时生成的 [2605.27366]。这构成 "generator writes its own exam" 问题——Library Drift 的 meta-skill authoring prior 研究表明,LLM 自评估的 false-positive rate 在无外部 oracle 时不可忽略 [2605.19576]。§4.6 的人工审计(35 skill)确认无 hardcoding,但审计覆盖有限,且对 subtle failure modes(如 over-specified preconditions)未检查。

3.3 缺乏 retirement 机制的长期风险 #

SLIM 的核心洞察是 skill bank 的最优 active set 是 non-monotonic 的——随 policy 内化能力,某些 skill 应被 retire [2605.10923]。Library Drift 的 A4 实验进一步证明缺乏 evidence-calibrated governance 会导致 bank collapse 或 drift [2605.19576]。MUSE 只有 "合并/裁剪" 的模糊描述,无量化 retirement criteria,面临长期部署下的 drift 风险。

3.4 单 backbone 限制 #

全部实验基于 GPT-5.5 单一 backbone [2605.27366]。Cross-agent 实验(MUSE→Hermes)验证了 skill portability 而非 backbone sensitivity。对比 SLIM 使用 Qwen3-4B、Library Drift 使用 Claude Opus 4.7——MUSE 的方法在 weaker backbone 上是否仍然有效完全未知。尤其是 skill creation 嵌入 ReAct loop 对 backbone reasoning 能力的要求更高。

3.5 Context compression 的信息保真度无保证 #

MUSE 的 DAG 两级自适应压缩声称通过 immutable history pointer 保留完整回放能力 [2605.27366],但压缩后的 synthetic summary node 被 LLM 实际使用时的信息损失率未量化。Experience Compression Spectrum 明确指出这是 "可被 bound 但未被 bound 的量" [2604.15877]

§4 生态位 #

范式定位 #

MUSE-Autoskill 占据 "full-lifecycle skill engineering" 的生态位——将 skill 从被动工具升级为有创建-记忆-评估-迭代闭环的一等资产。在 skill lifecycle 竞争格局中:

系统生态位关键差异化
MUSECreation-first, full lifecycleRuntime 内 skill 生成 + per-skill memory + unit-test gating
SLIMRetirement-first, RL-drivenMEC estimation + non-monotonic trajectory + formal guarantees
Library DriftGovernance-first, diagnosticEvidence-calibrated retirement + drift diagnosis
MemSkillMemory skill specializationRL routing + variable-size action space

采纳证据 #

MUSE 提及三个 production 系统(SkillMarket、ArkClaw、SkillHub)[2605.27366],但均未公开代码或 benchmark 数据。这意味着:

  1. 存在产业需求验证(至少有 deployed 服务)
  2. 但无法独立复现或验证 production 环境下的 drift/scalability 行为
  3. 范式转变信号 #

    MUSE 的 cross-agent transfer 结果(Hermes 使用 MUSE skill 后仅差 MUSE 本身 ~2pp)[2605.27366] 支持了一个更大的范式假设:skill 作为 externalized knowledge asset 独立于 agent runtime 存在。这与 Experience Compression Spectrum 的 "skill 社区和 memory 社区分离" 诊断形成对照——如果 skill 确实可以跨 agent 复用,那么统一的 skill marketplace 比每个 agent 自己进化更有效率。

    §5 未探索方向 #

    5.1 MUSE + SLIM 融合:MEC-gated lifecycle within ReAct loop #

    MUSE 的 unit-test gating 解决 creation-quality 但不解决 runtime value estimation。将 SLIM 的 MEC estimator 集成为 MUSE skill bank 的 runtime monitor——当 $\bar{\Delta}_t(s) < \tau_{\mathrm{retire}}$ 时 trigger MUSE 的 update_skill 或 retirement——可以结合两者优势。技术挑战:MUSE 是 frozen-LLM 推理时系统,SLIM 是 RL 训练时系统,融合需要 offline MEC 近似。

    5.2 Evidence-calibrated skill bank governance for MUSE #

    Library Drift 的 Hoeffding-calibrated evidence floor($N_{\min} = 100$, $\epsilon \approx 0.20$)[2605.19576] 直接可移植到 MUSE 作为 skill retirement gate。MUSE 的 per-skill .memory.md 已包含使用历史,只需追加 success/fail 计数即可计算 $\hat{c}(s)$。这是一个 low-hanging fruit 的工程整合。

    5.3 Adaptive compression level routing(Missing Diagonal 实现) #

    MUSE 强制所有成功经验走 $L_2$ skill 创建路径。结合 Experience Compression Spectrum 的 meta-controller 设想和 MemSkill 的 RL routing,可设计一个 routing layer:

    • 简单/重复模式 → $L_3$ declarative rule(如 "never use deprecated API")
    • 中等复杂度 → $L_2$ procedural skill(当前 MUSE default)
    • 高度 context-dependent → $L_1$ episodic memory(保留具体 case)

    MemSkill 的 variable-size action space + PPO 设计 [2602.02474] 可直接复用为该 routing layer 的 controller。

    5.4 Cross-agent skill marketplace with drift monitoring #

    MUSE 的 cross-agent transfer 验证了 skill 的 agent-agnostic 性质。下一步是 multi-agent ecosystem 中的 skill sharing with quality governance:

    • Producer agent 创建 skill 并附带 unit tests
    • Consumer agents 使用 skill 并报告 per-agent $\hat{c}(s)$
    • 集中式 curator(Library Drift 的 Ratchet 机制)基于多 agent 聚合信号做 retirement

    这需要解决 Library Drift 未触及的问题:同一 skill 在不同 agent 上的 contribution score 分布差异如何处理(skill×agent interaction effect)。

    5.5 Per-skill memory → skill evolution without re-creation #

    MUSE 的 .memory.md 积累使用经验但仅用于 prompt context,MemSkill 的 designer 从 hard cases 提炼 skill 改进 [2602.02474]。将 MUSE 的 per-skill memory 作为 MemSkill-style designer 的输入——memory 积累到阈值时自动 trigger skill body 重写——可实现 continuous adaptation 而非 binary "test 失败才修补" 的 reactive 模式。