| ID | Title | 关联理由 |
|---|---|---|
| 2602.12430 | Agent Skills Architecture | 同为 Agent Skills 领域综述;2602.12430 是更早的系统化梳理,聚焦 SKILL.md 实现范式 + 安全治理框架,2605.07358 在其基础上扩展为更完整的四阶段生命周期分类学 |
| 2604.15877 | Experience Compression Spectrum | 将 memory/skill/rule 统一为经验压缩谱上的三个层级;为 2605.07358 的 acquisition 阶段(特别是 experience-derived)提供理论根基,并揭示 skill 作为 $L_2$ 压缩工件的本质 |
| 2605.19362 | Skill Comprehension | 从 usable-security 角度审计技能规范的用户可理解性;补充 2605.07358 缺失的"用户视角"——生命周期中 representation 阶段的质量不仅影响 agent 行为,也影响人类信任决策 |
| 2603.22455 | SkillRouter | 在 ~80K 技能池中实现 retrieve-and-rerank routing;是 2605.07358 retrieval/selection 阶段的 SOTA 实证系统,验证了 full-text access 对大规模技能路由的必要性 |
这四篇论文覆盖了 2605.07358 生命周期分类学的不同切面:2602.12430 覆盖架构 + 安全,2604.15877 覆盖 acquisition 的理论基础,2605.19362 覆盖 representation 的人因维度,2603.22455 覆盖 retrieval 的工程实现。
增量贡献:2605.07358 将 2602.12430 的三层渐进加载架构泛化为四阶段生命周期分类学(representation → acquisition → retrieval/selection → evolution),覆盖 122 篇论文 vs 2602.12430 覆盖约 30 篇核心工作。形式化定义 $S = (M, \mathcal{R}, \mathcal{C})$ [2605.07358] 比 2602.12430 的"SKILL.md + 脚本 + 资源"更抽象——允许非文件系统实现(如 code-backed skills)。
本质重叠:两者对"过程性知识 vs 工具连接"的区分(skills vs MCP)完全一致 [2602.12430]。2605.07358 的 Figure 4 (literature review, code repair, travel planning, anomaly investigation) 与 2602.12430 的 CUA 场景高度重合。
矛盾点:2602.12430 将安全治理框架(G1–G4 验证门控 + T1–T4 信任等级)视为核心原创贡献并给出完整架构设计 [2602.12430];2605.07358 仅在 §VII 将安全作为"开放挑战"一笔带过(PoisonedSkills 引用),未整合 2602.12430 的治理框架到自身分类学中。这暗示 2605.07358 的 evolution 阶段定义可能不完整——它包含 runtime governance 但缺少 trust-level 分层机制。
互补关系:2604.15877 的压缩谱 ($L_0 \to L_3$) [2604.15877] 为 2605.07358 的 acquisition 阶段提供了量化框架——experience-derived acquisition 实质上是 $L_0 \to L_2$ 的压缩操作(50–500×)。2605.07358 识别了四种 acquisition 来源但未量化各来源的信息压缩效率。
Delta:2604.15877 的核心贡献("missing diagonal"——无系统支持自适应跨层级压缩)直接挑战 2605.07358 的隐含假设:后者将 acquisition 和 evolution 视为独立阶段,但 2604.15877 论证了两者之间需要一个 meta-controller 实现压缩层级的动态切换 [2604.15877]。2605.07358 的闭环图(execution → evolution → retrieval)缺少"压缩层级选择"这一决策节点。
2605.07358 额外覆盖:2604.15877 完全忽略 human-derived 和 corpus-derived acquisition(只关注 experience-derived),而 2605.07358 的四路径分类更完整。
盲区互补:2605.07358 的 representation 阶段讨论 text-backed / code-backed / hybrid 三种格式 [2605.07358],但完全从 agent 消费能力角度定义"好的表征"。2605.19362 证明 representation 质量还有第二个维度——人类可理解性——878 个技能中仅 2.3% 提供全部四个 comprehension anchors [2605.19362]。这意味着 2605.07358 的形式化定义 $\mathcal{C}$ (applicability conditions) 在实践中严重欠规范。
Delta 量化:2605.19362 的 operational basis (92.1%) → example demonstration (19.0%) 的陡降分布 [2605.19362] 实证了 2605.07358 §VII-A 提到的"admission quality at scale"问题——生态系统中大多数技能在形式化定义上合格(有 $M$ 和 $\mathcal{C}$)但在 comprehension support 上不合格。
实证补全:2605.07358 的 retrieval/selection 分类学列举了四种检索范式(dense/sparse/generative/structure-aware)和四种选择视角(context-aware/composition/cost-utility/feedback-driven)[2605.07358],但缺少任何一种在大规模池(80K+)中的定量验证。2603.22455 直接填补此空白:在 ~80K 池中,metadata-only routing 下降 31–44pp [2603.22455],证明 2605.07358 分类的 dense retrieval 范式必须消费 full skill text 才能在生态规模下工作。
矛盾:2605.07358 将 retrieval 和 selection 视为概念上独立的两个子阶段;2603.22455 的实证表明在同质候选池中,单阶段 retrieval 已不够,但"selection"不是独立决策而是 listwise reranking——本质仍是 retrieval 的延伸。Pointwise selection(2605.07358 分类中 cost-utility 选择的朴素实现)在同质候选池中反而有害(43.3% vs 65.4% without reranker)[2603.22455]。
2605.07358 声称四阶段形成闭环(evolution outcomes 反馈到 retrieval)[2605.07358],但 2604.15877 映射 20+ 系统后发现 19 个系统中仅 AutoSkill 具备完整 lifecycle 管理 [2604.15877]。如果实践中几乎不存在闭环运行的系统,那么"闭环"只是分类学设计者的美学偏好而非实证发现。2605.07358 未提供任何一个系统完整运行四阶段闭环的 case study。
当 $\mathcal{R} = \emptyset$ 时,最小可行技能退化为"一个 markdown 文件 + 触发元数据"[2605.07358]。2605.07358 自己承认这与 system prompt 难以区分。但更严重的问题被 2605.19362 量化:92.1% 的实际技能满足最低形式要求(有 operational basis)但仅 19.0% 提供 example demonstration [2605.19362]。形式化定义允许的"合法技能"中大部分在实用层面不合格——定义的区分力不足。
2605.07358 将 retrieval 分为 dense/sparse/generative/structure-aware 四种范式 [2605.07358]。2603.22455 在 80K 池中实测表明:(1) BM25-sparse 在 metadata-only 下 Hit@1=0.0% [2603.22455];(2) dense retrieval 不够需加 listwise reranking (+8.7pp);(3) 四种范式之间的界限在工程实现中模糊化(retrieve-and-rerank 是 dense + 某种"structure-aware"的混合)。分类学的正交性在实践中不成立。
2605.07358 引用 SkillsBench 证明技能可能有负效用 [2605.07358],但将此视为 retrieval/selection 的失败而非系统性风险。2604.15877 提供更深的解释:LLM self-generated $L_2$ skills 在多任务上 +0.0pp [2604.15877],curated 才 +16.2pp——这意味着 experience-derived acquisition(2605.07358 分类中最大的一类)的价值完全取决于压缩保真度。2605.07358 的四路径分类没有区分"高保真 acquisition"和"低保真 acquisition",但 2604.15877 证明这是决定性因素。
2602.12430 用全文 ~40% 篇幅构建安全治理框架(G1–G4 + T1–T4),并提供 26.1% 漏洞率的定量证据 [2602.12430]。2605.07358 仅在 §VII 的 challenge 列表中一笔带过 PoisonedSkills,未将安全治理整合为生命周期的独立阶段或跨阶段约束。对于一个声称"comprehensive"的综述,安全维度的缺失是显著的。
2605.07358 占据"Agent Skills 领域的 canonical reference survey"生态位——它是截至 2026 年 5 月覆盖范围最广(122 篇论文、8 应用域)、分类最系统(四阶段生命周期 × 多维子分类)的综述。但它面临的挑战是:
| 维度 | 2605.07358 | 2602.12430 | 2604.15877 | 2603.22455 | 2605.19362 |
|---|---|---|---|---|---|
| 覆盖广度 | ★★★★★ | ★★★★ | ★★★ | ★★ | ★★ |
| 形式化深度 | ★★★ | ★★★ | ★★★★ | ★★★★ | ★★ |
| 工程可操作性 | ★★ | ★★★ | ★★ | ★★★★★ | ★★★ |
| 安全覆盖 | ★ | ★★★★★ | — | — | ★★★★ |
| 实证 grounding | ★★ (综合) | ★★★ (综合 + 审计) | ★★★ (聚合) | ★★★★★ (原创) | ★★★★ (原创) |
2605.07358 的 GitHub 资源仓库 (Awesome-Agent-Skills) 作为社区索引点存在,但其核心价值在分类学框架而非代码产出。实际采用路径:后续系统性工作引用其四阶段模型作为定位坐标("我们的工作在 evolution 阶段做了 X"),类似 Vaswani 2017 之于 Transformer 文献。
2604.15877 的"missing diagonal"[2604.15877] 与 2605.07358 的闭环生命周期可合并为一个更精细的模型:在 evolution 阶段加入压缩层级上移/下推机制。具体实现:当 $L_2$ skill 在多个 context 中一致成功 → 推升为 $L_3$ rule;当 $L_3$ rule 在特定 context 中失败 → 降级回 $L_2$ skill 并触发 revision。当前两个框架都缺少对方的视角:2605.07358 不讨论压缩层级选择,2604.15877 不讨论完整生命周期管理。
2605.19362 的四锚框架 [2605.19362] 可作为 2605.07358 evolution 阶段 validation 步骤的具体 operationalization:技能在进入可信仓库前必须通过 comprehension audit(四锚中至少 operational basis + output contract + example demonstration),否则标记为低信任等级。当前无系统将 comprehension 质量纳入 skill validation pipeline。
2603.22455 证明 full-text access 对路由至关重要 [2603.22455],但其 pipeline 是 stateless 的——不利用技能的 evolution 历史(revision count、success rate、age)。结合 2605.07358 的 evolution 阶段元数据,可构建 lifecycle-aware routing:将技能的验证状态、执行成功率、revision 次数作为 reranking 的附加信号,打破纯语义匹配的上限。
2602.12430 的 G1–G4 门控 [2602.12430] 应被重新概念化为 2605.07358 四阶段的每个阶段的正交约束(而非仅在 evolution 阶段):representation 阶段的 structural security(不允许 $\mathcal{R}$ 中的未审 script)、acquisition 阶段的 provenance verification、retrieval 阶段的 trust-weighted ranking、evolution 阶段的 behavioral sandboxing。当前无系统实现跨生命周期的统一安全策略。
2604.15877 发现 $L_3$ 负约束 ("don't do X") 比正指令 ("do Y") 有效得多 (+7–14pp vs hurt) [2604.15877]。2605.07358 的 evolution 阶段可引入"failure-to-rule compiler":从 execution 失败轨迹中自动提取"不应做什么"的 $L_3$ 规则,而非试图归纳"应做什么"。这是一个利用 negative evidence 的实用化方向,2605.07358 的分类学中完全缺失。