A Comprehensive Survey on Agent Skills: Taxonomy, Techniques, and Applications

agent 2605.07358 — Cross-paper Synthesis

2605.07358 · L3 Per-Paper Synthesis #

§1 相关论文 #

IDTitle关联理由
2602.12430Agent Skills Architecture同为 Agent Skills 领域综述;2602.12430 是更早的系统化梳理,聚焦 SKILL.md 实现范式 + 安全治理框架,2605.07358 在其基础上扩展为更完整的四阶段生命周期分类学
2604.15877Experience Compression Spectrum将 memory/skill/rule 统一为经验压缩谱上的三个层级;为 2605.07358 的 acquisition 阶段(特别是 experience-derived)提供理论根基,并揭示 skill 作为 $L_2$ 压缩工件的本质
2605.19362Skill Comprehension从 usable-security 角度审计技能规范的用户可理解性;补充 2605.07358 缺失的"用户视角"——生命周期中 representation 阶段的质量不仅影响 agent 行为,也影响人类信任决策
2603.22455SkillRouter在 ~80K 技能池中实现 retrieve-and-rerank routing;是 2605.07358 retrieval/selection 阶段的 SOTA 实证系统,验证了 full-text access 对大规模技能路由的必要性

这四篇论文覆盖了 2605.07358 生命周期分类学的不同切面:2602.12430 覆盖架构 + 安全,2604.15877 覆盖 acquisition 的理论基础,2605.19362 覆盖 representation 的人因维度,2603.22455 覆盖 retrieval 的工程实现。

§2 本篇 vs 相关论文的 delta #

vs 2602.12430 (Agent Skills Architecture) #

增量贡献:2605.07358 将 2602.12430 的三层渐进加载架构泛化为四阶段生命周期分类学(representation → acquisition → retrieval/selection → evolution),覆盖 122 篇论文 vs 2602.12430 覆盖约 30 篇核心工作。形式化定义 $S = (M, \mathcal{R}, \mathcal{C})$ [2605.07358] 比 2602.12430 的"SKILL.md + 脚本 + 资源"更抽象——允许非文件系统实现(如 code-backed skills)。

本质重叠:两者对"过程性知识 vs 工具连接"的区分(skills vs MCP)完全一致 [2602.12430]。2605.07358 的 Figure 4 (literature review, code repair, travel planning, anomaly investigation) 与 2602.12430 的 CUA 场景高度重合。

矛盾点:2602.12430 将安全治理框架(G1–G4 验证门控 + T1–T4 信任等级)视为核心原创贡献并给出完整架构设计 [2602.12430];2605.07358 仅在 §VII 将安全作为"开放挑战"一笔带过(PoisonedSkills 引用),未整合 2602.12430 的治理框架到自身分类学中。这暗示 2605.07358 的 evolution 阶段定义可能不完整——它包含 runtime governance 但缺少 trust-level 分层机制。

vs 2604.15877 (Experience Compression Spectrum) #

互补关系:2604.15877 的压缩谱 ($L_0 \to L_3$) [2604.15877] 为 2605.07358 的 acquisition 阶段提供了量化框架——experience-derived acquisition 实质上是 $L_0 \to L_2$ 的压缩操作(50–500×)。2605.07358 识别了四种 acquisition 来源但未量化各来源的信息压缩效率。

Delta:2604.15877 的核心贡献("missing diagonal"——无系统支持自适应跨层级压缩)直接挑战 2605.07358 的隐含假设:后者将 acquisition 和 evolution 视为独立阶段,但 2604.15877 论证了两者之间需要一个 meta-controller 实现压缩层级的动态切换 [2604.15877]。2605.07358 的闭环图(execution → evolution → retrieval)缺少"压缩层级选择"这一决策节点。

2605.07358 额外覆盖:2604.15877 完全忽略 human-derived 和 corpus-derived acquisition(只关注 experience-derived),而 2605.07358 的四路径分类更完整。

vs 2605.19362 (Skill Comprehension) #

盲区互补:2605.07358 的 representation 阶段讨论 text-backed / code-backed / hybrid 三种格式 [2605.07358],但完全从 agent 消费能力角度定义"好的表征"。2605.19362 证明 representation 质量还有第二个维度——人类可理解性——878 个技能中仅 2.3% 提供全部四个 comprehension anchors [2605.19362]。这意味着 2605.07358 的形式化定义 $\mathcal{C}$ (applicability conditions) 在实践中严重欠规范。

Delta 量化:2605.19362 的 operational basis (92.1%) → example demonstration (19.0%) 的陡降分布 [2605.19362] 实证了 2605.07358 §VII-A 提到的"admission quality at scale"问题——生态系统中大多数技能在形式化定义上合格(有 $M$ 和 $\mathcal{C}$)但在 comprehension support 上不合格。

vs 2603.22455 (SkillRouter) #

实证补全:2605.07358 的 retrieval/selection 分类学列举了四种检索范式(dense/sparse/generative/structure-aware)和四种选择视角(context-aware/composition/cost-utility/feedback-driven)[2605.07358],但缺少任何一种在大规模池(80K+)中的定量验证。2603.22455 直接填补此空白:在 ~80K 池中,metadata-only routing 下降 31–44pp [2603.22455],证明 2605.07358 分类的 dense retrieval 范式必须消费 full skill text 才能在生态规模下工作。

矛盾:2605.07358 将 retrieval 和 selection 视为概念上独立的两个子阶段;2603.22455 的实证表明在同质候选池中,单阶段 retrieval 已不够,但"selection"不是独立决策而是 listwise reranking——本质仍是 retrieval 的延伸。Pointwise selection(2605.07358 分类中 cost-utility 选择的朴素实现)在同质候选池中反而有害(43.3% vs 65.4% without reranker)[2603.22455]

§3 可攻击面 #

Attack 1: 生命周期"闭环"可能是 artifact #

2605.07358 声称四阶段形成闭环(evolution outcomes 反馈到 retrieval)[2605.07358],但 2604.15877 映射 20+ 系统后发现 19 个系统中仅 AutoSkill 具备完整 lifecycle 管理 [2604.15877]。如果实践中几乎不存在闭环运行的系统,那么"闭环"只是分类学设计者的美学偏好而非实证发现。2605.07358 未提供任何一个系统完整运行四阶段闭环的 case study。

Attack 2: 形式化定义 $S = (M, \mathcal{R}, \mathcal{C})$ 过于宽松以至无用 #

当 $\mathcal{R} = \emptyset$ 时,最小可行技能退化为"一个 markdown 文件 + 触发元数据"[2605.07358]。2605.07358 自己承认这与 system prompt 难以区分。但更严重的问题被 2605.19362 量化:92.1% 的实际技能满足最低形式要求(有 operational basis)但仅 19.0% 提供 example demonstration [2605.19362]。形式化定义允许的"合法技能"中大部分在实用层面不合格——定义的区分力不足。

Attack 3: Retrieval/selection 分类学未 survive 规模化实测 #

2605.07358 将 retrieval 分为 dense/sparse/generative/structure-aware 四种范式 [2605.07358]。2603.22455 在 80K 池中实测表明:(1) BM25-sparse 在 metadata-only 下 Hit@1=0.0% [2603.22455];(2) dense retrieval 不够需加 listwise reranking (+8.7pp);(3) 四种范式之间的界限在工程实现中模糊化(retrieve-and-rerank 是 dense + 某种"structure-aware"的混合)。分类学的正交性在实践中不成立。

Attack 4: "负效用"警告被低估 #

2605.07358 引用 SkillsBench 证明技能可能有负效用 [2605.07358],但将此视为 retrieval/selection 的失败而非系统性风险。2604.15877 提供更深的解释:LLM self-generated $L_2$ skills 在多任务上 +0.0pp [2604.15877],curated 才 +16.2pp——这意味着 experience-derived acquisition(2605.07358 分类中最大的一类)的价值完全取决于压缩保真度。2605.07358 的四路径分类没有区分"高保真 acquisition"和"低保真 acquisition",但 2604.15877 证明这是决定性因素。

Attack 5: 安全维度被系统性边缘化 #

2602.12430 用全文 ~40% 篇幅构建安全治理框架(G1–G4 + T1–T4),并提供 26.1% 漏洞率的定量证据 [2602.12430]。2605.07358 仅在 §VII 的 challenge 列表中一笔带过 PoisonedSkills,未将安全治理整合为生命周期的独立阶段或跨阶段约束。对于一个声称"comprehensive"的综述,安全维度的缺失是显著的。

§4 生态位 #

范式定位 #

2605.07358 占据"Agent Skills 领域的 canonical reference survey"生态位——它是截至 2026 年 5 月覆盖范围最广(122 篇论文、8 应用域)、分类最系统(四阶段生命周期 × 多维子分类)的综述。但它面临的挑战是:

  1. 被后来者取代的风险低:作为首个提出完整生命周期分类学的工作,其术语框架(representation/acquisition/retrieval-selection/evolution)已被后续工作引用。
  2. 被实践超越的风险高:SkillRouter [2603.22455] 和 Experience Compression [2604.15877] 分别在 retrieval 和 acquisition 维度给出了比分类学更具操作性的方案。
  3. 与相邻工作的位次 #

    维度2605.073582602.124302604.158772603.224552605.19362
    覆盖广度★★★★★★★★★★★★★★★★
    形式化深度★★★★★★★★★★★★★★★★
    工程可操作性★★★★★★★★★★★★★★★
    安全覆盖★★★★★★★★★
    实证 grounding★★ (综合)★★★ (综合 + 审计)★★★ (聚合)★★★★★ (原创)★★★★ (原创)

    采用证据 #

    2605.07358 的 GitHub 资源仓库 (Awesome-Agent-Skills) 作为社区索引点存在,但其核心价值在分类学框架而非代码产出。实际采用路径:后续系统性工作引用其四阶段模型作为定位坐标("我们的工作在 evolution 阶段做了 X"),类似 Vaswani 2017 之于 Transformer 文献。

    §5 未探索方向 #

    Direction 1: Compression-aware lifecycle #

    2604.15877 的"missing diagonal"[2604.15877] 与 2605.07358 的闭环生命周期可合并为一个更精细的模型:在 evolution 阶段加入压缩层级上移/下推机制。具体实现:当 $L_2$ skill 在多个 context 中一致成功 → 推升为 $L_3$ rule;当 $L_3$ rule 在特定 context 中失败 → 降级回 $L_2$ skill 并触发 revision。当前两个框架都缺少对方的视角:2605.07358 不讨论压缩层级选择,2604.15877 不讨论完整生命周期管理。

    Direction 2: Comprehension-gated skill admission #

    2605.19362 的四锚框架 [2605.19362] 可作为 2605.07358 evolution 阶段 validation 步骤的具体 operationalization:技能在进入可信仓库前必须通过 comprehension audit(四锚中至少 operational basis + output contract + example demonstration),否则标记为低信任等级。当前无系统将 comprehension 质量纳入 skill validation pipeline。

    Direction 3: Adaptive full-text routing with lifecycle signals #

    2603.22455 证明 full-text access 对路由至关重要 [2603.22455],但其 pipeline 是 stateless 的——不利用技能的 evolution 历史(revision count、success rate、age)。结合 2605.07358 的 evolution 阶段元数据,可构建 lifecycle-aware routing:将技能的验证状态、执行成功率、revision 次数作为 reranking 的附加信号,打破纯语义匹配的上限。

    Direction 4: Security as cross-cutting lifecycle constraint #

    2602.12430 的 G1–G4 门控 [2602.12430] 应被重新概念化为 2605.07358 四阶段的每个阶段的正交约束(而非仅在 evolution 阶段):representation 阶段的 structural security(不允许 $\mathcal{R}$ 中的未审 script)、acquisition 阶段的 provenance verification、retrieval 阶段的 trust-weighted ranking、evolution 阶段的 behavioral sandboxing。当前无系统实现跨生命周期的统一安全策略。

    Direction 5: Negative-constraint skill extraction at $L_3$ #

    2604.15877 发现 $L_3$ 负约束 ("don't do X") 比正指令 ("do Y") 有效得多 (+7–14pp vs hurt) [2604.15877]。2605.07358 的 evolution 阶段可引入"failure-to-rule compiler":从 execution 失败轨迹中自动提取"不应做什么"的 $L_3$ 规则,而非试图归纳"应做什么"。这是一个利用 negative evidence 的实用化方向,2605.07358 的分类学中完全缺失。