Agent Skills for Large Language Models: Architecture, Acquisition, Security, and the Path Forward

agent 2602.12430
agent-skillstool-usecomputer-use-agentmodel-context-protocolprogressive-disclosureskill-security

Agent Skills for Large Language Models — L2 #

§1 TL;DR #

首篇系统综述 Agent Skills 范式:将 LLM agent 的过程性知识封装为可组合、可分发的模块化 SKILL.md 包,涵盖三层渐进加载架构、六种技能获取路径、CUA 部署及安全治理(26.1% 社区技能含漏洞),并提出四层信任等级 + 四阶验证门控的治理框架。

§2 痛点 / 方法 / 结果 #

Q1 — 痛点 #

通用 LLM 缺少专业过程性知识,fine-tuning 成本高且不可组合,RAG 只能注入被动知识而无法指导多步工作流;同时社区技能快速增长(62k+ stars)带来严峻安全威胁——42,447 个社区技能中 26.1% 含漏洞。

Q2 — 方法 #

Agent Skills 范式:技能即目录(SKILL.md + 脚本 + 资源),通过三层渐进加载(Progressive Disclosure)最小化上下文窗口消耗:

与 MCP(Model Context Protocol)形成互补的 Agentic Stack:Skills 提供"做什么"的过程性智能,MCP 提供"如何连接"的工具/数据通道。

技能获取六路径:人工编写、RL with Skill Library (SAGE)、自主探索 (SEAgent)、结构化技能库 (CUA-Skill)、组合合成 (Agentic Proposing)、Multi-Agent → Single-Agent 编译。

安全治理框架(原创贡献):四阶验证门控(G1 静态分析 → G2 LLM 语义分类 → G3 行为沙箱 → G4 权限清单验证)→ 四层信任等级(T1 未审社区技能 → T4 厂商认证),结合运行时监控实现信任动态升降级。

核心技术壁垒:将"技能即文档"抽象与分层信任模型结合——使不可审计的 prompt injection 表面变为可治理的分级权限问题,这要求同时理解 NL 指令的语义安全性和运行时行为的侧信道。

Q3 — 结果 #

方法基准关键指标
SAGEAppWorld+8.9% SGC, −59% tokens
SEAgentOSWorld (5 apps)11.3%→34.5% success
CUA-SkillWindowsAgentArena57.5% SOTA
Agentic ProposingAIME 202591.6% (30B solver)
OSWorld-V proprietaryOSWorld-Verified72.6% (超人类 72.4%)
安全审计42,447 skills26.1% 含漏洞;5.2% 高危

§3 架构 / 方法图 #

Figure 1: Progressive disclosure architecture of Agent Skills

Paper Figure 1: Progressive disclosure architecture — 信息分三阶段加载以最小化上下文窗口消耗。Level 1 元数据始终在 system prompt 中(~数十 token/技能),Level 2 完整指令在触发时注入,Level 3 脚本/资源按需引用。

这是本文的核心架构创新:通过将技能包分层为"目录→正文→附件"三级,agent 可承载大规模技能库(数百技能)而上下文代价仅为 Level 1 元数据之和。技能触发后注入的是 preparation(改变 agent 知道什么、能做什么),而非 output——这区别于 function call 直接产出结果。

Figure 2: Skill-equipped CUA architecture

Paper Figure 2: Skill-equipped CUA agent 架构 — 展示技能库、感知-定位-动作管道、MCP 连接层与操作系统环境的交互。Router 选择活跃技能并注入 agent 上下文。

CUA(Computer-Use Agent)是 Skills 范式的首要部署场景:GUI 操作天然需要组合感知、推理、动作序列,与技能抽象直接对应。图中展示了从 Skill Router 到 Perception-Grounding-Action pipeline 再到 OS 环境的完整数据流。

stateDiagram-v2 [*] --> SkillRouter: user request SkillRouter --> SkillLoading: match skill metadata (L1) SkillLoading --> ContextInjection: load SKILL.md body (L2) ContextInjection --> PlanningLoop: enriched context PlanningLoop --> ToolCall: act (MCP / bash / file) ToolCall --> Verify: tool result Verify --> PlanningLoop: retry / next step Verify --> ResourceLoad: need L3 resource ResourceLoad --> PlanningLoop: script/doc injected PlanningLoop --> [*]: task complete

Skills 与 MCP 的分工:

维度Agent SkillsMCP
主要角色过程性知识工具连接
单元含 SKILL.md 的目录含端点的 server
加载方Agent on triggerClient on config
修改上下文 + 权限可用工具/数据
持久性文件系统会话级

§4 作者证明 #

无形式化作者证明 — 仅实证。

本文为综述,无原创数学模型或收敛性证明。以下为实证声明验证:

#声明证据来源验证状态
126.1% 社区技能含漏洞Liu et al. [14], SkillScan 分析 31,132/42,447 技能定量实证,有统计显著性
2含脚本技能漏洞率 2.12× (OR=2.12, p<0.001)Liu et al. [14]定量实证,置信度高
3SAGE +8.9% SGC, −59% tokensWang et al. [29], AppWorld 基准独立消融实验
4SEAgent 11.3%→34.5%Sun et al. [26], OSWorld 5 新应用独立实验
5CUA-Skill 57.5% SOTAChen et al. [9], WindowsAgentArena独立实验
6OSWorld-V 72.6% 超人类 72.4%Table 3, 多来源交叉验证独立基准,但人类基线样本量未报告

可量化但未被量化的指标:技能加载对推理延迟的影响(Level 2/3 注入的 token 开销 vs. 端到端响应时间);技能选择准确率随库规模增长的具体 phase transition 临界点。

失败模式分类(agent-specific):论文识别出三类安全失败——prompt injection via skill files、data exfiltration via bundled scripts、agent hijacking via instruction manipulation。主导模式为 data exfiltration (13.3%),治理框架主要针对此类。

§5 实验与数据 #

Table 2: Taxonomy of skill acquisition methods

Paper Table 2: 2025–2026 年 LLM Agent 技能获取方法分类。六种模态各有代表性工作、机制、基准和关键结果。

技能获取六条路径在不同基准上展示了技能范式的广泛适用性。关键观察:(1) RL-based 方法(SAGE)在 token 效率上优势显著(−59%),表明技能复用确实减少冗余推理;(2) 自主探索(SEAgent)在完全未见过的软件上仍能达 34.5%,验证了技能发现的泛化性;(3) 组合合成使 30B 模型在数学竞赛上达 91.6%,说明技能组合能力涌现。

Table 3: CUA benchmark results

Paper Table 3: 代表性 CUA 基准结果(截至 2026 年 2 月)。OSWorld 成功率从 2024 初的个位数攀升至超人类水平(72.6% vs 72.4%)。

CUA 基准的快速进步验证了 skills 范式在 GUI 操作域的有效性。值得注意的是 7B 模型通过 RL 自进化训练仅用 3,000 样本就在 ScreenSpot-Pro 上超越 72B UI-TARS 达 24.2 pp——数据效率惊人,暗示小模型 + 正确技能可能比大模型无技能更优。

Figure 3: Skill Trust and Lifecycle Governance Framework

Paper Figure 3: 提出的技能信任与生命周期治理框架(本文原创贡献)。四种技能获取路径 → 四阶验证管道 (G1–G4) → 四层信任等级 (T1–T4),结合运行时监控实现信任动态演化。

这是本文最重要的原创贡献。框架的架构感知设计将三层渐进加载直接映射到信任等级:T1 仅暴露 Level 1 元数据;T2+ 可访问 Level 2 指令;T3/T4 才允许 Level 3 脚本执行——从结构上切断了 2.12× 漏洞率的攻击面。

Table 1: Skills vs MCP comparison

Paper Table 1: Agent Skills 与 MCP 作为 Agentic Stack 互补层的对比。两者正交:skills 管过程知识,MCP 管工具连接。

§6 论证链 #

步骤论点支撑依赖
1单体 LLM 的通用知识无法覆盖专业过程性任务,prompt/RAG/tool-call 均有结构性缺陷§1–2: prompt 不可组合、tools 只返回结果不注入知识、RAG 是被动的
2Agent Skills(SKILL.md + 三层渐进加载)解决上述缺陷:可组合、可分发、按需注入过程性知识§3: 架构定义、Figure 1、执行生命周期步骤 1
3Skills 与 MCP 互补形成完整 Agentic Stack§3.3: Table 1 对比、orthogonality 论证步骤 2
4技能可通过六种路径获取,均在对应基准上验证有效§4: Table 2、SAGE/SEAgent/CUA-Skill/Agentic Proposing 实验步骤 2
5CUA 是 Skills 范式的天然部署场景,GUI 操作基准已达超人类水平§5: Table 3、OSWorld-V 72.6% vs 72.4% human步骤 2, 4
6快速增长带来严峻安全问题:26.1% 漏洞率、单一工业化攻击者占 54.1%§6.1–6.3: 三项独立安全研究交叉验证步骤 3, 4
7提出 G1–G4 验证门控 + T1–T4 信任等级的治理框架,架构感知地映射到渐进加载层§6.4: Figure 3、framework 设计步骤 2, 6

§7 实现 cross-reference #

[实现未公开]

本文为综述论文,未提供开源实现仓库。涉及的系统实现分散在各引用工作中:

核心技术壁垒:安全治理框架(G1–G4 + T1–T4)的落地需要同时实现 NL 语义级漏洞检测(G2 的 LLM-based semantic classification)和行为级侧信道检测(G3 的 sandbox execution),目前两者均无成熟开源方案。

关键实现细节

  1. Tool Search Tool 将 token 开销降低 85%(§3.4)——在大规模技能库场景下必须实现程序化工具发现,否则上下文窗口会被工具描述溢出。
  2. 技能库存在 phase transition(§4.6)——单 agent 管理的技能数有硬上限,超过临界规模后选择准确率骤降,需 multi-agent 分担或分层路由。