SSL 将文本形式的 agent skill 文档拆解为三层 JSON 图(调度接口 / 场景执行图 / 原子操作图),用受限词表和源文溯源保证可比性。在 6,184 技能库上,Skill Discovery MRR@50 提升 +0.080,Risk Assessment macro F1 提升 +0.100。
Agent 系统的技能以自然语言指令文件形式存在,调用接口、执行流程和操作/资源证据三类信息混杂在同一文本表面。这导致两个下游任务受阻:
核心瓶颈:缺少一个位于原始文档与下游系统之间的中间表示层——能暴露技能证据而不需要反复重新解析全文。
SSL(Scheduling-Structural-Logical)将一个技能文档 $d$ 映射为一个类型化三层图:
$$G_d = (r_{\mathrm{sch}},\, G_{\mathrm{str}},\, G_{\mathrm{log}},\, R_{\mathrm{cont}},\, R_{\mathrm{entry}})$$
三层各解耦一种证据:
| 层 | 符号 | 设计类比 | 暴露什么 |
|---|---|---|---|
| Scheduling | $r_{\mathrm{sch}}$ | Memory Organization Packets (Schank 1980) | 技能级接口:目标、意图签名、I/O 合约、依赖、控制流特征 |
| Structural | $G_{\mathrm{str}}$ | Script Theory (Schank & Abelson 1977) | 场景级执行图:有向图节点为类型化执行阶段(PREPARE / ACQUIRE / REASON / ACT / VERIFY / RECOVER / FINALIZE),边为阶段转移 |
| Logical | $G_{\mathrm{log}}$ | Conceptual Dependency (Schank 1972) | 逻辑步骤级操作图:12 种原语动作类型 × 8 种资源范围,每个节点记录 actor、instrument、前置条件、效果、资源边界 |
辅助关系 $R_{\mathrm{cont}}$(包含关系:场景→技能,逻辑步骤→场景)和 $R_{\mathrm{entry}}$(入口指针)将三层组装为可遍历的多级图。
三项设计约束:Compact(只保留管理所需证据)、Typed(受限词表保证跨技能可比性)、Grounded(字段严格摘要源文档证据,不推断隐含行为)。
核心技术壁垒:四阶段 LLM 归一化流水线。用 DeepSeek-V3.2 将自由形式的自然语言技能文档转换为 SSL schema 的约束 NL2JSON 过程——在 6,184 个技能上达到 98.16% 的有效产出率和 83% 的人工审计源文溯源准确度。难点不在 schema 设计本身,而在于从多样化、欠规范的文本中可靠地提取类型化、有溯源的记录。四个 pass:(1) 提取技能级记录,(2) 分解为 2-5 个场景,(3) 展开每个场景为源文溯源的原子操作,(4) 验证(全局唯一 ID、合法枚举、合法转移目标、包含/入口指针一致性)。
| 任务 | 指标 | 基线 | SSL 增强 | Δ | 95% CI |
|---|---|---|---|---|---|
| Skill Discovery | MRR@50 | 0.649 (Desc + Source Outline) | 0.729 (Desc + SSL-Rich) | +0.080 | [0.051, 0.111] |
| Risk Assessment | Macro F1 | 0.409 (Full Doc) | 0.509 (Full Doc + SSL) | +0.100 | [0.051, 0.152] |
发布资产:6,184 技能归一化语料库、431 条意图级检索查询、252 个六维风险标签技能。代码与数据开源于 https://github.com/COOLPKU/SSL。

Paper Figure 1: SSL 表示总览。文本技能文档经归一化器转换为三层结构:调度层(调用级信号)、结构层(场景执行图)、逻辑层(原子操作与资源证据)。结构化视图保留与原文档的配对关系,支持 Skill Discovery 和 Risk Assessment 等下游任务。
Fig. 1 的关键读法:注意 SSL 不是取代原文档而是与之并行存在——这解释了 §5 实验中为何 Risk Assessment 的最佳方案是原文档+SSL 组合而非 SSL 单独使用。三层之间通过 $R_{\mathrm{cont}}$(包含)和 $R_{\mathrm{entry}}$(入口)关系连接,形成可遍历但边界清晰的多级图。

Paper Table 4: SSL schema 三层的核心字段定义。Scheduling 层暴露路由和调用接口;Structural 层将技能表示为类型化执行阶段的图;Logical 层记录原子操作和资源使用事实。
Table 4 展示了 SSL 的具体字段设计。值得注意的是 Logical 层的 resource_scope 字段(MEMORY / LOCAL_FS / CODEBASE / PROCESS / USER_DATA / CREDENTIALS / NETWORK / OTHER)直接服务于风险评估——它让资源接触面从长文本指令中显式化。Structural 层的 scene_type 受限为 7 个枚举值,保证跨技能的阶段类型可直接比较。
Mermaid 图补充展示了三层间的数据流和归一化流水线的四个 pass(提取 → 分解 → 展开 → 验证)。Structural 层的 7 种场景类型构成一个典型的执行阶段状态机,允许分支和回退(VERIFY 失败 → RECOVER → 重试 REASON)。Logical 层的 12 种动作原语覆盖从信息访问(READ)到外部交互(CALL_TOOL / TRANSFER)到控制终止(TERMINATE)的全操作谱。
无形式化作者证明 — 仅实证。 论文定义了 SSL 的图结构(Eq. 1)和归一化器的源文溯源准确度指标(Eq. 2),但不包含关于下游任务性能的形式化保证或收敛证明。评价完全基于实证实验。
| 符号 | 定义 | 出处 |
|---|---|---|
| $d$ | 技能文档(技能指令文件) | §3.1 |
| $G_d$ | $d$ 的完整 SSL 表示 | §3.1, Eq. 1 |
| $r_{\mathrm{sch}}$ | Scheduling 层记录(技能级接口) | §3.1, §3.2.1 |
| $G_{\mathrm{str}}$ | Structural 层场景图 | §3.1, §3.2.2 |
| $G_{\mathrm{log}}$ | Logical 层逻辑步骤图 | §3.1, §3.2.3 |
| $R_{\mathrm{cont}}$ | 跨层包含关系 | §3.1 |
| $R_{\mathrm{entry}}$ | 入口指针 | §3.1 |
| $\text{scene\_type}$ | 7-枚举场景类型 | Appendix A, Table 5 |
| $\text{act\_type}$ | 12-枚举动作原语类型 | Appendix A, Table 5 |
| $\text{resource\_scope}$ | 8-枚举资源范围 | Appendix A, Table 5 |
Eq. 1: $G_d = (r_{\mathrm{sch}}, G_{\mathrm{str}}, G_{\mathrm{log}}, R_{\mathrm{cont}}, R_{\mathrm{entry}})$
将一个技能文档分解为三种证据(调用接口、执行阶段、原子操作)加两个辅助关系(包含和入口),形成可遍历的多级图。这是一个 schema 定义而非可优化的目标函数——它规定了结构化表示的形状,不涉及训练或梯度。
Eq. 2: $\text{Support Accuracy} = \frac{\#\{\text{audited claims labeled Yes}\}}{\#\{\text{all audited claims}\}}$
衡量归一化器产出中被人工确认为溯源于源文档的 SSL 声明比例。在 100 个技能的审计集上,item-level support accuracy = 83%。这意味着约 1/6 的 SSL 字段未能准确溯源——但下游任务对这种噪声表现出一定鲁棒性。
| # | 检查项 | 结果 | 评价 |
|---|---|---|---|
| 1 | 受限词表一致性 | 7 scene types、12 act types、8 resource scopes 通过硬验证(Appendix C Pass 4) | 通过 |
| 2 | 消融单调性 | Skill Discovery 中 SSL-Shallow (0.716) < SSL-Sched (0.694) — 非单调;但 SSL-Rich (0.729) 最优 | 部分通过:Sched 不优于 Shallow,可能因 scheduling 视图的紧凑度反而稀释了 tags 的检索信号 |
| 3 | 互补性检验 | Risk Assessment 中 Full SSL 单独 (0.422) 仅略优于 Full Doc (0.409),但组合 (0.509) 跳跃最大 | 通过:结构化和非结构化视图互补而非冗余 |
| 4 | Bootstrap 显著性 | 两个主比较的 95% CI 均不包含零 | 通过 |
| 5 | 归一化器产出率 | 6,184/6,300 = 98.16% | 通过:流水线对多样化技能文档鲁棒 |
| 6 | 反例诚实度 | Case 3 (electric-proxy-auth) 明确展示 SSL 低估源文语境导致风险判断退化 | 通过:论文主动报告失败模式 |
可被形式化约束的指标:归一化器的源文溯源保证理论上可通过信息检索式的 recall/precision 对齐指标来约束——即证明 SSL 字段集合在信息论意义上保留了源文档中的任务相关证据。论文未追求这一方向。
检索基础设施:Qwen3-Embedding-0.6B 生成稠密向量,FAISS 内积索引,L2 归一化。10 种输入表示在相同管道下对比。
核心结果(Table 1 摘要):
| 组别 | 输入表示 | MRR@50 | Recall@10 |
|---|---|---|---|
| 非 SSL 基线 | Desc Only | 0.588 | 0.761 |
| Full Doc | 0.645 | 0.821 | |
| Desc + Source Outline | 0.649 | 0.833 | |
| SSL 增强 | Desc + SSL-Shallow | 0.716 | 0.879 |
| Desc + SSL-Rich | 0.729 | 0.905 | |
| Full Doc + SSL-Rich | 0.681 | 0.856 |
关键发现:

Paper Table 10: 六个风险维度的正面信号定义和维度间边界规则。每个维度独立标注(非互斥),gold labels 由 Gemini-3.1-pro-preview、Claude-Sonnet-4.5、GPT-5 三模型多数投票产生。
Table 10 揭示了风险评估基准设计的精细之处:维度边界规则明确区分了重叠概念(如"数据泄露需要数据外流,仅读取不够"、"昂贵执行若无资产损害算 resource abuse 而非 destructive behavior"),这保证了标注的一致性和可复现性。
核心结果(Tables 2-3 摘要):
| 输入 | Macro Acc. | Macro Prec. | Macro Rec. | Macro F1 |
|---|---|---|---|---|
| Desc Only | 0.714 | 0.823 | 0.148 | 0.235 |
| Full Doc | 0.765 | 0.828 | 0.283 | 0.409 |
| Full SSL | 0.778 | 0.841 | 0.315 | 0.422 |
| Full Doc + SSL | 0.801 | 0.884 | 0.382 | 0.509 |
| 维度 | Full Doc | Full SSL | Doc + SSL |
|---|---|---|---|
| Data Exfiltration | 0.511 | 0.651 | 0.699 |
| Destructive Behavior | 0.371 | 0.403 | 0.439 |
| Privilege Escalation | 0.381 | 0.348 | 0.455 |
| Covert Execution | 0.222 | 0.083 | 0.264 |
| Resource Abuse | 0.271 | 0.323 | 0.419 |
| Credential Access | 0.695 | 0.722 | 0.780 |
关键发现:
| 步骤 | 论点 | 证据 | 强度 |
|---|---|---|---|
| 1. 表示瓶颈存在 | 文本形式的技能文档将调用接口、执行结构和操作证据混杂,阻碍了自动化系统的分析和验证 | §1-2 定性分析:neural retriever 在工具文档上迁移不佳;安全审计需要连接分散在长文本中的操作线索 | 合理;动机文献充分但缺少量化证明"混杂"本身的程度 |
| 2. 三层分解有效 | SSL 的 Scheduling/Structural/Logical 三层解耦了三种技能证据 | §3 形式化定义(Eq. 1);Appendix B 完整实例(Writing Refiner 技能);Appendix D 人工审计 83% 溯源准确度 | 中等;83% 意味着 17% 的字段未忠实溯源,这限制了 grounded 设计目标的完全实现 |
| 3. 结构化证据改善检索 | Desc + SSL-Rich 将 MRR@50 从 0.649 提升至 0.729 | Table 1 全量结果 + Appendix H bootstrap CI [0.051, 0.111] + 5 种查询类型的一致性(Table 8) | 强;统计显著,消融模式一致 |
| 4. 结构化证据与源文档互补地改善风险评估 | Full Doc + SSL 将 macro F1 从 0.409 提升至 0.509 | Tables 2-3 全量结果 + Appendix H bootstrap CI [0.051, 0.152] + 6 维度中 5 个维度的一致提升 | 强;但 Full SSL 单独仅 0.422→互补性是核心而非可替代性 |
| 5. 不可替代性 | SSL 是证据接口而非源文档替代品:检索偏好简洁 SSL(不含全文),风险评估需要两者结合 | 两个任务的不对称表现(§5.1-5.2 讨论 + Case 3 反例) | 令人信服;跨任务不对称性是最自然的解释 |
代码仓库:https://github.com/COOLPKU/SSL — 包含 SSL schema 定义、归一化流水线提示词、评估数据集和重建脚本。
关键实现细节:
工具栈:DeepSeek-V3.2(归一化器 + 风险评估 judge)、Qwen3-Embedding-0.6B(稠密向量)、FAISS(内积索引,每种表示约 25 MB)。所有实验为推理 only,无模型训练。
[实现未公开的部分]:论文未开源归一化器的完整提示词模板(仅在 Appendix C 提供阶段描述),也未公开 Risk Assessment 的 judge 提示词。这限制了归一化器质量的独立验证和风险评估实验的完全复现。