From Skill Text to Skill Structure: The Scheduling-Structural-Logical Representation for Agent Skills

agent 2604.24026
skill-representationstructured-knowledgeagent-skillsskill-discoveryrisk-assessmentcognitive-linguistics

From Skill Text to Skill Structure: The SSL Representation for Agent Skills — L2 #

§1 TL;DR #

SSL 将文本形式的 agent skill 文档拆解为三层 JSON 图(调度接口 / 场景执行图 / 原子操作图),用受限词表和源文溯源保证可比性。在 6,184 技能库上,Skill Discovery MRR@50 提升 +0.080,Risk Assessment macro F1 提升 +0.100。


§2 痛点 · 方法 · 结果 #

Q1 痛点 #

Agent 系统的技能以自然语言指令文件形式存在,调用接口、执行流程和操作/资源证据三类信息混杂在同一文本表面。这导致两个下游任务受阻:

  1. 技能检索(Skill Discovery):大规模技能库需要超越稀疏元数据的实现级线索来匹配用户意图,但通用检索器在工具/技能文档上的迁移效果不稳定。
  2. 风险评估(Risk Assessment):第三方技能拥有广泛的文件、网络、凭证访问权限,数据泄露、权限提升等风险信号分散在长文本指令中,难以在执行前系统审查。
  3. 核心瓶颈:缺少一个位于原始文档与下游系统之间的中间表示层——能暴露技能证据而不需要反复重新解析全文。

    Q2 方法 #

    SSL(Scheduling-Structural-Logical)将一个技能文档 $d$ 映射为一个类型化三层图:

    $$G_d = (r_{\mathrm{sch}},\, G_{\mathrm{str}},\, G_{\mathrm{log}},\, R_{\mathrm{cont}},\, R_{\mathrm{entry}})$$

    三层各解耦一种证据:

    符号设计类比暴露什么
    Scheduling$r_{\mathrm{sch}}$Memory Organization Packets (Schank 1980)技能级接口:目标、意图签名、I/O 合约、依赖、控制流特征
    Structural$G_{\mathrm{str}}$Script Theory (Schank & Abelson 1977)场景级执行图:有向图节点为类型化执行阶段(PREPARE / ACQUIRE / REASON / ACT / VERIFY / RECOVER / FINALIZE),边为阶段转移
    Logical$G_{\mathrm{log}}$Conceptual Dependency (Schank 1972)逻辑步骤级操作图:12 种原语动作类型 × 8 种资源范围,每个节点记录 actor、instrument、前置条件、效果、资源边界

    辅助关系 $R_{\mathrm{cont}}$(包含关系:场景→技能,逻辑步骤→场景)和 $R_{\mathrm{entry}}$(入口指针)将三层组装为可遍历的多级图。

    三项设计约束:Compact(只保留管理所需证据)、Typed(受限词表保证跨技能可比性)、Grounded(字段严格摘要源文档证据,不推断隐含行为)。

    核心技术壁垒:四阶段 LLM 归一化流水线。用 DeepSeek-V3.2 将自由形式的自然语言技能文档转换为 SSL schema 的约束 NL2JSON 过程——在 6,184 个技能上达到 98.16% 的有效产出率和 83% 的人工审计源文溯源准确度。难点不在 schema 设计本身,而在于从多样化、欠规范的文本中可靠地提取类型化、有溯源的记录。四个 pass:(1) 提取技能级记录,(2) 分解为 2-5 个场景,(3) 展开每个场景为源文溯源的原子操作,(4) 验证(全局唯一 ID、合法枚举、合法转移目标、包含/入口指针一致性)。

    Q3 结果 #

    任务指标基线SSL 增强Δ95% CI
    Skill DiscoveryMRR@500.649 (Desc + Source Outline)0.729 (Desc + SSL-Rich)+0.080[0.051, 0.111]
    Risk AssessmentMacro F10.409 (Full Doc)0.509 (Full Doc + SSL)+0.100[0.051, 0.152]

    发布资产:6,184 技能归一化语料库、431 条意图级检索查询、252 个六维风险标签技能。代码与数据开源于 https://github.com/COOLPKU/SSL。


    §3 架构 / 方法图 #

    Figure 1: SSL representation overview — skill artifact to three-layer structured graph

    Paper Figure 1: SSL 表示总览。文本技能文档经归一化器转换为三层结构:调度层(调用级信号)、结构层(场景执行图)、逻辑层(原子操作与资源证据)。结构化视图保留与原文档的配对关系,支持 Skill Discovery 和 Risk Assessment 等下游任务。

    Fig. 1 的关键读法:注意 SSL 不是取代原文档而是与之并行存在——这解释了 §5 实验中为何 Risk Assessment 的最佳方案是原文档+SSL 组合而非 SSL 单独使用。三层之间通过 $R_{\mathrm{cont}}$(包含)和 $R_{\mathrm{entry}}$(入口)关系连接,形成可遍历但边界清晰的多级图。

    Table 4: Core fields of the SSL schema by layer

    Paper Table 4: SSL schema 三层的核心字段定义。Scheduling 层暴露路由和调用接口;Structural 层将技能表示为类型化执行阶段的图;Logical 层记录原子操作和资源使用事实。

    Table 4 展示了 SSL 的具体字段设计。值得注意的是 Logical 层的 resource_scope 字段(MEMORY / LOCAL_FS / CODEBASE / PROCESS / USER_DATA / CREDENTIALS / NETWORK / OTHER)直接服务于风险评估——它让资源接触面从长文本指令中显式化。Structural 层的 scene_type 受限为 7 个枚举值,保证跨技能的阶段类型可直接比较。

    stateDiagram-v2 direction TB state "Skill Artifact (d)" as doc state "Scheduling Layer" as sch { [*] --> skill_record skill_record: r_sch — skill-level interface note right of skill_record goal, intent_signature, I/O contracts, dependencies, control_flow_features, tags, top_pattern end note } state "Structural Layer" as str { PREPARE --> ACQUIRE ACQUIRE --> REASON REASON --> ACT ACT --> VERIFY VERIFY --> FINALIZE : success VERIFY --> RECOVER : failure RECOVER --> REASON : retry } state "Logical Layer" as log { READ --> SELECT SELECT --> VALIDATE VALIDATE --> INFER INFER --> CALL_TOOL CALL_TOOL --> WRITE WRITE --> NOTIFY } doc --> sch : Pass 1 Extract doc --> str : Pass 2 Decompose doc --> log : Pass 3 Expand sch --> str : R_entry str --> log : R_cont

    Mermaid 图补充展示了三层间的数据流和归一化流水线的四个 pass(提取 → 分解 → 展开 → 验证)。Structural 层的 7 种场景类型构成一个典型的执行阶段状态机,允许分支和回退(VERIFY 失败 → RECOVER → 重试 REASON)。Logical 层的 12 种动作原语覆盖从信息访问(READ)到外部交互(CALL_TOOL / TRANSFER)到控制终止(TERMINATE)的全操作谱。


    §4 作者证明 #

    无形式化作者证明 — 仅实证。 论文定义了 SSL 的图结构(Eq. 1)和归一化器的源文溯源准确度指标(Eq. 2),但不包含关于下游任务性能的形式化保证或收敛证明。评价完全基于实证实验。

    记号表 #

    符号定义出处
    $d$技能文档(技能指令文件)§3.1
    $G_d$$d$ 的完整 SSL 表示§3.1, Eq. 1
    $r_{\mathrm{sch}}$Scheduling 层记录(技能级接口)§3.1, §3.2.1
    $G_{\mathrm{str}}$Structural 层场景图§3.1, §3.2.2
    $G_{\mathrm{log}}$Logical 层逻辑步骤图§3.1, §3.2.3
    $R_{\mathrm{cont}}$跨层包含关系§3.1
    $R_{\mathrm{entry}}$入口指针§3.1
    $\text{scene\_type}$7-枚举场景类型Appendix A, Table 5
    $\text{act\_type}$12-枚举动作原语类型Appendix A, Table 5
    $\text{resource\_scope}$8-枚举资源范围Appendix A, Table 5

    方程物理意义 #

    Eq. 1: $G_d = (r_{\mathrm{sch}}, G_{\mathrm{str}}, G_{\mathrm{log}}, R_{\mathrm{cont}}, R_{\mathrm{entry}})$

    将一个技能文档分解为三种证据(调用接口、执行阶段、原子操作)加两个辅助关系(包含和入口),形成可遍历的多级图。这是一个 schema 定义而非可优化的目标函数——它规定了结构化表示的形状,不涉及训练或梯度。

    Eq. 2: $\text{Support Accuracy} = \frac{\#\{\text{audited claims labeled Yes}\}}{\#\{\text{all audited claims}\}}$

    衡量归一化器产出中被人工确认为溯源于源文档的 SSL 声明比例。在 100 个技能的审计集上,item-level support accuracy = 83%。这意味着约 1/6 的 SSL 字段未能准确溯源——但下游任务对这种噪声表现出一定鲁棒性。

    实证有效性检查 #

    #检查项结果评价
    1受限词表一致性7 scene types、12 act types、8 resource scopes 通过硬验证(Appendix C Pass 4)通过
    2消融单调性Skill Discovery 中 SSL-Shallow (0.716) < SSL-Sched (0.694) — 非单调;但 SSL-Rich (0.729) 最优部分通过:Sched 不优于 Shallow,可能因 scheduling 视图的紧凑度反而稀释了 tags 的检索信号
    3互补性检验Risk Assessment 中 Full SSL 单独 (0.422) 仅略优于 Full Doc (0.409),但组合 (0.509) 跳跃最大通过:结构化和非结构化视图互补而非冗余
    4Bootstrap 显著性两个主比较的 95% CI 均不包含零通过
    5归一化器产出率6,184/6,300 = 98.16%通过:流水线对多样化技能文档鲁棒
    6反例诚实度Case 3 (electric-proxy-auth) 明确展示 SSL 低估源文语境导致风险判断退化通过:论文主动报告失败模式

    可被形式化约束的指标:归一化器的源文溯源保证理论上可通过信息检索式的 recall/precision 对齐指标来约束——即证明 SSL 字段集合在信息论意义上保留了源文档中的任务相关证据。论文未追求这一方向。


    §5 实验与数据 #

    5.1 Skill Discovery(6,184 候选,431 查询) #

    检索基础设施:Qwen3-Embedding-0.6B 生成稠密向量,FAISS 内积索引,L2 归一化。10 种输入表示在相同管道下对比。

    核心结果(Table 1 摘要):

    组别输入表示MRR@50Recall@10
    非 SSL 基线Desc Only0.5880.761
    Full Doc0.6450.821
    Desc + Source Outline0.6490.833
    SSL 增强Desc + SSL-Shallow0.7160.879
    Desc + SSL-Rich0.7290.905
    Full Doc + SSL-Rich0.6810.856

    关键发现:

    • SSL-Shallow 已超越最强非 SSL 基线(0.716 vs 0.649):仅 name + tags + goal 这三个类型化字段就提供了超过冗长原文的检索价值。
    • 全文档稀释效应:Desc + SSL-Rich (0.729) > Full Doc + SSL-Rich (0.681)。完整文档不仅未增强结构化信号,反而稀释了它——对检索而言,简洁的类型化元数据比详尽的原文更有效。
    • Safety 类查询获益最大:SSL-Shallow 在 safety 维度 MRR@50 从 0.539 (Desc + Source Outline) 跳升至 0.700,因为 SSL 的 control_flow_features 和 resource_scope 字段直接匹配安全相关意图。

    5.2 Risk Assessment(252 技能,6 维度) #

    Table 10: Risk Assessment dimensions and boundary rules

    Paper Table 10: 六个风险维度的正面信号定义和维度间边界规则。每个维度独立标注(非互斥),gold labels 由 Gemini-3.1-pro-preview、Claude-Sonnet-4.5、GPT-5 三模型多数投票产生。

    Table 10 揭示了风险评估基准设计的精细之处:维度边界规则明确区分了重叠概念(如"数据泄露需要数据外流,仅读取不够"、"昂贵执行若无资产损害算 resource abuse 而非 destructive behavior"),这保证了标注的一致性和可复现性。

    核心结果(Tables 2-3 摘要):

    输入Macro Acc.Macro Prec.Macro Rec.Macro F1
    Desc Only0.7140.8230.1480.235
    Full Doc0.7650.8280.2830.409
    Full SSL0.7780.8410.3150.422
    Full Doc + SSL0.8010.8840.3820.509
    维度Full DocFull SSLDoc + SSL
    Data Exfiltration0.5110.6510.699
    Destructive Behavior0.3710.4030.439
    Privilege Escalation0.3810.3480.455
    Covert Execution0.2220.0830.264
    Resource Abuse0.2710.3230.419
    Credential Access0.6950.7220.780

    关键发现:

    • Recall 驱动的提升:组合视图的 macro recall (0.382) 远高于 text-only (0.283),同时 precision 不降反升 (0.884 vs 0.828)。SSL 帮助模型发现文本中微弱但具体的风险信号。
    • Privilege Escalation 最难:正面率仅 6.0% (15/252),所有输入都挣扎于此——最佳 F1 仅 0.455。这一维度需要连接授权边界、范围扩展等跨位置的隐含推理,可能从根本上难以从静态文档检测。
    • Covert Execution 的 SSL 退化:Full SSL 单独在此维度 F1 仅 0.083,远低于 Full Doc 的 0.222。当不可观察性线索嵌入在散文上下文而非显式操作字段中时,归一化器倾向于遗漏这些信号。

    5.3 归一化器质量 #

    • 产出率:6,184/6,300 = 98.16%
    • 人工审计源文溯源准确度:100 个技能上 83%
    • 初始 pass 用 DeepSeek-V3.2 (thinking mode, temp 0.1);失败后 retry 用 no-thinking mode
    • 验证包含:JSON 可解析性、必填字段、唯一 ID、合法枚举值、包含/入口指针一致性、转移目标有效性

    §6 论证链 #

    步骤论点证据强度
    1. 表示瓶颈存在文本形式的技能文档将调用接口、执行结构和操作证据混杂,阻碍了自动化系统的分析和验证§1-2 定性分析:neural retriever 在工具文档上迁移不佳;安全审计需要连接分散在长文本中的操作线索合理;动机文献充分但缺少量化证明"混杂"本身的程度
    2. 三层分解有效SSL 的 Scheduling/Structural/Logical 三层解耦了三种技能证据§3 形式化定义(Eq. 1);Appendix B 完整实例(Writing Refiner 技能);Appendix D 人工审计 83% 溯源准确度中等;83% 意味着 17% 的字段未忠实溯源,这限制了 grounded 设计目标的完全实现
    3. 结构化证据改善检索Desc + SSL-Rich 将 MRR@50 从 0.649 提升至 0.729Table 1 全量结果 + Appendix H bootstrap CI [0.051, 0.111] + 5 种查询类型的一致性(Table 8)强;统计显著,消融模式一致
    4. 结构化证据与源文档互补地改善风险评估Full Doc + SSL 将 macro F1 从 0.409 提升至 0.509Tables 2-3 全量结果 + Appendix H bootstrap CI [0.051, 0.152] + 6 维度中 5 个维度的一致提升强;但 Full SSL 单独仅 0.422→互补性是核心而非可替代性
    5. 不可替代性SSL 是证据接口而非源文档替代品:检索偏好简洁 SSL(不含全文),风险评估需要两者结合两个任务的不对称表现(§5.1-5.2 讨论 + Case 3 反例)令人信服;跨任务不对称性是最自然的解释

    §7 实现 cross-reference #

    代码仓库:https://github.com/COOLPKU/SSL — 包含 SSL schema 定义、归一化流水线提示词、评估数据集和重建脚本。

    关键实现细节

    1. 归一化器的 thinking/no-thinking 双 pass 策略:初始 pass 使用 DeepSeek-V3.2 thinking mode(temperature 0.1),失败后切换至 no-thinking mode 重试(最多 3 次)。这一策略平衡了推理深度和鲁棒性——thinking mode 对复杂技能更精确但偶尔产出格式错误的 JSON,no-thinking mode 更稳定但可能过度简化。
    2. 硬验证 vs 软检查分离:硬验证(JSON 可解析、必填字段、唯一 ID、合法枚举、合法转移目标)失败时直接拒绝并重试;软检查(场景输出由逻辑步骤绑定支持、数据流一致性)仅作为修复/QC 工具,不触发拒绝。这一分离避免了过度严格导致的产出率下降,同时保持了结构正确性的底线。
    3. 工具栈:DeepSeek-V3.2(归一化器 + 风险评估 judge)、Qwen3-Embedding-0.6B(稠密向量)、FAISS(内积索引,每种表示约 25 MB)。所有实验为推理 only,无模型训练。

      [实现未公开的部分]:论文未开源归一化器的完整提示词模板(仅在 Appendix C 提供阶段描述),也未公开 Risk Assessment 的 judge 提示词。这限制了归一化器质量的独立验证和风险评估实验的完全复现。