本篇处于 agent skill representation & optimization 领域的方法论交汇处,与以下三篇形成紧密关系:
| 论文 | 关系类型 | 共同关切 |
|---|---|---|
| SSL (2604.24026) | 同域竞争 | 都将 prose skill 文档转换为类型化中间表示以提升下游任务性能 |
| SkillReducer (2603.29919) | 同域互补 | 都以减少 token 消耗为核心目标,但切入点不同(压缩 vs 重构) |
| Agent Skills Architecture (2602.12430) | 范式定义者 | 定义了 Progressive Disclosure 三层架构——SaP 和 SkillReducer 都在该范式内工作 |
为什么这四篇构成一个 cluster:2602.12430 定义了 "skill-as-document" 范式和三层渐进加载架构 [2602.12430];2604.24026 和 2605.27955 分别提出了将 prose skill 转化为结构化表示的具体方案(JSON 图 vs typed pseudocode);2603.29919 则从 token efficiency 维度优化 skill 内容。四者的交集是:prose 形式的 skill 文档是 agent 性能的瓶颈,需要某种中间表示或压缩方案来改善检索/执行/成本。
SSL 将 skill 文档映射为三层类型化 JSON 图(Scheduling / Structural / Logical),目标是暴露证据以支持检索和风险评估 [2604.24026]。SaP 将 skill 文档重构为 typed pseudocode(typed contract + concrete action template),目标是提供可直接执行的 action 模板以打破 retrieval-action 反馈循环 [2605.27955]。
| 维度 | SSL | SaP |
|---|---|---|
| 输出形式 | JSON 结构化图 | Typed pseudocode + action template bundle |
| 优化目标 | 检索质量 + 风险评估 | Agent 执行正确性 + token 效率 |
| 评估任务 | Information retrieval (MRR) + classification (F1) | Agent task completion (win rate) |
| LLM 在 pipeline 中的角色 | 归一化器(生成结构化输出) | Contract extractor + binding extractor + rewrite cleanup |
| 验证机制 | 硬验证(JSON 格式/枚举/ID)+ 软检查 | 4-check 确定性验证器(Coverage/Binding/Replacement/Risk) |
| 与源文档关系 | 并行存在(不替代源文档) | 替代源文档(bundle 取代原始 prose) |
关键差异:SSL 是证据接口——它帮助外部系统理解 skill 内容,但 agent 执行时仍需阅读源文档或 SSL 结构 [2604.24026]。SaP 是执行接口——bundle 直接给 agent "what to type",agent 无需再从长文本中推导 action syntax [2605.27955]。两者解决 prose 瓶颈的层次不同:SSL 在检索层(帮找到正确 skill),SaP 在执行层(帮正确使用 skill)。
SkillReducer 的核心洞察:skill 内容中只有 38.5% 是 actionable core rules,通过 taxonomy-driven classification 分离后可安全压缩 [2603.29919]。SaP 的核心洞察:prose 表征本身是瓶颈——即使内容是 actionable 的,prose 形式仍然迫使 agent 反复推导 action syntax [2605.27955]。
| 维度 | SkillReducer | SaP |
|---|---|---|
| 诊断 | 内容冗余(60%+ 非 actionable) | 表征形式错误(prose 无法直接执行) |
| 手段 | 压缩 + progressive disclosure | 重构为 typed pseudocode + deterministic verification |
| Token 减少机制 | 删除非核心内容 + on-demand loading | 用紧凑的 typed contract 替代冗长 prose |
| 质量保证 | Faithfulness constraint (Eq. 3) + Gate 2 task-based validation | 4-check verifier (0% FP) + hierarchy-only retrieval |
| 适用场景 | 任何 skill-based agent | 检索型 skill library agent |
| less-is-more 效应 | 有(+2.8%,p=0.002) | 有(+74% relative win rate) |
互补性:SkillReducer 的 taxonomy classification 可作为 SaP pipeline 的前置 pass——先将非 actionable 内容移至 on-demand reference,再对剩余 actionable content 执行 pseudocode 重构。两者的 less-is-more 效应来源不同:SkillReducer 通过减少注意力稀释 [2603.29919],SaP 通过消除 action syntax 推导开销 [2605.27955]。
2602.12430 定义了三层渐进加载的架构蓝图 [2602.12430]:Level 1 (metadata)、Level 2 (SKILL.md body)、Level 3 (resources)。SaP 的 substituted bundle 本质上是对 Level 2 → agent context 这一步骤的质量优化——将 prose-formatted Level 2 替换为 pseudocode-formatted Level 2。
2602.12430 还预言了 phase transition 问题——技能库规模超过临界点后选择准确率骤降 [2602.12430]。SaP 的 hierarchy-only retrieval pool(children 不进入 top-K)实际上是对这一 phase transition 的工程缓解:通过限制检索池大小(只含 parents),延迟了检索精度退化的临界点。
SaP 的独特贡献是 4-check 确定性验证器 和 substituted bundle 的 prefix-first 布局。前者在 pipeline 中交替安排 LLM 生成与确定性验证,使产出质量不依赖 LLM 的可靠性 [2605.27955]。后者利用 LLM 对 context 前部的注意力偏向,将 executable action templates 放在 prefix 位置 [2605.27955]。这两个设计在相关论文中均无对应。
SaP 的主实验仅在 ALFWorld 上进行——一个文本解析器严格限制 action vocabulary 的仿真环境。"Nothing happens." 循环的根因是 环境的 brittle parser(verb-argument 不完全匹配则拒绝),而非 prose representation 的固有缺陷。在真实 computer-use 场景中(如 OSWorld),action space 是连续的 GUI 坐标和键盘输入,不存在 "verb 错误则 action 无效" 的硬约束。
反驳力度:SkillsBench 补充实验仅 10 tasks 且效果量极小(3 vs 2 wins)[2605.27955]。论文的核心机制(消除 verb-argument 推导开销)在非受限 action space 中的有效性完全未被验证。
30 个 synthetic negatives 分 3 类(命名错误 / 过宽 cluster / control-flow entanglement),由论文作者手工构建 [2605.27955]。这种 "设计 check → 设计 negatives to validate check" 的循环无法排除 distribution shift:real-world 的失败模式可能不落入这三类。0% FP 仅在已知失败类型上成立——对未知类型无保证。
对比 SSL 的做法:SSL 的归一化器在 6,184 个真实技能上运行,人工审计 100 个技能发现 17% 未忠实溯源 [2604.24026]。SSL 直面了 imperfection,而 SaP 用小样本 synthetic negatives 构造了一个虚假的 perfection 叙事。
论文声称 "bundle 而非 factoring 驱动收益",证据是打破 hierarchy → reward −27% [2605.27955]。但打破 hierarchy 同时引入了两个 confound:(1) 检索池变大→检索精度下降(noise effect),(2) child 脱离 parent context→丢失 action template(context loss)。论文无法区分这两个因素各贡献多少。如果主要是 (1)(retrieval noise),则收益归因于检索池设计而非 pseudocode 本身。
论文将 "−23% tokens" 与 "+74% wins" 并列为独立收益。但 §5 自身承认 "won games 提前结束 → token 节省是 reward gain 的结果而非 trade-off" [2605.27955]。这意味着 token 减少不是方法的独立价值主张——它完全由 win rate 驱动。如果 SaP 的 reward 与 baseline 相同,token 消耗是否仍然更低?未被测试。
Pipeline 中 BE 对每个 call-site 调用 gpt-4o-mini,RC 对每个 parent 调用一次 LLM [2605.27955]。在 skills_500 上有 2,105 个 call-sites + 322 个 parents = ~2,427 次 LLM 调用。论文未报告 pipeline 的总运行成本和时间。SkillReducer 至少报告了 "~$14–18 for 600 skills" [2603.29919]——SaP 的 build-time cost transparency 为零。
SaP 处于 "skill representation reform" 浪潮的执行层位置:
范式层次:
L0: Agent Skills 范式定义 (2602.12430)
└── L1: 结构化表示层
├── SSL (2604.24026): 证据接口 — 帮外部系统理解 skill
└── SaP (2605.27955): 执行接口 — 帮 agent 正确使用 skill
└── L2: 优化压缩层
└── SkillReducer (2603.29919): 内容瘦身 — 减少非核心 token
SaP 的生态位是 post-retrieval execution quality——假定检索已返回正确 skill,确保 agent 能正确地将 skill 转化为 environment action。这个位置与 SSL(检索质量)和 SkillReducer(加载成本)正交,理论上三者可叠加。
SaP 提出了一个有价值的设计原则:"LLM 生成是假设,确定性验证是裁判"。这种 generate-then-verify 的 pipeline 纪律超越了 skill 领域本身,可迁移到任何 LLM-in-the-loop 的 code/config generation 场景。但当前论文的验证仅限于 toy benchmark(ALFWorld 134 games),距离范式确立还需在大规模真实 skill library(如 2602.12430 讨论的 42,447 社区技能 [2602.12430])上验证。
SkillReducer 的 taxonomy classification 将 skill 内容分为 5 类(core rule / background / example / template / redundant)[2603.29919]。SaP 的 pseudocode 重构应仅针对 core rules——examples 和 templates 的 prose 形式可能反而有利于 few-shot prompting。一个 hybrid pipeline:先 SkillReducer Stage 2 分类 → 对 core rules 执行 SaP pseudocode 重构 → 对 examples 执行 SkillReducer 的 type-specific compression。预期收益:在 SkillReducer 的 39% body compression 基础上进一步改善 post-retrieval action correctness。
SSL 的 Logical 层已经提取了原子操作(12 种 act_type × 8 种 resource_scope)[2604.24026]。这些类型化原子操作可直接作为 SaP contract extraction 的 warm start——跳过 SaP pipeline 的 Stage 1-2(Parser + Candidate Proposer),从 SSL 的 Logical 节点直接生成 typed contracts。这可能显著降低 SaP 的 pipeline 成本(消除 2,105 次 call-site detection)并提高 contract 质量(利用 SSL 已验证的源文溯源)。
当前所有方案(SSL / SaP / SkillReducer)假设单一表示适用于所有 agent backbone。但证据显示:
一个 adaptive skill rendering 系统应根据 agent backbone 的 context window、instruction following 能力和 attention pattern 选择最优表示(full prose / SSL / pseudocode / compressed)。这需要一个 "representation router" 的 meta-model。
SaP 的 promotion score 使用固定权重 $w_b, w_c, w_r, w_s$ [2605.27955]。论文未公开具体值,也未探索权重是否应 domain-dependent。在不同类型的 skill library(coding skills vs GUI navigation skills vs data analysis skills)上,四个 check 的相对重要性可能不同。一个 meta-learning approach 可从少量标注的 success/failure cases 中学习 per-domain weights,在保持 0% FP 的约束下最大化 promotion yield。
2602.12430 指出 Skills 与 MCP 互补 [2602.12430],但 skill 文档目前没有跨框架标准。SaP 的 typed contract schema(trigger, I/O schema, pre/postconditions)具有成为 interop standard 的潜力——类似 OpenAPI spec 对 REST API 的作用。如果 typed pseudocode contract 成为 skill interchange format,不同 agent framework(Claude Code / Cursor / OpenCode)可共享 refactored skill libraries。SkillReducer 已验证跨框架 retention 0.944 [2603.29919],暗示标准化的可行性。