Skill-as-Pseudocode: Refactoring Skill Libraries to Pseudocode for LLM Agents

agent 2605.27955 — Cross-paper Synthesis

Skill-as-Pseudocode (2605.27955) — L3 Per-Paper Synthesis #

§1 相关论文 #

本篇处于 agent skill representation & optimization 领域的方法论交汇处,与以下三篇形成紧密关系:

论文关系类型共同关切
SSL (2604.24026)同域竞争都将 prose skill 文档转换为类型化中间表示以提升下游任务性能
SkillReducer (2603.29919)同域互补都以减少 token 消耗为核心目标,但切入点不同(压缩 vs 重构)
Agent Skills Architecture (2602.12430)范式定义者定义了 Progressive Disclosure 三层架构——SaP 和 SkillReducer 都在该范式内工作

为什么这四篇构成一个 cluster:2602.12430 定义了 "skill-as-document" 范式和三层渐进加载架构 [2602.12430];2604.24026 和 2605.27955 分别提出了将 prose skill 转化为结构化表示的具体方案(JSON 图 vs typed pseudocode);2603.29919 则从 token efficiency 维度优化 skill 内容。四者的交集是:prose 形式的 skill 文档是 agent 性能的瓶颈,需要某种中间表示或压缩方案来改善检索/执行/成本


§2 本篇 vs 相关论文的 delta #

2.1 vs SSL (2604.24026): 表示目标的根本分歧 #

SSL 将 skill 文档映射为三层类型化 JSON 图(Scheduling / Structural / Logical),目标是暴露证据以支持检索和风险评估 [2604.24026]。SaP 将 skill 文档重构为 typed pseudocode(typed contract + concrete action template),目标是提供可直接执行的 action 模板以打破 retrieval-action 反馈循环 [2605.27955]

维度SSLSaP
输出形式JSON 结构化图Typed pseudocode + action template bundle
优化目标检索质量 + 风险评估Agent 执行正确性 + token 效率
评估任务Information retrieval (MRR) + classification (F1)Agent task completion (win rate)
LLM 在 pipeline 中的角色归一化器(生成结构化输出)Contract extractor + binding extractor + rewrite cleanup
验证机制硬验证(JSON 格式/枚举/ID)+ 软检查4-check 确定性验证器(Coverage/Binding/Replacement/Risk)
与源文档关系并行存在(不替代源文档)替代源文档(bundle 取代原始 prose)

关键差异:SSL 是证据接口——它帮助外部系统理解 skill 内容,但 agent 执行时仍需阅读源文档或 SSL 结构 [2604.24026]。SaP 是执行接口——bundle 直接给 agent "what to type",agent 无需再从长文本中推导 action syntax [2605.27955]。两者解决 prose 瓶颈的层次不同:SSL 在检索层(帮找到正确 skill),SaP 在执行层(帮正确使用 skill)。

2.2 vs SkillReducer (2603.29919): 压缩 vs 重构 #

SkillReducer 的核心洞察:skill 内容中只有 38.5% 是 actionable core rules,通过 taxonomy-driven classification 分离后可安全压缩 [2603.29919]。SaP 的核心洞察:prose 表征本身是瓶颈——即使内容是 actionable 的,prose 形式仍然迫使 agent 反复推导 action syntax [2605.27955]

维度SkillReducerSaP
诊断内容冗余(60%+ 非 actionable)表征形式错误(prose 无法直接执行)
手段压缩 + progressive disclosure重构为 typed pseudocode + deterministic verification
Token 减少机制删除非核心内容 + on-demand loading用紧凑的 typed contract 替代冗长 prose
质量保证Faithfulness constraint (Eq. 3) + Gate 2 task-based validation4-check verifier (0% FP) + hierarchy-only retrieval
适用场景任何 skill-based agent检索型 skill library agent
less-is-more 效应有(+2.8%,p=0.002)有(+74% relative win rate)

互补性:SkillReducer 的 taxonomy classification 可作为 SaP pipeline 的前置 pass——先将非 actionable 内容移至 on-demand reference,再对剩余 actionable content 执行 pseudocode 重构。两者的 less-is-more 效应来源不同:SkillReducer 通过减少注意力稀释 [2603.29919],SaP 通过消除 action syntax 推导开销 [2605.27955]

2.3 vs Agent Skills Architecture (2602.12430): 范式实例化 #

2602.12430 定义了三层渐进加载的架构蓝图 [2602.12430]:Level 1 (metadata)、Level 2 (SKILL.md body)、Level 3 (resources)。SaP 的 substituted bundle 本质上是对 Level 2 → agent context 这一步骤的质量优化——将 prose-formatted Level 2 替换为 pseudocode-formatted Level 2。

2602.12430 还预言了 phase transition 问题——技能库规模超过临界点后选择准确率骤降 [2602.12430]。SaP 的 hierarchy-only retrieval pool(children 不进入 top-K)实际上是对这一 phase transition 的工程缓解:通过限制检索池大小(只含 parents),延迟了检索精度退化的临界点。

2.4 新增贡献总结 #

SaP 的独特贡献是 4-check 确定性验证器substituted bundle 的 prefix-first 布局。前者在 pipeline 中交替安排 LLM 生成与确定性验证,使产出质量不依赖 LLM 的可靠性 [2605.27955]。后者利用 LLM 对 context 前部的注意力偏向,将 executable action templates 放在 prefix 位置 [2605.27955]。这两个设计在相关论文中均无对应。


§3 可攻击面 #

Attack 1: ALFWorld 评估的生态效度极低 #

SaP 的主实验仅在 ALFWorld 上进行——一个文本解析器严格限制 action vocabulary 的仿真环境。"Nothing happens." 循环的根因是 环境的 brittle parser(verb-argument 不完全匹配则拒绝),而非 prose representation 的固有缺陷。在真实 computer-use 场景中(如 OSWorld),action space 是连续的 GUI 坐标和键盘输入,不存在 "verb 错误则 action 无效" 的硬约束。

反驳力度:SkillsBench 补充实验仅 10 tasks 且效果量极小(3 vs 2 wins)[2605.27955]。论文的核心机制(消除 verb-argument 推导开销)在非受限 action space 中的有效性完全未被验证。

Attack 2: 4-check verifier 的 0% FP 是 calibration artifact #

30 个 synthetic negatives 分 3 类(命名错误 / 过宽 cluster / control-flow entanglement),由论文作者手工构建 [2605.27955]。这种 "设计 check → 设计 negatives to validate check" 的循环无法排除 distribution shift:real-world 的失败模式可能不落入这三类。0% FP 仅在已知失败类型上成立——对未知类型无保证。

对比 SSL 的做法:SSL 的归一化器在 6,184 个真实技能上运行,人工审计 100 个技能发现 17% 未忠实溯源 [2604.24026]。SSL 直面了 imperfection,而 SaP 用小样本 synthetic negatives 构造了一个虚假的 perfection 叙事。

Attack 3: Hierarchy-only retrieval 的收益归因可疑 #

论文声称 "bundle 而非 factoring 驱动收益",证据是打破 hierarchy → reward −27% [2605.27955]。但打破 hierarchy 同时引入了两个 confound:(1) 检索池变大→检索精度下降(noise effect),(2) child 脱离 parent context→丢失 action template(context loss)。论文无法区分这两个因素各贡献多少。如果主要是 (1)(retrieval noise),则收益归因于检索池设计而非 pseudocode 本身。

Attack 4: Token 减少是 reward gain 的机械结果而非独立优势 #

论文将 "−23% tokens" 与 "+74% wins" 并列为独立收益。但 §5 自身承认 "won games 提前结束 → token 节省是 reward gain 的结果而非 trade-off" [2605.27955]。这意味着 token 减少不是方法的独立价值主张——它完全由 win rate 驱动。如果 SaP 的 reward 与 baseline 相同,token 消耗是否仍然更低?未被测试。

Attack 5: BE 和 RC 的 LLM 调用引入不可控成本 #

Pipeline 中 BE 对每个 call-site 调用 gpt-4o-mini,RC 对每个 parent 调用一次 LLM [2605.27955]。在 skills_500 上有 2,105 个 call-sites + 322 个 parents = ~2,427 次 LLM 调用。论文未报告 pipeline 的总运行成本和时间。SkillReducer 至少报告了 "~$14–18 for 600 skills" [2603.29919]——SaP 的 build-time cost transparency 为零。


§4 生态位 #

范式定位 #

SaP 处于 "skill representation reform" 浪潮的执行层位置:


范式层次:
  L0: Agent Skills 范式定义 (2602.12430)
    └── L1: 结构化表示层
        ├── SSL (2604.24026): 证据接口 — 帮外部系统理解 skill
        └── SaP (2605.27955): 执行接口 — 帮 agent 正确使用 skill
    └── L2: 优化压缩层
        └── SkillReducer (2603.29919): 内容瘦身 — 减少非核心 token

SaP 的生态位是 post-retrieval execution quality——假定检索已返回正确 skill,确保 agent 能正确地将 skill 转化为 environment action。这个位置与 SSL(检索质量)和 SkillReducer(加载成本)正交,理论上三者可叠加。

采纳证据 #

范式变革潜力 #

SaP 提出了一个有价值的设计原则:"LLM 生成是假设,确定性验证是裁判"。这种 generate-then-verify 的 pipeline 纪律超越了 skill 领域本身,可迁移到任何 LLM-in-the-loop 的 code/config generation 场景。但当前论文的验证仅限于 toy benchmark(ALFWorld 134 games),距离范式确立还需在大规模真实 skill library(如 2602.12430 讨论的 42,447 社区技能 [2602.12430])上验证。


§5 未探索方向 #

方向 1: SaP × SkillReducer pipeline 融合 #

SkillReducer 的 taxonomy classification 将 skill 内容分为 5 类(core rule / background / example / template / redundant)[2603.29919]。SaP 的 pseudocode 重构应仅针对 core rules——examples 和 templates 的 prose 形式可能反而有利于 few-shot prompting。一个 hybrid pipeline:先 SkillReducer Stage 2 分类 → 对 core rules 执行 SaP pseudocode 重构 → 对 examples 执行 SkillReducer 的 type-specific compression。预期收益:在 SkillReducer 的 39% body compression 基础上进一步改善 post-retrieval action correctness。

方向 2: SSL 结构化表示 → SaP contract extraction 的 bootstrap #

SSL 的 Logical 层已经提取了原子操作(12 种 act_type × 8 种 resource_scope)[2604.24026]。这些类型化原子操作可直接作为 SaP contract extraction 的 warm start——跳过 SaP pipeline 的 Stage 1-2(Parser + Candidate Proposer),从 SSL 的 Logical 节点直接生成 typed contracts。这可能显著降低 SaP 的 pipeline 成本(消除 2,105 次 call-site detection)并提高 contract 质量(利用 SSL 已验证的源文溯源)。

方向 3: Adaptive representation 根据 agent backbone 能力选择 #

当前所有方案(SSL / SaP / SkillReducer)假设单一表示适用于所有 agent backbone。但证据显示:

一个 adaptive skill rendering 系统应根据 agent backbone 的 context window、instruction following 能力和 attention pattern 选择最优表示(full prose / SSL / pseudocode / compressed)。这需要一个 "representation router" 的 meta-model。

方向 4: 4-check verifier 的 learned weight adaptation #

SaP 的 promotion score 使用固定权重 $w_b, w_c, w_r, w_s$ [2605.27955]。论文未公开具体值,也未探索权重是否应 domain-dependent。在不同类型的 skill library(coding skills vs GUI navigation skills vs data analysis skills)上,四个 check 的相对重要性可能不同。一个 meta-learning approach 可从少量标注的 success/failure cases 中学习 per-domain weights,在保持 0% FP 的约束下最大化 promotion yield。

方向 5: 跨 agent 的 skill bundle 标准化 #

2602.12430 指出 Skills 与 MCP 互补 [2602.12430],但 skill 文档目前没有跨框架标准。SaP 的 typed contract schema(trigger, I/O schema, pre/postconditions)具有成为 interop standard 的潜力——类似 OpenAPI spec 对 REST API 的作用。如果 typed pseudocode contract 成为 skill interchange format,不同 agent framework(Claude Code / Cursor / OpenCode)可共享 refactored skill libraries。SkillReducer 已验证跨框架 retention 0.944 [2603.29919],暗示标准化的可行性。