AgentSM: Semantic Memory for Agentic Text-to-SQL

algorithm 2601.15709 — Cross-paper Synthesis

AgentSM (2601.15709) — L3 相关论文综合 #

Mode A(per-paper synthesis)。Target = AgentSM,一个用 结构化语义记忆 + 复合工具 加速 agentic Text-to-SQL 的算法论文 [2601.15709]。 需要坦率说明:本 cluster 是 algorithm 大类下的异质采样——多数 peer 是 RL 世界模型、attention 量化、GPU 通信、可解释性、benchmark、多模态训练、MoE 优化器,与 Text-to-SQL / agent memory 主题不重叠。因此本篇的价值在于跨机制类比(synthetic-data 制造、RoPE/长上下文瓶颈、memory 结构化),而非同题竞品对比。

1. 相关论文 #

按与 AgentSM 的机制邻近度分三档:

A 档 — 直接机制邻近(agentic pipeline + synthetic-data 制造)

B 档 — 底层现象邻近(RoPE / 长上下文 / lost-in-the-middle)

C 档 — 纯类比(algorithm 大类共性,无主题交集)

cluster 判定:真正可做 delta 对比的只有 A 档(K2)+ B 档(NoLiMa/Massive Values),其余为氛围类比。下文的 delta / 攻击面 / 生态位主要围绕 A、B 档展开。

2. 本篇 vs 相关论文的 delta #

vs Kimi K2 — synthetic agentic-trajectory 制造的两种终点

维度AgentSM [2601.15709]Kimi K2 [2507.20534]
合成轨迹用途inference-time 检索复用(存库、按 same-DB + max-sim 召回)training-time SFT/RL 语料(消化进权重)
是否改模型权重否(纯 in-context,模型冻结)是(15.5T tokens 训练)
过滤机制regex 步骤分类 + markdown 结构化multi-agent LLM-judge
覆盖策略per-DB budget 分配偏向大 schema(Algorithm 1 L6–11)tool 分布 t-SNE 对齐(3k 真实 → 20k 合成)

新意(AgentSM 相对 K2):把合成轨迹当作外挂 retrieval 记忆而非训练语料,从而 (a) 免训练、(b) 可解释(markdown 分段可读)、(c) 让中端模型(claude-4-sonnet,非 o3/Qwen3)逼近 SOTA [2601.15709]。这是一条比 K2 更轻量的路径。

增量而非颠覆:合成-执行-过滤 pipeline 本身是 K2 已有范式;AgentSM 的贡献是把它接到 retrieval 而非 gradient。

vs NoLiMa / Massive Values — 直面 vs 回避长上下文瓶颈

vs DreamerV3 — "在合成经验中学习" 的两种载体

DreamerV3 在世界模型 imagination 中训练策略 [2301.04104];AgentSM 在合成 trajectory store 中预演探索。delta:Dreamer 的合成经验是神经世界模型 rollout(连续、可微、可训练),AgentSM 的是真实数据库上执行的离散 trace(离散、检索式、不训练)。前者赌模型能外推,后者赌真实执行的可信度——AgentSM 更保守但更可靠(synthetic question 在真实 DB 上跑)。


3. 可攻击面 #

(A1) "无 reasoning model 达 SOTA" 的因果归属存疑。

AgentSM 宣称 44.8% 是在不用 o3/Qwen3 下取得的 [2601.15709]。但对照 NoLiMa:推理模型(GPT-o1)在长上下文关联检索上同样退化到 31.1% [2502.05167]——即 reasoning model 未必是 Spider 2.0 这类 schema-linking-bound 任务的正确武器。因此 "不用 reasoning model 也行" 可能不是 AgentSM 的功劳,而是任务本身对 reasoning model 不敏感。作者未做 "AgentSM + o3" 的上界实验来隔离这两者。

(A2) 头条数字自相矛盾,削弱可信度。

L2 记录了多处 self-inconsistency:ablation 的 25%/35% 在 abstract 与 §4.3.1 指向不同量(长度 vs 精度);Table 3 "full method" 75 题子集上 52.0% 远高于全集 44.8% 却被称 "consistent";gold-tables 在 §4.3.2 文本 55.3% vs Table 2 的 57.6% [2601.15709]。对照 Kimi K2 用未平滑 per-step loss 曲线做零 spike 的铁证 [2507.20534]——AgentSM 的实证严谨度明显偏低。

(A3) top-1 检索 + same-DB 过滤是脆弱启发式。

Eq.2 只取最相似的单个 $q^*$ [2601.15709],作者自认 finer-grained retrieval 是 future work。NoLiMa 的 distractor 实验显示:单条含关键词的误导句即可让 GPT-4o effective length 从 8K 崩到 1K [2502.05167]——若召回的 top-1 trajectory 是误导性相似(同 DB 但探索了错误的表),reuse 可能主动注入噪声。AgentSM 未报告 "检索错误 trajectory" 的失败率。

(A4) 合成问题分布 = 未验证的隐藏变量。

核心壁垒是合成问题的 quality/coverage [2601.15709],但 prompt、budget $N$、阈值 $\theta$ 均未公开。对照 K2 用 t-SNE 验证合成工具与真实工具分布对齐 [2507.20534]——AgentSM 完全没有等价的分布对齐验证,无法排除 "合成问题恰好覆盖了评测问题的探索路径" 的乐观偏差。

(A5) 效率主张有诚实的反例但被淡化。

AgentSM 的 input token 用量(~300K)高于 baseline(200K)[2601.15709]——记忆注入本身是 token 成本。论文把 "efficiency" 窄化为 steps/latency,但按 token 计其实更贵。这与 SageAttention 系 "端到端损失 <0.2% 且真省算力" 的干净效率主张 [2410.02367] 形成对比:AgentSM 的效率是换维度(步数换 token),不是纯赚。


4. 生态位 #

AgentSM 处在 "agent memory 从 scratchpad/vector-retrieval 走向结构化 inter-task memory" 的范式迁移点上。其 L1 明确把自己定位在 MemGPT(OS 式内存层级)、Mem0(图记忆)之后,主张 "结构不足" 是前作局限 [2601.15709]


5. 未探索方向(cluster 混合 / 自适应) #

  1. AgentSM × K2 的合成分布验证:把 K2 的 t-SNE 分布对齐验证 [2507.20534] 移植到 AgentSM 的合成问题生成——量化 "合成问题 vs 真实评测问题" 的探索路径覆盖度,直接回应攻击面 A4。技术上可做,只需对 trajectory embedding 做覆盖分析。
    1. 多-trajectory 融合替代 top-1(回应 A3):Eq.2 从 argmax 单选改为 top-k 聚合 + NoLiMa 式 distractor 过滤 [2502.05167]——在召回阶段主动剔除 "同 DB 但误导" 的 trace,把 NoLiMa 的 haystack-filtering pipeline 反向用作 memory 去噪。
      1. 结构化记忆 × attention 稀释的联合优化:NoLiMa 证明瓶颈是 token 竞争 [2502.05167],AgentSM 的分段选择性加载已隐式缓解;可进一步量化 "加载的 trajectory 段长度 vs 检索精度" 的 trade-off 曲线,给出 context budget 下的最优段长——目前 AgentSM 只给了定性设计。
        1. 训练 × 检索的混合路线(AgentSM ⊕ K2):把高频复用的 composite-tool 序列与 top trajectory 蒸馏进一个小 adapter(K2 式 SFT),低频/长尾走 AgentSM 式检索——热路径进权重、冷路径留外挂,兼顾 K2 的推理速度与 AgentSM 的可扩展记忆。
          1. 合成经验可信度的 world-model 视角:借 DreamerV3 "开环预测一致性" 的思路 [2301.04104],给 AgentSM 的合成 trajectory 加一个 "reuse 后是否真的减少了真实探索步数" 的闭环验证指标,而非只报聚合 EX——把 Dreamer 的 imagination-fidelity 检验迁移到 trajectory-reuse-fidelity。

          2. 参考 #