Mem-π models agent memory as a separate generative policy (7B LM) trained in two stages — SFT on an experience bank, then decision-content decoupled GRPO — to learn both when and what guidance to produce. Achieves 55.4% avg SR across 4 agentic benchmarks (+22% relative over base agent), with near-50% relative gain on WebArena alone.
现有 memory-augmented agents 从经验库中检索历史条目注入上下文,存在结构性缺陷:
认知科学的启示:人类记忆不是字面回放,而是基于先验知识和当前情境的 constructive reconstruction(Bartlett 1932, Schacter & Addis 2007)。
Mem-π 将 memory 建模为参数化生成策略 $\pi_{\text{mem}}$,与下游 agent $\pi_{\text{agent}}$ 参数分离。给定任务上下文 $x = (q, o)$(任务描述 + 环境观测),输出结构化序列 $y = d \oplus m$,其中 $d \in \{[\text{ABSTAIN}], [\text{GENERATE}]\}$ 是路由决策,$m$ 是生成的指导文本(ABSTAIN 时为空)。
Stage 1 — Experience Distillation(SFT): 在离线经验库 $\mathcal{E}$ 上用自回归交叉熵训练 $\pi_{\text{mem}}$,将显式 context-guidance 对压缩进参数。初始化后的策略已能生成 context-specific guidance,但倾向于 always-generate。
Stage 2 — Adaptation Distillation(Decision-Content Decoupled GRPO): 以下游 agent 的任务成功率为 reward 信号,用 RL 精调。关键机制:
核心技术壁垒:Decision-content decoupled policy optimization。标准 GRPO 应用于 $y = d \oplus m$ 时存在两个非显然问题:(1) Stage 1 init 偏向 GENERATE,i.i.d. 采样可能产生全 GENERATE group,消除跨分支比较信号;(2) content tokens 远多于 decision tokens,flat per-token objective 中 content 梯度淹没 decision 梯度。structured counterfactual rollout + $\Delta$-gating 的组合是使 RL stage 有效学习 abstention routing 的关键非显然设计。
| 指标 | 数值 |
|---|---|
| 整体平均 SR(4 benchmarks) | 55.4% vs 45.3% base agent (+22% relative) |
| WebArena SR | 43.1% vs 27.1% base (+59% relative) |
| WebArena 最大子域增益 | CMS +28.2 pp, Reddit +23.8 pp |
| Stage 1 SFT-only avg SR | 51.4%(已匹配/超过 RL baselines Memory-R1 49.2%, MemRL 50.0%) |
| Stage 2 对 WebArena 增益 | +8.1 pp (35.0% → 43.1%) |
| 跨 agent 迁移 | Qwen-7B 训练的 $\pi_{\text{mem}}$ 用于 gpt-5.4-mini,增益 3-5× 大于 RAG |
| Token 效率 | 138 tokens/task avg(比 Stage 1 少 31%,比 Memory-R1 少 38%) |
| 平均 abstention rate | WebArena 34%, WorkArena 28%, ALFWorld 21%, LAB 39% |

Paper Figure 1: 三种 agent memory 范式对比。(a) Workflow-based:预定义检索/更新流水线;(b) Learning-based:下游 outcome 联合优化 memory 操作;(c) Mem-π:将 memory 建模为独立生成策略 $\pi_{\text{mem}}$,通过离线蒸馏 + 在线适应蒸馏内化可复用经验。
Mem-π 的核心范式转换是:memory 不再是数据库查询,而是一个有独立参数的生成模型。$\pi_{\text{mem}}$ 接收与 $\pi_{\text{agent}}$ 相同的 context,但输出的不是 action,而是 guidance(或 ABSTAIN)。这种分离使 memory 模型可以是比 agent 小得多的模型(7B 辅助 frontier model),且可以在 agent 冻结的条件下独立训练。

Paper Figure 2: Mem-π 完整训练流程。上半部:两阶段 pipeline(Experience Distillation → Adaptation Distillation)。下半部:Decision-Content Decoupled Policy Optimization 的细节——structured sampling 产生 1 ABSTAIN + 3 GENERATE rollout,分别计算 decision-level 和 content-level advantage,经 $\Delta$-gating 合成 per-token advantage。
Figure 2 是理解全系统的关键图。注意两个设计选择:(1) Stage 1 的输出 $\theta$ 直接初始化 Stage 2,而不是从 pretrained checkpoint 重新开始;(2) Stage 2 的 reward $R$ 需要实际运行 $\pi_{\text{agent}}$(冻结)在环境中执行,这意味着 RL training 的每个 step 都包含 agent rollout 的环境交互成本。
Inference 路径:给定新 context $x$,$\pi_{\text{mem}}$ 先生成 decision token $d$;若 $d = [\text{GENERATE}]$,继续生成 memory $m$(最长 256 tokens),注入 $\pi_{\text{agent}}$ 的 prompt;若 $d = [\text{ABSTAIN}]$,$\pi_{\text{agent}}$ 在无 memory 条件下执行。整个过程只增加一次 7B model forward pass 的延迟。
| 符号 | 含义 | 取值/来源 | ||
|---|---|---|---|---|
| $\pi_{\text{mem}}(\theta)$ | 参数化记忆生成策略 | Qwen2.5-7B-Instruct | ||
| $\pi_{\text{agent}}$ | 下游 agent 策略(冻结) | Qwen-7B fine-tuned 或 gpt-5.4-mini | ||
| $x = (q, o)$ | 任务上下文(task spec + observation) | — | ||
| $y = d \oplus m$ | 结构化输出(决策 + 内容) | — | ||
| $d$ | 路由决策 token | $\{[\text{ABSTAIN}], [\text{GENERATE}]\}$ | ||
| $m$ | 生成的 memory guidance | 最长 $L_{\text{max}} = 256$ tokens | ||
| $\mathcal{E}$ | 离线经验库 | JEF-Hinter 5 hints/task | ||
| $G$ | GRPO group size | 4 (1 ABSTAIN + 3 GENERATE) | ||
| $\Delta$ | 跨分支决策信号 | $V_{\text{abs}} - V_{\text{gen}}$ | ||
| $A_d^j$ | decision advantage | $+\Delta$ (ABSTAIN) / $-\Delta$ (GENERATE) | ||
| $A_c^j$ | content advantage | GRPO within GENERATE branches | ||
| $R_m(m)$ | 长度正则 | $-\lambda_{\text{len}} | m | / L_{\text{max}}$, $\lambda_{\text{len}}=0.1$ |
| $\epsilon_{\text{clip}}$ | PPO clip ratio | 0.2 | ||
| $\beta$ | KL coefficient | 0.01 |
Eq. 1 — Stage 1 SFT objective:
$$\mathcal{J}_{\text{mem}}^{(1)}(\theta) = \mathbb{E}_{(x,m)\sim\mathcal{E}}\left[\sum_{t=1}^{|m|} \log \pi_{\theta}(m_t \mid x, m_{ 标准自回归交叉熵,逐 token 最大化在给定 context 下重建经验库中参考 guidance 的概率。将经验库的显式 knowledge 压缩进 $\theta$。 Eq. 2 — Standard GRPO(Stage 2 baseline): $$\mathcal{J}_{\text{GRPO}}(\theta) = \mathbb{E}_{x}\left[\frac{1}{G}\sum_{j=1}^{G}\frac{1}{|y^j|}\sum_{t=1}^{|y^j|}\left(\min\!\Big(\rho_t^j \hat{A}^j,\;\operatorname{clip}(\rho_t^j, 1-\epsilon, 1+\epsilon)\hat{A}^j\Big) - \beta D_{\text{KL}}^{(t)}\right)\right]$$ PPO-style clipped objective + group-normalized advantage + KL regularization。问题在于对 $y = d \oplus m$ 使用单一标量 $\hat{A}^j$,无法区分 decision 和 content 信号。 Eq. 3 — Reward function: $$R(x, y) = \begin{cases} \text{TaskReward}(\pi_{\text{agent}}(\cdot \mid x, m)) + R_m(m), & d = [\text{GENERATE}] \\ \text{TaskReward}(\pi_{\text{agent}}(\cdot \mid x)), & d = [\text{ABSTAIN}] \end{cases}$$ GENERATE 分支的 reward = agent 在注入 memory 后的任务成功(0/1)+ 长度惩罚;ABSTAIN 分支 = agent 无辅助时的成功。长度惩罚 $R_m$ 饱和于 $-0.1$,比二值 task reward 低一个数量级,防止惩罚过度压制生成。 Eq. 4 — Structured counterfactual rollout: 每个 context 强制 $y^0 = [\text{ABSTAIN}]$,$y^{1..G-1} = [\text{GENERATE}] \oplus m^j$。保证 group 内同时存在两种决策,解决 Stage 1 init 偏向 GENERATE 导致的 comparison 缺失问题。 Eq. 5 — Decision-content advantage decomposition: $V_{\text{abs}} = R(x, y^0)$,$V_{\text{gen}} = \frac{1}{G-1}\sum_{j=1}^{G-1}R(x, y^j)$,$\Delta = V_{\text{abs}} - V_{\text{gen}}$。 $\Delta$ 是 abstention 相对于 generation 的净价值。正 $\Delta$ 鼓励 abstain,负 $\Delta$ 鼓励 generate。 Eq. 6 — $\Delta$-gating per-token advantage: $$A_t^j = \begin{cases} A_d^j, & t \leq T_d \\ \mathbb{1}[\Delta < 0] \cdot A_c^j, & t > T_d \end{cases}$$ Decision tokens 只接收 decision 信号;content tokens 只在 generation 有益时接收 content 信号。$\Delta \geq 0$ 时 content 梯度被 gate 掉——这是关键设计:在 memory 无用的 context 上不更新 content 生成能力,避免 content 学习被无效样本污染。 Eq. 7 — 最终 Stage 2 objective: $$\mathcal{J}_{\text{mem}}^{(2)}(\theta) = \mathbb{E}_{x}\left[\frac{1}{G}\sum_{j=0}^{G-1}\frac{1}{|y^j|}\sum_{t=1}^{|y^j|}\left(\min\!\Big(\rho_t^j A_t^j,\;\operatorname{clip}(\rho_t^j, 1-\epsilon, 1+\epsilon)A_t^j\Big) - \beta D_{\text{KL}}^{(t)}\right)\right]$$ 与 Eq. 2 唯一区别:标量 $\hat{A}^j$ 替换为 per-token $A_t^j$。形式上是最小改动,但语义上完全分离了 when 和 what 的学习。 无形式化收敛保证 — 仅实证。 本文无 RL 策略收敛定理或 success rate 的下界证明。可被形式化的方向:在 contextual bandit 框架下(memory generation 作为 action,task success 作为 reward),证明 structured counterfactual sampling 相比 i.i.d. sampling 的 variance reduction bound。 Paper Table 1: 以 gpt-5.4-mini 为 base agent 的四基准 SR(%) 对比。Mem-π 在所有 benchmark 和子域上取得 SOTA。 核心观察: Paper Table 2: 消融实验。训练阶段消融(上)和 RL 目标消融(下)。 关键发现: Paper Figure 4: WebArena 上按 base agent SR 分 bin 的 abstention rate(线,左轴)和 SR improvement(柱,右轴)。 Figure 4 展示了 Mem-π 最引人注目的涌现行为:calibrated abstention。在最简单任务 bin(base SR 80-100%)上 abstention rate 高达 ~71%,SR improvement 仅 +1.3 pp;在最困难 bin(base SR 0-20%)上 abstention rate 降至 ~13%,SR improvement 达 +9.7 pp。模型学会了"easy tasks don't need help, hard tasks do"——这不是手工规则,而是 RL 从 task reward 中自主发现的路由策略。 Paper Figure 6: Mem-π、RAG 和 base agent 的 success-set Venn 图(左)及典型案例对比(右)。 两个 winning pattern: 失败模式(Region 110, 4 tasks + Region 010, 6 tasks):生成式 memory 偶尔会重排正确操作序列(如 "Reset Filter" 的正确位置被打乱),而检索能保持源经验的精确顺序。这是生成 vs 检索的根本 tradeoff:灵活性换取精确性。 Paper Table 3: 在 Qwen2.5-7B 上训练的 $\pi_{\text{mem}}$ 应用于 Qwen-7B 和 gpt-5.4-mini 两个 agent。 一个 7B 参数的 memory model 在 frontier model 上的增益(WebArena +16.0 pp)是 RAG 增益(+4.3 pp)的 3.7×。这表明 $\pi_{\text{mem}}$ 编码的 guidance 足够 explicit,不依赖于训练时 agent 的能力水平——weaker agent 训练的 memory 可以有效辅助 stronger agent。 [实现未公开] — 论文未提供公开代码仓库链接。验证检查 #
# 检查项 结果 1 维度一致性:Eq. 7 中 $A_t^j$ 是无量纲标量(归一化 reward 差),$\rho_t^j$ 是概率比,两者相乘后取 min/clip 产生无量纲梯度信号。各项量纲一致。 ✓ 2 边界条件 — 全组同 reward:若所有 $G$ 个 rollout reward 相同,则 $\Delta = 0$,$A_d^j = 0$,$A_c^j = 0$(std 归一化分母有 $\epsilon_{\text{std}} = 10^{-6}$ 防除零)。此时无梯度更新,合理——无法区分好坏时不应调整策略。 ✓ 3 $\Delta = 0$ 时 $\Delta$-gating:$\mathbb{1}[\Delta < 0] = 0$,content tokens 梯度为零。语义:generation 恰好与 abstention 持平时,不奖励 content 生成,保守偏向 abstain。这是一个设计选择,非必然。 ✓(设计选择) 4 长度惩罚饱和:$R_m$ 最大绝对值为 $\lambda_{\text{len}} = 0.1$(当 $ m = L_{\text{max}} = 256$ 时),task reward ∈ {0, 1}。惩罚不会使 GENERATE + success 的 reward ($\geq 0.9$) 低于 ABSTAIN + success ($= 1.0$) 超过 0.1,不会过度惩罚有用但较长的 memory。 ✓ 5 GRPO 归一化稳定性:content advantage 只在 $G-1 = 3$ 个 GENERATE rollout 间归一化。样本量极小,std 估计方差大。论文用 $\epsilon_{\text{std}} = 10^{-6}$ 防除零但不缓解高方差。这是潜在噪声源。 ⚠(3 样本 std 方差大) 6 Abstention token 初始化:[ABSTAIN] 和 [GENERATE] 用语义相关 token(skip/bypass vs recall/retrieve)的均值初始化,再二者求均值得到共享初始 embedding → ~50% abstention probability at Stage 2 start。Figure 7 证实:无此初始化,收敛到 ~21% abstention vs 正常 ~34%,永远无法恢复。 ✓(实验验证)
§5 实验与数据 #
主结果 #

消融 #

Abstention 行为分析 #

案例分析 #

跨 agent 迁移 #

§6 论证链 #
Step 论点 证据 逻辑 1 检索式 memory 返回静态条目,无法适应当前 context 的具体参数 §1 + Figure 6 Case 1: RAG 返回 "first two rows" 而 query 要 "first three rows" 经验性:实际任务失败案例 2 将 memory 建模为生成策略,能 fuse 多条经验并重写参数以匹配 query §2 设计 + §3.3 RQ7 案例 + Table 1 Mem-π SFT-only > 所有 retrieval baselines 经验性 + 定量:SFT-only 已超过 RL baselines 3 Always-generate 不如 adaptive abstention,因为无用 memory 在简单任务上引入噪声 §3.3 Figure 4: easy bin abstention 71%, SR gain 仅 +1.3 pp; hard bin abstention 13%, SR gain +9.7 pp 定量:abstention rate 与 task difficulty 的负相关 4 Standard GRPO 无法有效学习 abstention routing,因为 decision 和 content 信号被 conflate §3.2 Table 2: w/o structured rollout −4.8 pp WA 定量消融 5 Structured counterfactual rollout + $\Delta$-gating 解耦 decision/content 学习 §3.2 Table 2: full model vs 各消融变体;§2.2 形式化推导 形式化 + 定量消融 6 两阶段(SFT→RL)优于单阶段(联合训练) §3.2 Table 2: unified −6.8 pp WA, w/o Stage 1 −5.2 pp 定量:联合训练比跳过 SFT 更差,说明梯度冲突 7 生成式 memory 跨 agent 迁移有效——小模型 memory 辅助大模型 §3.3 Table 3: 7B memory → gpt-5.4-mini, +16.0 pp WA (3.7× RAG gain) 定量:不同 agent backbone 上一致增益
§7 实现 cross-reference #
关键实现细节 #