Mem-π: Adaptive Memory through Learning When and What to Generate

agent 2605.21463
agent-memorygenerative-memoryreinforcement-learningweb-navigationabstention-mechanism

Mem-π: Adaptive Memory through Learning When and What to Generate — L2 #

§1 TL;DR #

Mem-π models agent memory as a separate generative policy (7B LM) trained in two stages — SFT on an experience bank, then decision-content decoupled GRPO — to learn both when and what guidance to produce. Achieves 55.4% avg SR across 4 agentic benchmarks (+22% relative over base agent), with near-50% relative gain on WebArena alone.


§2 痛点 / 方法 / 结果 #

Q1 痛点:检索式 agent memory 的三重失配 #

现有 memory-augmented agents 从经验库中检索历史条目注入上下文,存在结构性缺陷:

  1. 静态失配:检索条目在写入时固定,无法适应当前 query 的具体参数(数量、标识符、格式)。例如源任务为 "top-2 rows",当前任务为 "top-3 rows",RAG 原样返回 "first two rows",导致 agent 执行错误操作。
  2. 噪声注入:在 agent 已能自行解决的简单任务上,任何非空 memory 都会引入干扰。检索系统无法判断 "不提供 memory" 是否为最优选择。
  3. Always-on 生成的风险:并行工作 ParamMem 和 SEAM 用生成替代检索,但不区分 context 质量——在模糊或 OOD 场景下,生成的指导可能包含 hallucinated cues,传播进 agent action chain。
  4. 认知科学的启示:人类记忆不是字面回放,而是基于先验知识和当前情境的 constructive reconstruction(Bartlett 1932, Schacter & Addis 2007)。

    Q2 方法:生成式记忆策略 $\pi_{\text{mem}}$ + 双阶段训练 #

    Mem-π 将 memory 建模为参数化生成策略 $\pi_{\text{mem}}$,与下游 agent $\pi_{\text{agent}}$ 参数分离。给定任务上下文 $x = (q, o)$(任务描述 + 环境观测),输出结构化序列 $y = d \oplus m$,其中 $d \in \{[\text{ABSTAIN}], [\text{GENERATE}]\}$ 是路由决策,$m$ 是生成的指导文本(ABSTAIN 时为空)。

    Stage 1 — Experience Distillation(SFT): 在离线经验库 $\mathcal{E}$ 上用自回归交叉熵训练 $\pi_{\text{mem}}$,将显式 context-guidance 对压缩进参数。初始化后的策略已能生成 context-specific guidance,但倾向于 always-generate。

    Stage 2 — Adaptation Distillation(Decision-Content Decoupled GRPO): 以下游 agent 的任务成功率为 reward 信号,用 RL 精调。关键机制:

    • Structured counterfactual rollout:每个 context $x$ 采样 $G=4$ 个 rollout,其中 1 个强制 ABSTAIN + 3 个 GENERATE,保证每个 group 内两种决策都有表示,使 abstain vs generate 的相对价值可直接观测。
    • Decision-content advantage decomposition:将 GRPO 的标量 advantage $\hat{A}^j$ 替换为 per-token advantage $A_t^j$——decision tokens 接收跨分支信号 $A_d$(ABSTAIN reward vs GENERATE 均值),content tokens 接收分支内信号 $A_c$(单条 GENERATE reward vs GENERATE 均值)。
    • $\Delta$-gating:当 $\Delta = V_{\text{abs}} - V_{\text{gen}} \geq 0$(abstention 优于 generation)时,content tokens 的梯度被置零——避免在 memory 无用的 context 上更新 content 生成能力。

    核心技术壁垒:Decision-content decoupled policy optimization。标准 GRPO 应用于 $y = d \oplus m$ 时存在两个非显然问题:(1) Stage 1 init 偏向 GENERATE,i.i.d. 采样可能产生全 GENERATE group,消除跨分支比较信号;(2) content tokens 远多于 decision tokens,flat per-token objective 中 content 梯度淹没 decision 梯度。structured counterfactual rollout + $\Delta$-gating 的组合是使 RL stage 有效学习 abstention routing 的关键非显然设计。

    Q3 结果 #

    指标数值
    整体平均 SR(4 benchmarks)55.4% vs 45.3% base agent (+22% relative)
    WebArena SR43.1% vs 27.1% base (+59% relative)
    WebArena 最大子域增益CMS +28.2 pp, Reddit +23.8 pp
    Stage 1 SFT-only avg SR51.4%(已匹配/超过 RL baselines Memory-R1 49.2%, MemRL 50.0%)
    Stage 2 对 WebArena 增益+8.1 pp (35.0% → 43.1%)
    跨 agent 迁移Qwen-7B 训练的 $\pi_{\text{mem}}$ 用于 gpt-5.4-mini,增益 3-5× 大于 RAG
    Token 效率138 tokens/task avg(比 Stage 1 少 31%,比 Memory-R1 少 38%)
    平均 abstention rateWebArena 34%, WorkArena 28%, ALFWorld 21%, LAB 39%

    §3 架构 / 方法图 #

    Figure 1: Comparison of memory paradigms

    Paper Figure 1: 三种 agent memory 范式对比。(a) Workflow-based:预定义检索/更新流水线;(b) Learning-based:下游 outcome 联合优化 memory 操作;(c) Mem-π:将 memory 建模为独立生成策略 $\pi_{\text{mem}}$,通过离线蒸馏 + 在线适应蒸馏内化可复用经验。

    Mem-π 的核心范式转换是:memory 不再是数据库查询,而是一个有独立参数的生成模型。$\pi_{\text{mem}}$ 接收与 $\pi_{\text{agent}}$ 相同的 context,但输出的不是 action,而是 guidance(或 ABSTAIN)。这种分离使 memory 模型可以是比 agent 小得多的模型(7B 辅助 frontier model),且可以在 agent 冻结的条件下独立训练。

    Figure 2: Mem-π overview — two-stage training pipeline

    Paper Figure 2: Mem-π 完整训练流程。上半部:两阶段 pipeline(Experience Distillation → Adaptation Distillation)。下半部:Decision-Content Decoupled Policy Optimization 的细节——structured sampling 产生 1 ABSTAIN + 3 GENERATE rollout,分别计算 decision-level 和 content-level advantage,经 $\Delta$-gating 合成 per-token advantage。

    Figure 2 是理解全系统的关键图。注意两个设计选择:(1) Stage 1 的输出 $\theta$ 直接初始化 Stage 2,而不是从 pretrained checkpoint 重新开始;(2) Stage 2 的 reward $R$ 需要实际运行 $\pi_{\text{agent}}$(冻结)在环境中执行,这意味着 RL training 的每个 step 都包含 agent rollout 的环境交互成本。

    stateDiagram-v2 direction LR state "Stage 1: Experience Distillation" as S1 { [*] --> SFT: Qwen-7B init SFT --> π_mem_1: 3 epochs on E note right of SFT: autoregressive CE
    on (x,m) pairs } state "Stage 2: Adaptation Distillation" as S2 { π_mem_1 --> StructuredSample: init θ StructuredSample --> Reward: 1 ABSTAIN + 3 GENERATE Reward --> AdvDecomp: task SR + length penalty AdvDecomp --> DeltaGate: A_d (cross-branch) + A_c (within-branch) DeltaGate --> Update: per-token advantage Update --> StructuredSample: 200 steps } state "Inference" as INF { π_mem_2 --> Decision: context x Decision --> ABSTAIN: Δ≥0 learned Decision --> GENERATE: Δ<0 learned GENERATE --> Agent: inject m into context ABSTAIN --> Agent: no memory } S1 --> S2 S2 --> INF

    Inference 路径:给定新 context $x$,$\pi_{\text{mem}}$ 先生成 decision token $d$;若 $d = [\text{GENERATE}]$,继续生成 memory $m$(最长 256 tokens),注入 $\pi_{\text{agent}}$ 的 prompt;若 $d = [\text{ABSTAIN}]$,$\pi_{\text{agent}}$ 在无 memory 条件下执行。整个过程只增加一次 7B model forward pass 的延迟。


    §4 作者证明 #

    符号表 #

    符号含义取值/来源
    $\pi_{\text{mem}}(\theta)$参数化记忆生成策略Qwen2.5-7B-Instruct
    $\pi_{\text{agent}}$下游 agent 策略(冻结)Qwen-7B fine-tuned 或 gpt-5.4-mini
    $x = (q, o)$任务上下文(task spec + observation)
    $y = d \oplus m$结构化输出(决策 + 内容)
    $d$路由决策 token$\{[\text{ABSTAIN}], [\text{GENERATE}]\}$
    $m$生成的 memory guidance最长 $L_{\text{max}} = 256$ tokens
    $\mathcal{E}$离线经验库JEF-Hinter 5 hints/task
    $G$GRPO group size4 (1 ABSTAIN + 3 GENERATE)
    $\Delta$跨分支决策信号$V_{\text{abs}} - V_{\text{gen}}$
    $A_d^j$decision advantage$+\Delta$ (ABSTAIN) / $-\Delta$ (GENERATE)
    $A_c^j$content advantageGRPO within GENERATE branches
    $R_m(m)$长度正则$-\lambda_{\text{len}}m/ L_{\text{max}}$, $\lambda_{\text{len}}=0.1$
    $\epsilon_{\text{clip}}$PPO clip ratio0.2
    $\beta$KL coefficient0.01

    方程物理意义 #

    Eq. 1 — Stage 1 SFT objective:

    $$\mathcal{J}_{\text{mem}}^{(1)}(\theta) = \mathbb{E}_{(x,m)\sim\mathcal{E}}\left[\sum_{t=1}^{|m|} \log \pi_{\theta}(m_t \mid x, m_{

    标准自回归交叉熵,逐 token 最大化在给定 context 下重建经验库中参考 guidance 的概率。将经验库的显式 knowledge 压缩进 $\theta$。

    Eq. 2 — Standard GRPO(Stage 2 baseline):

    $$\mathcal{J}_{\text{GRPO}}(\theta) = \mathbb{E}_{x}\left[\frac{1}{G}\sum_{j=1}^{G}\frac{1}{|y^j|}\sum_{t=1}^{|y^j|}\left(\min\!\Big(\rho_t^j \hat{A}^j,\;\operatorname{clip}(\rho_t^j, 1-\epsilon, 1+\epsilon)\hat{A}^j\Big) - \beta D_{\text{KL}}^{(t)}\right)\right]$$

    PPO-style clipped objective + group-normalized advantage + KL regularization。问题在于对 $y = d \oplus m$ 使用单一标量 $\hat{A}^j$,无法区分 decision 和 content 信号。

    Eq. 3 — Reward function:

    $$R(x, y) = \begin{cases} \text{TaskReward}(\pi_{\text{agent}}(\cdot \mid x, m)) + R_m(m), & d = [\text{GENERATE}] \\ \text{TaskReward}(\pi_{\text{agent}}(\cdot \mid x)), & d = [\text{ABSTAIN}] \end{cases}$$

    GENERATE 分支的 reward = agent 在注入 memory 后的任务成功(0/1)+ 长度惩罚;ABSTAIN 分支 = agent 无辅助时的成功。长度惩罚 $R_m$ 饱和于 $-0.1$,比二值 task reward 低一个数量级,防止惩罚过度压制生成。

    Eq. 4 — Structured counterfactual rollout:

    每个 context 强制 $y^0 = [\text{ABSTAIN}]$,$y^{1..G-1} = [\text{GENERATE}] \oplus m^j$。保证 group 内同时存在两种决策,解决 Stage 1 init 偏向 GENERATE 导致的 comparison 缺失问题。

    Eq. 5 — Decision-content advantage decomposition:

    $V_{\text{abs}} = R(x, y^0)$,$V_{\text{gen}} = \frac{1}{G-1}\sum_{j=1}^{G-1}R(x, y^j)$,$\Delta = V_{\text{abs}} - V_{\text{gen}}$。

    $\Delta$ 是 abstention 相对于 generation 的净价值。正 $\Delta$ 鼓励 abstain,负 $\Delta$ 鼓励 generate。

    Eq. 6 — $\Delta$-gating per-token advantage:

    $$A_t^j = \begin{cases} A_d^j, & t \leq T_d \\ \mathbb{1}[\Delta < 0] \cdot A_c^j, & t > T_d \end{cases}$$

    Decision tokens 只接收 decision 信号;content tokens 只在 generation 有益时接收 content 信号。$\Delta \geq 0$ 时 content 梯度被 gate 掉——这是关键设计:在 memory 无用的 context 上不更新 content 生成能力,避免 content 学习被无效样本污染。

    Eq. 7 — 最终 Stage 2 objective:

    $$\mathcal{J}_{\text{mem}}^{(2)}(\theta) = \mathbb{E}_{x}\left[\frac{1}{G}\sum_{j=0}^{G-1}\frac{1}{|y^j|}\sum_{t=1}^{|y^j|}\left(\min\!\Big(\rho_t^j A_t^j,\;\operatorname{clip}(\rho_t^j, 1-\epsilon, 1+\epsilon)A_t^j\Big) - \beta D_{\text{KL}}^{(t)}\right)\right]$$

    与 Eq. 2 唯一区别:标量 $\hat{A}^j$ 替换为 per-token $A_t^j$。形式上是最小改动,但语义上完全分离了 when 和 what 的学习。

    验证检查 #

    #检查项结果
    1维度一致性:Eq. 7 中 $A_t^j$ 是无量纲标量(归一化 reward 差),$\rho_t^j$ 是概率比,两者相乘后取 min/clip 产生无量纲梯度信号。各项量纲一致。
    2边界条件 — 全组同 reward:若所有 $G$ 个 rollout reward 相同,则 $\Delta = 0$,$A_d^j = 0$,$A_c^j = 0$(std 归一化分母有 $\epsilon_{\text{std}} = 10^{-6}$ 防除零)。此时无梯度更新,合理——无法区分好坏时不应调整策略。
    3$\Delta = 0$ 时 $\Delta$-gating:$\mathbb{1}[\Delta < 0] = 0$,content tokens 梯度为零。语义:generation 恰好与 abstention 持平时,不奖励 content 生成,保守偏向 abstain。这是一个设计选择,非必然。✓(设计选择)
    4长度惩罚饱和:$R_m$ 最大绝对值为 $\lambda_{\text{len}} = 0.1$(当 $m= L_{\text{max}} = 256$ 时),task reward ∈ {0, 1}。惩罚不会使 GENERATE + success 的 reward ($\geq 0.9$) 低于 ABSTAIN + success ($= 1.0$) 超过 0.1,不会过度惩罚有用但较长的 memory。
    5GRPO 归一化稳定性:content advantage 只在 $G-1 = 3$ 个 GENERATE rollout 间归一化。样本量极小,std 估计方差大。论文用 $\epsilon_{\text{std}} = 10^{-6}$ 防除零但不缓解高方差。这是潜在噪声源。⚠(3 样本 std 方差大)
    6Abstention token 初始化:[ABSTAIN] 和 [GENERATE] 用语义相关 token(skip/bypass vs recall/retrieve)的均值初始化,再二者求均值得到共享初始 embedding → ~50% abstention probability at Stage 2 start。Figure 7 证实:无此初始化,收敛到 ~21% abstention vs 正常 ~34%,永远无法恢复。✓(实验验证)

    无形式化收敛保证 — 仅实证。 本文无 RL 策略收敛定理或 success rate 的下界证明。可被形式化的方向:在 contextual bandit 框架下(memory generation 作为 action,task success 作为 reward),证明 structured counterfactual sampling 相比 i.i.d. sampling 的 variance reduction bound。


    §5 实验与数据 #

    主结果 #

    Table 1: Task success rate across four benchmarks

    Paper Table 1: 以 gpt-5.4-mini 为 base agent 的四基准 SR(%) 对比。Mem-π 在所有 benchmark 和子域上取得 SOTA。

    核心观察:

    • Stage 1 SFT 已经是强 baseline:51.4% avg,超过所有检索型和 RL 型 baselines(MemRL 50.0%),说明参数化 knowledge compression 本身被低估为策略。
    • Stage 2 RL 增益集中在 WebArena:+8.1 pp(35.0% → 43.1%),因 WebArena 任务多样性最高,abstention routing 价值最大。
    • CMS 和 Reddit 子域获益最大:CMS +28.2 pp, Reddit +23.8 pp,这两个域的任务参数化程度高(不同 content types, post categories),静态检索失配最严重。

    消融 #

    Table 2: Ablation results on WebArena and ALFWorld

    Paper Table 2: 消融实验。训练阶段消融(上)和 RL 目标消融(下)。

    关键发现:

    • Unified single-stage (−6.8 pp WA) 比 skip Stage 1 (−5.2 pp) 更差——联合 imitation loss ($R_{\text{sim}}$) 和 task reward ($R_{\text{task}}$) 产生梯度冲突,比不 imitate 还糟。这反直觉但合理:SFT 目标鼓励保真于经验库,RL 目标鼓励偏离经验库去适应当前 context,二者方向相反。
    • Structured counterfactual sampling 是最关键 Stage 2 组件(−4.8 pp WA, −4.5 pp ALF),移除后 abstain/generate 比较信号缺失。
    • $\Delta$-gating 和 $R_m$ 贡献互补但较小(−1.8 pp, −1.2 pp),属于 polish 而非 make-or-break。

    Abstention 行为分析 #

    Figure 4: Abstention rate and SR improvement vs task difficulty

    Paper Figure 4: WebArena 上按 base agent SR 分 bin 的 abstention rate(线,左轴)和 SR improvement(柱,右轴)。

    Figure 4 展示了 Mem-π 最引人注目的涌现行为:calibrated abstention。在最简单任务 bin(base SR 80-100%)上 abstention rate 高达 ~71%,SR improvement 仅 +1.3 pp;在最困难 bin(base SR 0-20%)上 abstention rate 降至 ~13%,SR improvement 达 +9.7 pp。模型学会了"easy tasks don't need help, hard tasks do"——这不是手工规则,而是 RL 从 task reward 中自主发现的路由策略。

    案例分析 #

    Figure 6: Case analysis — Venn diagram and examples

    Paper Figure 6: Mem-π、RAG 和 base agent 的 success-set Venn 图(左)及典型案例对比(右)。

    两个 winning pattern:

    1. Generation 适配检索内容(Region 001, 15 tasks):源任务是 "top-2",当前任务是 "top-3",RAG 原样返回 "first two rows",Mem-π 生成 "first three rows"。生成式 memory 能 fuse 多条经验并重写参数。
    2. Abstention 过滤有害 memory(Region 101, 10 tasks):RAG 检索到的 hint 编码了不适用假设(特定产品类别),Mem-π 选择 ABSTAIN,恢复 agent 的开放搜索能力。
    3. 失败模式(Region 110, 4 tasks + Region 010, 6 tasks):生成式 memory 偶尔会重排正确操作序列(如 "Reset Filter" 的正确位置被打乱),而检索能保持源经验的精确顺序。这是生成 vs 检索的根本 tradeoff:灵活性换取精确性。

      跨 agent 迁移 #

      Table 3: Cross-agent transfer results

      Paper Table 3: 在 Qwen2.5-7B 上训练的 $\pi_{\text{mem}}$ 应用于 Qwen-7B 和 gpt-5.4-mini 两个 agent。

      一个 7B 参数的 memory model 在 frontier model 上的增益(WebArena +16.0 pp)是 RAG 增益(+4.3 pp)的 3.7×。这表明 $\pi_{\text{mem}}$ 编码的 guidance 足够 explicit,不依赖于训练时 agent 的能力水平——weaker agent 训练的 memory 可以有效辅助 stronger agent。


      §6 论证链 #

      Step论点证据逻辑
      1检索式 memory 返回静态条目,无法适应当前 context 的具体参数§1 + Figure 6 Case 1: RAG 返回 "first two rows" 而 query 要 "first three rows"经验性:实际任务失败案例
      2将 memory 建模为生成策略,能 fuse 多条经验并重写参数以匹配 query§2 设计 + §3.3 RQ7 案例 + Table 1 Mem-π SFT-only > 所有 retrieval baselines经验性 + 定量:SFT-only 已超过 RL baselines
      3Always-generate 不如 adaptive abstention,因为无用 memory 在简单任务上引入噪声§3.3 Figure 4: easy bin abstention 71%, SR gain 仅 +1.3 pp; hard bin abstention 13%, SR gain +9.7 pp定量:abstention rate 与 task difficulty 的负相关
      4Standard GRPO 无法有效学习 abstention routing,因为 decision 和 content 信号被 conflate§3.2 Table 2: w/o structured rollout −4.8 pp WA定量消融
      5Structured counterfactual rollout + $\Delta$-gating 解耦 decision/content 学习§3.2 Table 2: full model vs 各消融变体;§2.2 形式化推导形式化 + 定量消融
      6两阶段(SFT→RL)优于单阶段(联合训练)§3.2 Table 2: unified −6.8 pp WA, w/o Stage 1 −5.2 pp定量:联合训练比跳过 SFT 更差,说明梯度冲突
      7生成式 memory 跨 agent 迁移有效——小模型 memory 辅助大模型§3.3 Table 3: 7B memory → gpt-5.4-mini, +16.0 pp WA (3.7× RAG gain)定量:不同 agent backbone 上一致增益

      §7 实现 cross-reference #

      [实现未公开] — 论文未提供公开代码仓库链接。

      关键实现细节 #

      1. [ABSTAIN]/[GENERATE] token 对称初始化:将 skip/bypass 的 mean embedding 赋给 [ABSTAIN],recall/retrieve 的 mean embedding 赋给 [GENERATE],再二者求均值得到共享初始 embedding。这使 Stage 2 开始时 abstention probability ≈ 50%。Figure 7 实验证实:无此初始化,最终 abstention rate 收敛到 ~21%(vs 正常 ~34%),且收敛速度慢 ≥2×。这一初始化策略对最终性能有 outsized impact,但论文仅在 Appendix A.2 简要提及。
        1. vLLM sleep mode GPU 共享:Stage 2 RL 训练需要同时运行 (a) RL optimizer (DeepSpeed ZeRO-2) 和 (b) rollout generator (vLLM)。论文使用 vLLM 的 sleep mode——RL update 时 vLLM 释放 GPU memory,rollout 时 RL optimizer 释放——在 8× H100-80GB 上实现两者交替使用同一组 GPU,避免需要 16 卡。
          1. Prompt-leakage token stripping:计算长度惩罚 $R_m$ 时,先剥离 memory $m$ 中可能包含的 prompt template tokens,只计算 actual guidance content 的长度。防止 prompt 格式的固定开销被惩罚。