Mem-π: Adaptive Memory through Learning When and What to Generate

agent 2605.21463 — Cross-paper Synthesis

Mem-π: Adaptive Memory — L3 Synthesis #

§1 相关论文 #

ID标题关联维度
2602.02474MemSkill: Learning and Evolving Memory Skills同为 RL 训练 memory 策略;MemSkill 学习 skill 选择,Mem-π 学习 generation + abstention routing
2601.07470MCMA: Meta-Cognitive Memory Abstraction同为独立小模型做 memory 管理(Copilot 4B vs Mem-π 7B);MCMA 用 DPO,Mem-π 用 decoupled GRPO
2512.23343AI Meets Brain: Memory Systems Survey提供认知科学 grounding:Mem-π 的 constructive reconstruction 直接呼应 Bartlett 的 schema theory

三篇论文共同构成一个演进序列:2512.23343 从认知科学视角提出 agent memory 应当是 constructive 而非 reproductive[2512.23343];2602.02474 和 2601.07470 各自实现了"可学习 memory 操作"的不同维度(skill bank 进化 vs abstraction level 学习)[2602.02474] [2601.07470];2605.21463 将这一方向推至极端——直接将 memory 建模为端到端生成策略,并首次引入 learned abstention 作为核心机制 [2605.21463]


§2 本篇 vs 相关论文的 delta #

2.1 Mem-π vs MemSkill #

维度Mem-πMemSkill
Memory 表示端到端生成(free-form text)Skill-conditioned 结构化生成
何时提供 memoryLearned abstention(ABSTAIN/GENERATE routing)无 abstention——每个 span 必定选 Top-K skills
RL 方法Decoupled GRPO(decision + content 分离)PPO + Gumbel-Top-K joint probability
可扩展性固定 7B 模型,无 skill bank 膨胀Skill bank 持续进化,需 designer LLM 维护
基准重叠WebArena, ALFWorldALFWorld, LoCoMo, HotpotQA

关键增量:Mem-π 的 abstention routing 解决了 MemSkill 未触及的"何时不提供 memory"问题。MemSkill 假设每个 context 都需要 skill-guided memory [2602.02474],这在简单任务上会引入噪声——正是 Mem-π §3.3 Figure 4 所量化的问题:easy bin 上 abstention 71%,说明约七成简单任务根本不需要外部 memory [2605.21463]

MemSkill 的优势:compositional skill application 在高难度长 horizon 任务上具有 Mem-π 不具备的 可组合性——200 docs 设置下 K 增大持续提升 [2602.02474],而 Mem-π 的单条 free-form guidance 无法表达多个独立 memory 的组合逻辑。

2.2 Mem-π vs MCMA #

维度Mem-πMCMA
训练信号在线 RL(环境交互 reward)离线 DPO(偏好对)
输出粒度单条 guidance(≤256 tokens)多结构候选 × 连续抽象参数 α
Abstention 机制显式学习的 ABSTAIN token隐式——无匹配时迁移 Copilot 本身
跨模型迁移7B memory → gpt-5.4-mini,+16.0 pp WA (3.7× RAG)4B Copilot → GPT-4o-mini, +20.71% ALFWorld
训练成本高:每 RL step 需 agent 环境 rollout低:DPO 仅需离线评估

关键增量:Mem-π 的 Stage 2 在线 RL 直接以 agent 的 task success 为 reward 信号,形成 closed-loop optimization [2605.21463]。MCMA 的 DPO 虽然也用下游 utility 构造偏好对,但评估是离线的——不包含 agent 在注入 memory 后的真实行为反馈 [2601.07470]。这意味着 Mem-π 能学到"什么 guidance 实际帮助了 agent",而 MCMA 只能学到"什么 memory 结构在人工评分上更优"。

MCMA 的优势:(1) 多结构原语(text/kv/chain/tree)使 MCMA 能为不同任务适配不同表示格式 [2601.07470];(2) 层次化复用机制(H0→H2)提供了 Mem-π 完全缺失的 abstraction level 维度——Mem-π 只产生一个 flat guidance,无法调节抽象粒度。

2.3 认知科学 grounding 对比 #

2512.23343 综述指出人类记忆的核心特征是 constructive reconstruction 而非 verbatim replay [2512.23343]。三个系统的对应关系:

认知机制Mem-πMemSkillMCMA
Constructive recall端到端生成(最强对应)Skill-conditioned 生成(部分对应)Multi-structure abstraction(结构层面对应)
Selective attention / inhibitionLearned abstention相似度阈值(隐式)
Consolidation (offline replay)Stage 1 Experience DistillationDesigner 从 hard cases 进化DPO 离线训练
Metacognition无显式无显式Memory Copilot = metacognitive controller

Mem-π 在 constructive recall 和 selective inhibition 两维度最贴合认知科学模型,但缺乏 MCMA 的 metacognitive 自省能力——Mem-π 不 "知道自己为什么 abstain",只学到 policy-level routing。


§3 可攻击面 #

3.1 Structured counterfactual rollout 的 sample efficiency 问题 #

Mem-π 声称 structured counterfactual rollout 是关键设计 [2605.21463],但每个 context 仅 $G=4$ rollout(1 ABSTAIN + 3 GENERATE),content advantage 在 3 个样本间归一化。L2 自身已标注此为 ⚠ 潜在噪声源 [2605.21463]。当 3 个 GENERATE rollout 恰好产生相似 reward 时,$A_c$ 的 std 估计方差极大,content 梯度本质上变为随机噪声。对比 MemSkill 使用标准 PPO with larger batch [2602.02474],Mem-π 的 RL signal quality 在 content tokens 上可能显著更差。

可验证实验:将 $G$ 从 4 增至 8 或 16(保持 1 ABSTAIN 不变),观察 Stage 2 的 content quality 是否提升。论文未报告此消融。

3.2 Abstention 作为 default 的保守偏向 #

$\Delta$-gating 的设计使 $\Delta = 0$(abstention 与 generation 持平)时 content 梯度被 gate 掉 [2605.21463]。这引入了系统性的 conservative bias:在信号不清晰时偏向 abstain。结合 WebArena 34% abstention rate [2605.21463],这意味着约三分之一的任务上 Mem-π 选择"不帮忙"。

对比 MCMA:MCMA 在无匹配时迁移 Copilot 本身 [2601.07470]——即使不确定也尝试提供某种形式的 guidance。在 hard tasks(base SR 0-20%)上,MCMA 的 always-try 策略可能优于 Mem-π 残留的 13% abstention [2605.21463]

3.3 跨 agent 迁移的因果声称过强 #

Mem-π 展示 7B memory → gpt-5.4-mini 的 +16.0 pp 增益并声称"weaker agent 训练的 memory 可有效辅助 stronger agent" [2605.21463]。但 MCMA 在同方向实验上展示了更强的迁移(4B Copilot → GPT-4o-mini, +20.71%)[2601.07470]。两者差异在于:

Mem-π 的跨 agent 迁移成功可能主要来自 WebArena 这类 task 分布固定的 benchmark,在 open-ended 或 distribution-shift 场景下能否保持需要验证。

3.4 训练成本的可行性疑问 #

Stage 2 每个 RL step 包含 4 条 agent rollout 的完整环境交互 [2605.21463]。以 WebArena 为例(多步网页交互),单条 rollout 可能需要 10+ 步环境操作。200 个 training step × 4 rollouts × batch size = 数千次完整环境 episode。论文使用 8×H100-80GB + vLLM sleep mode [2605.21463],但未报告 wall-clock 训练时间。MemSkill 的 PPO 训练不需要环境交互(reward 基于 memory bank 的 F1) [2602.02474],MCMA 的 DPO 也是离线的 [2601.07470]——Mem-π 的 training cost 可能是两者的 10-100×。

3.5 256 tokens guidance 的表达力上限 #

Mem-π 的单条 guidance 最长 256 tokens [2605.21463]。对比 MemSkill 可组合 Top-7 skills(每个 skill 独立贡献不同维度的 guidance)[2602.02474],256 tokens 是否足以表达复杂任务所需的多维度指导?在 WebArena CMS 域(需要知道"先找到 filter → 选 category → sort by date → pick top-3"的多步序列),单条 256 token guidance 可能需要压缩到 loss 信息的程度。


§4 生态位 #

范式定位 #

Mem-π 代表 agent memory 领域的一个极端立场:memory 即生成模型。在 2512.23343 的 taxonomy 中 [2512.23343],它将 cross-trail semantic memory 从"存储 + 检索"范式推进为"参数化 + 生成"范式,是 Parameter Internalization 路线(综述 §5 Utilization)的最新演绎。

范式阶段代表系统本质
Static retrievalRAG, MemGPT数据库查询
Learned retrievalMemRL, Memory-R1训练检索策略
Structured generationMemSkill, MCMA学习"如何处理 memory"
End-to-end generation + routingMem-πMemory 本身是一个独立策略

Mem-π 的生态位在于:当训练分布覆盖了目标任务空间的大部分变体,且推理延迟预算允许额外一次 7B forward pass 时,端到端生成式 memory 是最优选择。这个生态位的边界条件非常明确——分布偏移大时退化为 hallucination 源,延迟敏感场景下 7B 的额外 pass 不可接受。

采用可能性分析 #

有利因素

不利因素


§5 未探索方向 #

5.1 Mem-π + MemSkill 混合架构 #

将 Mem-π 的 abstention routing 作为 gating layer,决定是否启用 MemSkill 的 skill-conditioned generation。当 Mem-π 判断 ABSTAIN 时跳过;当 GENERATE 时,不直接生成 free-form text,而是激活 MemSkill 的 Top-K skill selection + executor pipeline。这结合了 Mem-π 的"何时"决策能力和 MemSkill 的"如何"组合能力。

技术可行性:Mem-π 的 decision token 生成是独立于 content 的,可以将 GENERATE 分支替换为任意 downstream module。训练时用 MemSkill executor 的 output 替代 Mem-π 的 content generation 即可。

5.2 MCMA 的多层级抽象 + Mem-π 的 RL 优化 #

MCMA 的连续抽象参数 $\alpha \in [0,1]$ 目前通过 DPO 离线优化 [2601.07470]。可以将 $\alpha$ 的选择纳入 Mem-π 的 RL 框架——让 decision 变为三元决策:ABSTAIN / GENERATE-DETAILED ($\alpha \approx 0$) / GENERATE-ABSTRACT ($\alpha \approx 1$)。这使系统能在线学习"对于这类任务,提供精细 step-by-step 还是高层策略"。

5.3 Structured counterfactual rollout 的 variance reduction #

当前 $G=4$ 的设计在 content tokens 上 signal-to-noise ratio 低。可借鉴 control variates 方法——用 Stage 1 SFT model 的 value estimate 作为 baseline,只计算超出 SFT baseline 的增量 reward。这在不增加 rollout 数量的前提下降低 $A_c$ 的方差。

5.4 从认知科学引入 memory consolidation #

2512.23343 强调离线巩固(sleep-phase replay)是长期记忆形成的关键 [2512.23343]。Mem-π 当前一次性训练后 $\pi_{\text{mem}}$ 冻结。可引入 continual learning stage:周期性地从新环境 rollout 中收集新的 (context, guidance, reward) 三元组,对 $\pi_{\text{mem}}$ 做 lightweight RL update(如 LoRA adapter),模拟认知科学的 memory reconsolidation。需要解决 catastrophic forgetting——可用 MCMA 的层次化设计将新旧 memory 分离 [2601.07470]

5.5 Adversarial robustness of generative memory #

2512.23343 系统化了 agent memory 的安全攻防 [2512.23343]。Mem-π 将 memory 内化为模型参数后,传统的 memory poisoning(注入恶意条目到 memory bank)不再适用,但产生了新攻击面:training data poisoning of $\mathcal{E}$。如果攻击者能控制 Experience Distillation 阶段的经验库 $\mathcal{E}$,Stage 1 SFT 会将恶意 guidance 编码进 $\theta$。与 RAG poisoning 不同,参数化后的恶意 memory 无法通过"删除某条记录"来修复。这一方向目前完全未被探索。