| 论文 | 关联维度 | 关联强度 |
|---|---|---|
| MemSkill (2602.02474) | 均将 memory 操作提升为可学习组件;均支持跨模型迁移 | 强——方法级竞争者 |
| Mem-π (2605.21463) | 均将 memory 建模为独立于 task agent 的小模型;均用 RL 信号优化 memory 质量 | 强——范式级竞争者 |
| AI Meets Brain (2512.23343) | 综述提出的层次化记忆框架(episodic → semantic)与 MCMA 的 $\mathcal{H} = \{H_0, H_1, \ldots, H_L\}$ 直接对应 | 中——理论支撑 |
MCMA ↔ MemSkill:两者都意识到固定记忆操作原语的局限性 [2602.02474],但解决路径分叉——MCMA 学习"如何将轨迹转化为结构化记忆"(abstraction policy),MemSkill 学习"选哪些 skill 来处理 interaction span"(selection policy)[2602.02474]。两者都在 ALFWorld 上验证,形成直接对比场景。
MCMA ↔ Mem-π:核心共识是 memory 应由独立于 agent 的可训练模型管理 [2605.21463]。MCMA 的 Memory Copilot (4B) 和 Mem-π 的 $\pi_{\text{mem}}$ (7B) 都比 task agent 小,都可跨模型迁移。关键分歧在于 MCMA 聚焦"记什么结构"(multi-structure abstraction),Mem-π 聚焦"记不记"(abstention routing)+ "记什么内容"(generative memory)。
MCMA ↔ AI Meets Brain:综述的 nature-based × scope-based 双维分类体系 [2512.23343] 为 MCMA 提供认知科学合法性——MCMA 的 $H_0$(原始轨迹)对应 episodic inside-trail memory,$H_2$(抽象脚本)对应 semantic cross-trail memory。综述提出的 extraction → updating → retrieval → utilization 闭环 [2512.23343] 中,MCMA 主要覆盖 extraction(多结构生成)和 retrieval(相似度分层选择),但缺乏显式 updating(主动遗忘/更新)机制。
| 维度 | MCMA | MemSkill |
|---|---|---|
| 核心学习目标 | 学习记忆的抽象表示 | 学习记忆操作的选择策略 |
| 训练信号 | Offline DPO(偏好对来自下游效用差) | Online PPO(task reward 实时反馈) |
| 可学习单元 | 连续抽象参数 $\alpha$ + 结构原语组合 $\mathcal{S}$ [2601.07470] | Skill bank 中的离散 skill 描述 [2602.02474] |
| 进化机制 | 无——结构固定为 {text, kv, chain, tree} | Designer 从 hard cases 进化 skill bank [2602.02474] |
| 迁移粒度 | 迁移整个 Copilot 模型 | 迁移 skill bank(文本描述集) |
| 环境类型 | 确定性文本环境 (ALFWorld, ScienceWorld) [2601.07470] | 对话 + 确定性环境 (LoCoMo, ALFWorld) [2602.02474] |
增量贡献:MCMA 的独特价值在于"连续抽象粒度控制"——$\alpha \in [0,1]$ 参数允许在细粒度情景记忆和高度抽象策略之间连续插值 [2601.07470]。MemSkill 的 skill bank 虽然可进化,但每个 skill 本身是离散的文本描述,没有粒度控制。
MemSkill 的独特优势:closed-loop skill evolution [2602.02474] 是 MCMA 缺乏的。MCMA 的结构原语集合 $\mathcal{S}$ 是预定义的,无法从失败中自动扩展新的记忆组织方式。
| 维度 | MCMA | Mem-π |
|---|---|---|
| Memory 输出形式 | 多结构化表示 (text/kv/chain/tree 组合) | 自由文本 guidance (≤256 tokens) |
| 路由决策 | 相似度阈值选择层级 $H_\ell$ [2601.07470] | 学习的 ABSTAIN/GENERATE token [2605.21463] |
| 训练范式 | SFT + offline DPO(无需环境交互) | SFT + online GRPO(每步需 agent rollout)[2605.21463] |
| 对"不记"的处理 | 极端分布偏移时迁移 Copilot 本身(仍生成某种 memory) | 显式 ABSTAIN:学会在简单任务上不提供 memory [2605.21463] |
| 训练成本 | 低(DPO 只需偏好对,无环境交互) | 高(Stage 2 每步需完整 agent rollout) |
| 跨模型迁移增幅 | GPT-4o-mini +20.71% [2601.07470] | gpt-5.4-mini +16.0 pp [2605.21463] |
关键 delta:MCMA 提出的核心问题是"以什么结构存储经验",Mem-π 提出的核心问题是"何时提供经验指导"。两者互补而非矛盾——一个优化 memory 的形式,一个优化 memory 的使用时机。
潜在矛盾:MCMA 在极端分布偏移时的解法是"迁移 Copilot 本身"——即始终提供某种形式的 memory guidance [2601.07470]。Mem-π 的实验表明,在 easy tasks 上 71% 的 abstention rate 是最优的,memory 本身是噪声 [2605.21463]。MCMA 缺乏"不记"的选项,可能在简单任务上引入不必要的认知负载。
MCMA 部分实例化了综述的理论框架 [2512.23343]:
MCMA 的所有实验在 确定性文本环境(ALFWorld, ScienceWorld, BabyAI)中进行 [2601.07470]。这些环境的动作空间离散且有限,状态转移完全确定。真实世界 agent 面临的部分可观测性、随机性、和开放动作空间均未被测试。Mem-π 至少在 WebArena(真实网页环境)中验证 [2605.21463],生态效度更高。
MCMA 的 DPO 训练依赖于"在下游任务上评估候选记忆以构造偏好对" [2601.07470]。这意味着:
对比 Mem-π 的 online GRPO [2605.21463],后者在 Stage 2 直接从当前 agent 的环境交互中获得 reward,能适应部署时的任务分布。MCMA 的 offline DPO 低成本但可能低适应性。
论文仅报告"平均执行步数"作为效率指标,未报告 wall-clock 时间 [2601.07470]。Memory Copilot (4B) 对每条轨迹的推理时间、DPO 训练的总 GPU 小时、以及推理时的记忆检索延迟均未披露。在实际部署中,如果 Copilot 的生成时间接近 Task Model 本身的思考时间,解耦的价值会被抵消。
跨域 Copilot 迁移(ALFWorld → ScienceWorld)的增幅为 +8.25 reward [2601.07470],但两个环境都是文本交互式环境,共享大量低层次操作模式(explore → find → manipulate)。如果目标域是对话系统(如 LoCoMo)或网页导航(如 WebArena),Copilot 学到的"如何抽象家务轨迹"的元认知是否仍然适用,完全未验证。
ScienceWorld 上仅使用 Reflection Copilot(成功摘要反而有负面效果)[2601.07470],说明 Copilot 配置高度依赖环境特性。论文声称的"元认知是通用技能"与这一环境特异性配置之间存在张力:如果真正通用,应该能自动学会何时用 Summary、何时用 Reflection。
MCMA (2025.01)、MemSkill (2025.02)、Mem-π (2025.05) 是同期工作,论文中互不引用。三者均在 ALFWorld 上评测,但使用不同的 backbone(MCMA: Qwen3-8B/32B;MemSkill: LLaMA/Qwen;Mem-π: Qwen-7B + gpt-5.4-mini),无法直接比较。缺乏统一 benchmark 条件下的 head-to-head 对比是整个 cluster 的共同短板。
Agent memory 的"学习化"浪潮中,三种范式同时涌现:
| 范式 | 代表 | 核心问题 | 学习方式 |
|---|---|---|---|
| Learn to Abstract | MCMA | 以什么结构/粒度存储经验 | Offline DPO on structure preference |
| Learn to Select | MemSkill | 选哪些操作 skill 处理输入 | Online PPO on skill selection |
| Learn When & What | Mem-π | 何时提供 + 提供什么内容 | SFT + Decoupled GRPO |
MCMA 占据了"记忆表示学习"的生态位——它不假设最优记忆格式已知,而是让数据驱动结构选择。这在认知科学视角下是最接近"元认知"(metacognition = thinking about thinking)定义的 [2512.23343]:MCMA 字面意义上在学习"如何思考自己的经验"。
MCMA 的核心优势是训练成本低(offline DPO,无需环境交互)和迁移粒度大(整个 Copilot 模型即插即用)。劣势是缺乏在线适应能力和无 abstention 机制。相比之下:
若按部署便利性排序:MCMA > MemSkill > Mem-π(MCMA 只需 DPO 数据,MemSkill 需在线 RL,Mem-π 需在线 RL + 环境交互)。
MCMA 的多结构抽象 [2601.07470] 与 Mem-π 的 ABSTAIN/GENERATE 路由 [2605.21463] 天然互补。一个 hybrid 架构:先用 Mem-π 的 decision mechanism 判断"是否需要 memory",若 GENERATE 则用 MCMA 的 Copilot 决定"以何种结构和粒度提供"。这消除了 MCMA 在简单任务上的冗余 memory 问题,同时比 Mem-π 的 free-text generation 更结构化。
MCMA 的 $\mathcal{S} = \{\text{text, kv, chain, tree}\}$ 是预定义的 [2601.07470],但 MemSkill 证明了"操作原语可以从 hard cases 中进化"[2602.02474]。如果将 MemSkill 的 Designer 机制应用于 MCMA 的结构原语集合——从 Copilot 失败的案例中自动发现新的记忆组织结构(如 DAG、timeline、causal chain)——可能突破当前四种固定结构的表达力上限。
MCMA 当前的 DPO 训练是一次性的 [2601.07470]。结合 Mem-π 的 online reward 获取机制 [2605.21463],可以设计一种 online DPO 变体:agent 在部署中持续产生新轨迹,Copilot 生成候选记忆,agent 的成功/失败构成在线偏好信号,Copilot 周期性微调。这填补了"部署后持续改进"的空白。
AI Meets Brain 综述明确指出 memory poisoning 和 extraction attack 是 agent memory 的关键威胁面 [2512.23343]。MCMA 的层次化记忆库 $\mathcal{H}$ 如果被注入恶意轨迹,Copilot 可能将其抽象为"高层级策略"并跨任务传播。三篇方法论文 (MCMA, MemSkill, Mem-π) 均未讨论对抗鲁棒性。开放问题:能否训练 Copilot 在抽象过程中检测和过滤对抗性输入?
MCMA 的全部验证在确定性环境中完成 [2601.07470]。在 stochastic 环境(如多人游戏、真实网页交互)中,同一轨迹的最优抽象可能依赖于隐状态的概率分布。将 MCMA 的确定性抽象扩展为概率性记忆表示(如 probabilistic programs 或 Bayesian knowledge structures)是一个未探索方向。
三种范式 (MCMA / MemSkill / Mem-π) 均在不同 backbone、不同超参下报告 ALFWorld 结果,不可直接比较。社区需要一个标准化的 agent memory benchmark suite(固定 Task Model、固定环境 split、报告 wall-clock 和 token cost),以区分"记忆方法的贡献"和"backbone 能力的混淆"。AI Meets Brain 综述的 benchmark 梳理 [2512.23343] 可作为设计起点。