MCMA decouples agent memory management from task execution via a DPO-trained Memory Copilot (Qwen3-4B) that learns multi-structure abstraction and hierarchical organization of experience. When no stored memory fits, the copilot itself transfers—achieving +27.85% on ALFWorld and cross-model gains on GPT-4o-mini/Gemini.
Existing memory-augmented LLM agents store experience in fixed representations (raw trajectories, natural language insights, or step-level retrieval) at a single or implicit abstraction level. This creates the abstraction reuse dilemma:
No existing method learns how experience should be abstracted or which abstraction level fits a new task.

Paper Figure 1: an example showing how MCMA abstracts a household task trajectory into structured multi-level memories and selects the appropriate level for a new task.
MCMA 的核心设计是将记忆管理视为可学习的元认知技能,而非固定设计。系统由两个功能独立的模型组成:
四阶段流程:
核心技术壁垒:用独立的小模型(4B)做元认知记忆管理,Task Model 完全冻结。这使得"如何记忆"的能力可跨模型迁移(GPT-4o-mini +20.71%)和跨域迁移(ALFWorld → ScienceWorld Copilot +8.25%),而非仅迁移记忆内容。
| Setting | Metric | Value |
|---|---|---|
| ALFWorld Qwen3-32B | Seen / Unseen Acc | 90.71% / 90.30% (↑27.85 / ↑23.88) |
| ALFWorld Qwen3-8B | Seen / Unseen Acc | 79.29% / 80.60% (↑24.29 / ↑24.27) |
| ScienceWorld Qwen3-8B | Test Reward | 29.17 (↑9.99) |
| Cross-model GPT-4o-mini | Seen / Unseen Acc | 63.57% / 63.43% (↑20.71 / ↑14.92) |
| Cross-model Gemini-2.5-flash | Seen / Unseen Acc | 84.29% / 88.06% (↑22.86 / ↑20.15) |
| Cross-domain Mix Copilot | ScienceWorld / ALFWorld | ↑10.67 reward / ↑13.07 Acc |

Paper Figure 2: The task model collects raw trajectories, which the memory copilot abstracts into structured knowledge. Preference pairs constructed from downstream task performance train the copilot via DPO. Learned memories and the copilot are organized hierarchically for adaptive reuse.
Figure 2 是 MCMA 的完整数据流。左侧 Task Model 与环境交互产生原始轨迹;中间 Memory Copilot 将轨迹转化为多种结构的候选记忆并通过 DPO 迭代优化;右侧按相似度匹配将记忆分层组织($H_0$ 原始轨迹 → $H_1$ 情景记忆 → $H_2$ 抽象脚本),供新任务按需取用。
Mermaid 补充了 Figure 2 中不易看清的分支逻辑:在 Reuse 阶段,高相似度任务取低层级细粒度记忆,低相似度任务取高层级抽象记忆,完全无匹配时迁移 Copilot 本身。
无形式化作者证明 — 仅实证
本文无定理证明或收敛保证,所有结论基于实验验证。以下整理关键公式的物理意义。
| 符号 | 含义 |
|---|---|
| $\tau$ | 交互轨迹 |
| $\mathcal{M}_\tau$ | 轨迹 $\tau$ 的候选记忆集合 |
| $m_\tau^i$ | 第 $i$ 个候选记忆 |
| $\mathcal{S}$ | 结构原语集合 {text, kv, chain, tree} |
| $\alpha \in [0,1]$ | 连续抽象粒度参数 |
| $s(m)$ | 下游任务效用评分 |
| $\theta$ | Copilot 参数 |
| $\beta$ | 温度参数 |
| $\mathcal{H} = \{H_0, \ldots, H_L\}$ | 层次化记忆库 |
| $(m^+, m^-)$ | 偏好对(优/劣) |
候选记忆生成概率(Eq. 3)— 以下游效用加权的 softmax 分布,使 Copilot 偏向生成高性能记忆表示:
$$P_\theta(m_\tau^i \mid \tau) = \frac{\exp(\beta \, s(m_\tau^i))}{\sum_{j=1}^{N} \exp(\beta \, s(m_\tau^j))}$$
连续抽象控制(Eq. 4)— 将抽象级别参数化为连续变量,允许端到端学习最优粒度:
$$m_\tau(\alpha) = \text{MemCopilot}_\theta^{\text{abs}}(\tau, \alpha)$$
记忆效用评分(Eq. 6)— 同时奖励任务成功和执行效率(步数越少分越高),失败任务得 0:
$$s(m_i) = \begin{cases} 0, & \text{task fails} \\ 0.1 + 0.9 \cdot \frac{T_{\max} - T_i}{T_{\max} - T_{\min}}, & \text{otherwise} \end{cases}$$
DPO 损失(Eq. 7)— 标准 DPO,鼓励 Copilot 为高效用记忆赋予更高概率:
$$\mathcal{L} = -\log \sigma\big(\beta [\log p_\theta(m^+) - \log p_\theta(m^-)]\big)$$
层次化复用选择(Eq. 9)— 按新任务与存储记忆的相似度选择最优层级和条目:
$$m_{\text{reuse}} = \arg\max_{m \in H_\ell, \, \ell \in [0, L]} \text{sim}(\tau_{\text{new}}, m)$$
| 检查项 | 结果 |
|---|---|
| 成功率 sweep (task × model × memory type) | Table 1 覆盖 2 model scales × 5 baselines × 2 domains;Table 3 覆盖组件消融 |
| 延迟预算 | 未讨论 wall-clock 时间;仅报告平均执行步数(Step 列) |
| 失败模式分类 | 2 类 Copilot(成功摘要 + 失败反思);ScienceWorld 发现成功摘要有负面效果 |
| 收敛保证 | 无;可被形式化的指标:DPO 训练的样本复杂度(多少偏好对收敛) |
| Backbone 敏感性 | Table 2 验证 GPT-4o-mini / Gemini-2.5-flash;Table 7/8 验证 Qwen3-4B / Qwen2.5-72B |
| 环境确定性假设 | ALFWorld/ScienceWorld 均为确定性文本环境;BabyAI 为部分可观测网格世界 |

Paper Table 1: MCMA 在 ALFWorld 和 ScienceWorld 上的主要性能对比(Qwen3-8B / 32B)。
Table 1 的核心发现:

Paper Figure 4: (a) 提供的知识数量对 ALFWorld 性能的影响;(b) 结构分布及替换实验。
Figure 4 揭示两个关键模式:
消融要点(Table 3):

Paper Table 6: 跨域 Copilot 迁移结果(Qwen3-8B task model)。
Table 6 验证了 MCMA 最核心的主张——Copilot 本身可迁移:
跨任务知识迁移(Table 5,ALFWorld → BabyAI):
| # | 论点 | 证据来源 | 推理类型 |
|---|---|---|---|
| 1 | 固定记忆表示在分布偏移下失效,导致负迁移 | §1 文献综述 + §4.5 BabyAI Level 1 负迁移(−3.13%) | 归纳(文献 + 实验) |
| 2 | 记忆抽象应是可学习的元认知技能,而非预定义设计 | §3.2 多结构候选生成 + 连续抽象参数 $\alpha$ | 演绎(架构设计) |
| 3 | 基于下游效用的 DPO 训练能学到有效的抽象策略 | §4.3 Table 4:训练后 Copilot 比未训练高 7.13%;比更强的未训练 Gemini 高 4.15% | 实验验证 |
| 4 | 层次化组织使记忆在不同相似度下均可复用 | §4.5 Table 5:Level 2 正迁移 vs Level 1 负迁移 | 实验验证 |
| 5 | Copilot 本身(而非记忆内容)可跨域、跨模型迁移 | §4.6 Table 6:跨域 Copilot 迁移有效;§4.2 Table 2:跨模型(GPT/Gemini)迁移有效 | 实验验证 |
[实现未公开]
截至 2026-06-01,论文未公开代码仓库或实现。
MCMA 的核心不可复制洞察:将记忆管理完全解耦为独立的小模型训练问题。这使得 (a) Task Model 无需任何参数更新即可获得记忆增强,(b) 训练好的 Copilot 可即插即用地服务任意 Task Model(含闭源模型),(c) Copilot 学到的"如何抽象"能力本身成为可迁移的资产。传统方法将记忆与策略纠缠,无法实现这三点中的任何一点。