Learning How to Remember: A Meta-Cognitive Management Method for Structured and Transferable Agent Memory

agent 2601.07470
agent-memorymemory-abstractionDPOmeta-cognitioncross-task-transferhierarchical-memory

MCMA: Meta-Cognitive Memory Abstraction for Structured & Transferable Agent Memory #

§1 TL;DR #

MCMA decouples agent memory management from task execution via a DPO-trained Memory Copilot (Qwen3-4B) that learns multi-structure abstraction and hierarchical organization of experience. When no stored memory fits, the copilot itself transfers—achieving +27.85% on ALFWorld and cross-model gains on GPT-4o-mini/Gemini.


§2 痛点 / 方法 / 结果 #

Q1 痛点 #

Existing memory-augmented LLM agents store experience in fixed representations (raw trajectories, natural language insights, or step-level retrieval) at a single or implicit abstraction level. This creates the abstraction reuse dilemma:

No existing method learns how experience should be abstracted or which abstraction level fits a new task.

Q2 方法 #

Figure 1: MCMA working example

Paper Figure 1: an example showing how MCMA abstracts a household task trajectory into structured multi-level memories and selects the appropriate level for a new task.

MCMA 的核心设计是将记忆管理视为可学习的元认知技能,而非固定设计。系统由两个功能独立的模型组成:

四阶段流程:

  1. Trajectory Collection — Task Model 收集成功/失败轨迹,经噪声修剪、子任务分割、一致性检查后组织为树形结构
  2. Multi-Structure Memory Generation — Copilot 在四种结构原语 $\mathcal{S} = \{\text{natural text, key-value, chain, tree}\}$ 上生成 $N$ 个候选复合记忆,并通过连续抽象参数 $\alpha \in [0,1]$ 控制粒度
  3. Copilot Training — 候选记忆在下游任务上评估,构造偏好对 $(m^+, m^-)$,经 SFT + DPO 训练 Copilot
  4. Hierarchical Reuse — 记忆组织为层次 $\mathcal{H} = \{H_0, H_1, \ldots, H_L\}$(原始 → 情景 → 抽象脚本),按任务相似度选择合适层级;极端分布偏移时直接迁移 Copilot 本身
  5. 核心技术壁垒:用独立的小模型(4B)做元认知记忆管理,Task Model 完全冻结。这使得"如何记忆"的能力可跨模型迁移(GPT-4o-mini +20.71%)和跨域迁移(ALFWorld → ScienceWorld Copilot +8.25%),而非仅迁移记忆内容。

    Q3 结果 #

    SettingMetricValue
    ALFWorld Qwen3-32BSeen / Unseen Acc90.71% / 90.30% (↑27.85 / ↑23.88)
    ALFWorld Qwen3-8BSeen / Unseen Acc79.29% / 80.60% (↑24.29 / ↑24.27)
    ScienceWorld Qwen3-8BTest Reward29.17 (↑9.99)
    Cross-model GPT-4o-miniSeen / Unseen Acc63.57% / 63.43% (↑20.71 / ↑14.92)
    Cross-model Gemini-2.5-flashSeen / Unseen Acc84.29% / 88.06% (↑22.86 / ↑20.15)
    Cross-domain Mix CopilotScienceWorld / ALFWorld↑10.67 reward / ↑13.07 Acc

    §3 架构 / 方法图 #

    Figure 2: MCMA pipeline overview

    Paper Figure 2: The task model collects raw trajectories, which the memory copilot abstracts into structured knowledge. Preference pairs constructed from downstream task performance train the copilot via DPO. Learned memories and the copilot are organized hierarchically for adaptive reuse.

    Figure 2 是 MCMA 的完整数据流。左侧 Task Model 与环境交互产生原始轨迹;中间 Memory Copilot 将轨迹转化为多种结构的候选记忆并通过 DPO 迭代优化;右侧按相似度匹配将记忆分层组织($H_0$ 原始轨迹 → $H_1$ 情景记忆 → $H_2$ 抽象脚本),供新任务按需取用。

    stateDiagram-v2 [*] --> Collect: Stage 1 Collect --> Abstract: Preprocessed trajectories Abstract --> Train: N candidate memories Train --> Organize: Trained copilot Organize --> Reuse state Collect { [*] --> Prune Prune --> Segment Segment --> Verify Verify --> TreeStructure } state Abstract { [*] --> GenCandidates: S = {text, kv, chain, tree} GenCandidates --> SetAlpha: α ∈ [0,1] } state Train { [*] --> Evaluate: Downstream utility s(m) Evaluate --> PrefPairs: Top-K differences PrefPairs --> SFT_DPO } state Reuse { [*] --> SimMatch: sim(τ_new, m) SimMatch --> H0_H1: High similarity SimMatch --> H2: Low similarity SimMatch --> TransferCopilot: No match }

    Mermaid 补充了 Figure 2 中不易看清的分支逻辑:在 Reuse 阶段,高相似度任务取低层级细粒度记忆,低相似度任务取高层级抽象记忆,完全无匹配时迁移 Copilot 本身。


    §4 作者证明 #

    无形式化作者证明 — 仅实证

    本文无定理证明或收敛保证,所有结论基于实验验证。以下整理关键公式的物理意义。

    符号表 #

    符号含义
    $\tau$交互轨迹
    $\mathcal{M}_\tau$轨迹 $\tau$ 的候选记忆集合
    $m_\tau^i$第 $i$ 个候选记忆
    $\mathcal{S}$结构原语集合 {text, kv, chain, tree}
    $\alpha \in [0,1]$连续抽象粒度参数
    $s(m)$下游任务效用评分
    $\theta$Copilot 参数
    $\beta$温度参数
    $\mathcal{H} = \{H_0, \ldots, H_L\}$层次化记忆库
    $(m^+, m^-)$偏好对(优/劣)

    关键方程 #

    候选记忆生成概率(Eq. 3)— 以下游效用加权的 softmax 分布,使 Copilot 偏向生成高性能记忆表示:

    $$P_\theta(m_\tau^i \mid \tau) = \frac{\exp(\beta \, s(m_\tau^i))}{\sum_{j=1}^{N} \exp(\beta \, s(m_\tau^j))}$$

    连续抽象控制(Eq. 4)— 将抽象级别参数化为连续变量,允许端到端学习最优粒度:

    $$m_\tau(\alpha) = \text{MemCopilot}_\theta^{\text{abs}}(\tau, \alpha)$$

    记忆效用评分(Eq. 6)— 同时奖励任务成功和执行效率(步数越少分越高),失败任务得 0:

    $$s(m_i) = \begin{cases} 0, & \text{task fails} \\ 0.1 + 0.9 \cdot \frac{T_{\max} - T_i}{T_{\max} - T_{\min}}, & \text{otherwise} \end{cases}$$

    DPO 损失(Eq. 7)— 标准 DPO,鼓励 Copilot 为高效用记忆赋予更高概率:

    $$\mathcal{L} = -\log \sigma\big(\beta [\log p_\theta(m^+) - \log p_\theta(m^-)]\big)$$

    层次化复用选择(Eq. 9)— 按新任务与存储记忆的相似度选择最优层级和条目:

    $$m_{\text{reuse}} = \arg\max_{m \in H_\ell, \, \ell \in [0, L]} \text{sim}(\tau_{\text{new}}, m)$$

    Agent-specific 实证检查 #

    检查项结果
    成功率 sweep (task × model × memory type)Table 1 覆盖 2 model scales × 5 baselines × 2 domains;Table 3 覆盖组件消融
    延迟预算未讨论 wall-clock 时间;仅报告平均执行步数(Step 列)
    失败模式分类2 类 Copilot(成功摘要 + 失败反思);ScienceWorld 发现成功摘要有负面效果
    收敛保证无;可被形式化的指标:DPO 训练的样本复杂度(多少偏好对收敛)
    Backbone 敏感性Table 2 验证 GPT-4o-mini / Gemini-2.5-flash;Table 7/8 验证 Qwen3-4B / Qwen2.5-72B
    环境确定性假设ALFWorld/ScienceWorld 均为确定性文本环境;BabyAI 为部分可观测网格世界

    §5 实验与数据 #

    主实验:全面性能对比 #

    Table 1: Main performance comparison

    Paper Table 1: MCMA 在 ALFWorld 和 ScienceWorld 上的主要性能对比(Qwen3-8B / 32B)。

    Table 1 的核心发现:

    • MCMA 在所有设置下均取得最佳性能,Qwen3-32B 在 ALFWorld Unseen 上达到 90.30%,超越最强 baseline ExpeL 12.69 个百分点
    • 同时减少执行步数:Qwen3-32B Unseen 仅需 18.00 步(baseline 无记忆 30.36 步)
    • 小模型受益更大:Qwen3-8B 在 ScienceWorld 上绝对提升近 10%,而 Qwen3-32B 提升 4.91%
    • Cross-model 迁移(Table 2):用 Qwen3-32B 训练的 Copilot 直接服务 GPT-4o-mini(↑20.71%)和 Gemini-2.5-flash(↑22.86%),增幅接近在 Qwen3-32B 本身上的表现

    消融与结构分析 #

    Figure 4: Knowledge structure analysis

    Paper Figure 4: (a) 提供的知识数量对 ALFWorld 性能的影响;(b) 结构分布及替换实验。

    Figure 4 揭示两个关键模式:

    1. 最优知识数量:4–5 条结构化知识时达到最佳,过少(信息不足)和过多(上下文干扰)均降低性能
    2. 结构偏好:Tree 结构占顶层组织的约 70%,Chain 占约 20%,但内部嵌套了大量 Key-Value 和 Natural Language 子结构。将已学习的 Tree/Chain 结构替换为其他格式会导致性能下降
    3. 消融要点(Table 3):

      • Sum + Ref 互补:单独使用 Summarization(Qwen3-8B 68.57%)或 Reflection(72.86%)均不如组合(79.29%),说明"学什么该做"和"学什么该避"是互补信号
      • DPO 训练关键:未训练的 Qwen3-4B Copilot 比 DPO 训练后低 7.13%(Table 4),即使用更强的 Gemini-2.5-flash 做未训练 Copilot 仍低 4.15%

      跨域 Copilot 迁移 #

      Table 6: Cross-domain copilot transfer

      Paper Table 6: 跨域 Copilot 迁移结果(Qwen3-8B task model)。

      Table 6 验证了 MCMA 最核心的主张——Copilot 本身可迁移:

      • ALFWorld Copilot 应用于 ScienceWorld:↑8.25 reward(vs base 19.18)
      • ScienceWorld Copilot 应用于 ALFWorld:↑4.86 Acc(vs base 56.33%)
      • Mix Copilot(混合训练数据)在 ScienceWorld 上表现最优(↑10.67),说明跨域训练数据可能起正则化作用

      跨任务知识迁移(Table 5,ALFWorld → BabyAI):

      • Level 1 细粒度知识导致负迁移(−3.13%)
      • Level 2 抽象知识带来正迁移(+1.04%)
      • 验证了层次化抽象对于跨环境泛化的必要性

      §6 论证链 #

      #论点证据来源推理类型
      1固定记忆表示在分布偏移下失效,导致负迁移§1 文献综述 + §4.5 BabyAI Level 1 负迁移(−3.13%)归纳(文献 + 实验)
      2记忆抽象应是可学习的元认知技能,而非预定义设计§3.2 多结构候选生成 + 连续抽象参数 $\alpha$演绎(架构设计)
      3基于下游效用的 DPO 训练能学到有效的抽象策略§4.3 Table 4:训练后 Copilot 比未训练高 7.13%;比更强的未训练 Gemini 高 4.15%实验验证
      4层次化组织使记忆在不同相似度下均可复用§4.5 Table 5:Level 2 正迁移 vs Level 1 负迁移实验验证
      5Copilot 本身(而非记忆内容)可跨域、跨模型迁移§4.6 Table 6:跨域 Copilot 迁移有效;§4.2 Table 2:跨模型(GPT/Gemini)迁移有效实验验证

      §7 实现 cross-reference #

      [实现未公开]

      截至 2026-06-01,论文未公开代码仓库或实现。

      关键实现细节 #

      1. Copilot 规模与 Task Model 解耦:Memory Copilot 使用 Qwen3-4B(约为 Task Model Qwen3-32B 的 1/8 参数),说明元认知记忆管理不需要与任务执行同等规模的模型。这也意味着 Copilot 的训练和推理成本远低于微调 Task Model。
        1. 环境相关的 Copilot 配置:ALFWorld 同时使用成功摘要和失败反思两个 Copilot(Sum + Ref),而 ScienceWorld 仅使用失败反思 Copilot——因为在科学推理任务中,成功轨迹的摘要反而产生负面效果。这一环境特异性配置在论文中仅一句话带过,但对复现至关重要。
        2. 核心技术壁垒 #

          MCMA 的核心不可复制洞察:将记忆管理完全解耦为独立的小模型训练问题。这使得 (a) Task Model 无需任何参数更新即可获得记忆增强,(b) 训练好的 Copilot 可即插即用地服务任意 Task Model(含闭源模型),(c) Copilot 学到的"如何抽象"能力本身成为可迁移的资产。传统方法将记忆与策略纠缠,无法实现这三点中的任何一点。