agent-memory-systems

Cross-category topic | 7 sources

Agent Memory Systems: From Fixed Pipelines to Learnable Cognitive Skills #

§1 主题缘起 #

2025–2026 年间,agent memory 领域出现了一次范式级转向:记忆管理从人工设计的固定流水线走向数据驱动的可学习系统。这一方向同时整合了 agent 运行时架构和训练算法两个维度的创新,是一个天然跨 category 的前沿研究聚落。

驱动力来自三个方向的汇聚。首先,现有 agent memory 依赖手工设计的静态操作原语(add/update/delete/skip),面对交互模式多样化和分布漂移时表现脆弱 [2602.02474]。其次,检索式 memory 的三重失配问题被系统识别:条目在写入时固化无法适应新 query 参数,无法判断"不提供 memory"是否为最优选择,且 always-on 生成存在 hallucination 风险 [2605.21463]。第三,认知神经科学的跨学科综述为这一技术转向提供了理论合法性——人类记忆的核心特征是 constructive reconstruction 而非 verbatim replay [2512.23343]

与此同时,一个被长期忽视的社区隔离问题浮出水面:agent memory 社区和 agent skill 社区在解决同一个问题——从交互经验中提取可复用知识——但跨社区互引率不到 1% [2604.15877]。统一框架的缺失不仅导致重复造轮子,还阻碍了跨粒度的自适应经验压缩。

这一转向最新的延伸是把可学习记忆的对象从"交互经验"扩展到"外部上下文本身"。PEEK 提出 agent 反复查询同一个大型外部上下文(语料库、代码仓库)时,应当缓存关于该上下文的可复用 orientation knowledge——它包含什么、如何组织、关键实体/常量/schema——以常量大小的 context map 常驻于系统提示词 [2605.19932]。它形式化了一个空白的设计象限:active × external-context——共享对话/压缩保存的是 agent 自身轨迹、RAG/offloading 保存的是对原始材料的被动访问、prompt learning(ACE/Reflexion/GEPA)保存的是 task 级策略,没有任何方法主动维护"关于上下文的定向知识" [2605.19932]。这正是本 topic 所说的"从固定流水线到可学习认知技能"在记忆对象维度上的又一次拓展:PEEK 的 map 不是 hand-crafted,而是由一个 programmable cache policy 从执行轨迹自动生长 [2605.19932],恰好填补了检索式 memory 因写入时固化、无 abstention、always-on hallucination 而留下的空缺 [2605.21463]

本 topic 覆盖了这一转向中的七项关键工作:一篇奠定认知科学基础的综述、三个提出不同可学习 memory 范式的系统、一个统一 memory/skill/rule 的元框架、一个实现了完整 skill 生命周期管理的工程系统,以及一个把可学习记忆指向"外部上下文定向知识"的 orientation cache。它们分别从理论基础、训练算法设计、系统工程,以及记忆对象的重新定义四个层面推进了 agent memory 的可学习化进程。


§2 覆盖的 category 分布 #

Category论文数量代表作
agent7MemSkill (2602.02474), MCMA (2601.07470), Mem-π (2605.21463), AI Meets Brain (2512.23343), Experience Compression (2604.15877), MUSE-Autoskill (2605.27366), PEEK (2605.19932)
algorithm3MemSkill (PPO + Gumbel-Top-K), MCMA (SFT + DPO), Mem-π (SFT + Decoupled GRPO)

所有七篇论文的核心问题域在 agent category(记忆系统设计、skill 管理、运行时架构)。但三个可学习 memory 系统的核心创新同时深入 algorithm category:MemSkill 的 variable-size action space 上的 Top-K without-replacement RL policy [2602.02474]、MCMA 将记忆管理建模为 offline DPO 的偏好学习问题 [2601.07470]、Mem-π 的 decision-content decoupled policy optimization [2605.21463]——这三项均为训练算法层面的创新,而非仅仅是 agent 架构的重组。

PEEK 不进入 algorithm category:它的 cache policy(Distiller/Cartographer/Evictor)是 prompted LLM 调用而非可训练模型,全文无形式化证明、纯实证 [2605.19932]。它的贡献因此落在 agent 一侧,但引入了一个本 topic 此前没有的记忆维度——记忆对象不是交互轨迹或经验条目,而是关于外部上下文的定向知识,常量大小、常驻提示词 [2605.19932]。其 tag(long-context, context-engineering, cache-policy, prompt-learning)也把本 topic 与长上下文/上下文工程方向缝合在一起。

MUSE-Autoskill 涉及 code category 的边缘——其 skill 以结构化代码包(SKILL.md + scripts/ + tests/)的形式存在 [2605.27366],但主体贡献仍在 agent 生命周期管理。


§3 时间线 #

时间事件贡献
2024-12AI Meets Brain (2512.23343) 发布提出 nature×scope 双维分类体系和 extraction→updating→retrieval→utilization 闭环框架,覆盖 ~400 篇文献,首次系统化 agent memory 安全攻防 [2512.23343]
2025-01MCMA (2601.07470) 发布首个用独立小模型(Qwen3-4B)做 meta-cognitive memory management 的系统,通过 DPO 学习多结构记忆抽象,证明 Copilot 本身可跨模型迁移 [2601.07470]
2025-02MemSkill (2602.02474) 发布将 memory 操作提升为 RL 可学习的 skill bank,引入 Designer 从 hard cases 进化 skill 集合,首次实现 memory management 的 closed-loop evolution [2602.02474]
2025-04Experience Compression Spectrum (2604.15877) 发布统一 memory/skill/rule 为压缩轴上的不同层级,发现 missing diagonal(无系统支持自适应跨层级压缩)和 <1% 跨社区互引率 [2604.15877]
2025-05Mem-π (2605.21463) 发布将 memory 建模为端到端生成策略,引入 calibrated abstention routing——agent 学会在简单任务上不提供 memory [2605.21463]
2025-05MUSE-Autoskill (2605.27366) 发布实现最完整的单层级 skill 生命周期闭环(创建→记忆→管理→评估→迭代),自生成 skill 超越人工 skill 上限 [2605.27366]
2026-05PEEK (2605.19932) 发布把可学习记忆指向"外部上下文定向知识",以常量大小 context map 常驻提示词、由 Distiller→Cartographer→Evictor cache policy 从轨迹自动维护;填补 active×external-context 空白象限 [2605.19932]

三个可学习 memory 系统(MCMA、MemSkill、Mem-π)在 2025 年 1–5 月间独立涌现,互不引用 [2601.07470],形成了一次自发的范式转向。PEEK 则在一年后从一个不同的入口(长上下文/上下文工程)汇入同一主题,把"可学习地管理记忆"从交互经验扩展到外部上下文本身 [2605.19932]


§4 Evolution timeline (技术谱系) #

flowchart TD subgraph CogSci["认知科学基础"] Bartlett["Bartlett Schema Theory
(constructive recall)"] HippoNeocortex["海马体–新皮层协调
(fast encoding + consolidation)"] end subgraph Survey["理论框架层"] AIBrain["AI Meets Brain (2512.23343)
nature×scope taxonomy
+ management closed loop"] ECS["Experience Compression (2604.15877)
unified compression spectrum
+ missing diagonal"] end subgraph FixedPipeline["固定流水线 (preceding era)"] MemGPT["MemGPT / MemoryOS
handcrafted add/update/delete"] RAG["RAG
static knowledge retrieval"] Reflexion["Reflexion / Voyager
fixed reflection patterns"] PromptLearn["ACE / GEPA
task-level playbooks"] end subgraph LearnableMemory["可学习 Memory 系统 (2025)"] MemSkill["MemSkill (2602.02474)
RL-trained skill bank
+ Designer evolution"] MCMA["MCMA (2601.07470)
DPO-trained Copilot
+ multi-structure abstraction"] MemPi["Mem-π (2605.21463)
Decoupled GRPO
+ abstention routing"] end subgraph SkillLifecycle["Skill 生命周期 (2025)"] MUSE["MUSE-Autoskill (2605.27366)
5-stage lifecycle
+ unit-test gating"] end subgraph OrientationCache["外部上下文定向缓存 (2026)"] PEEK["PEEK (2605.19932)
constant-size context map
+ Distiller/Cartographer/Evictor"] end Bartlett --> AIBrain HippoNeocortex --> AIBrain AIBrain --> ECS MemGPT --> MemSkill MemGPT --> MCMA RAG --> MemPi Reflexion --> MUSE AIBrain --> MemSkill AIBrain --> MCMA AIBrain --> MemPi ECS --> MUSE RAG --> PEEK PromptLearn --> PEEK MemSkill -.->|"shared: learnable skill bank"| MUSE MCMA -.->|"shared: independent small model"| MemPi MemSkill -.->|"tension: symbolic vs neural"| MCMA MemPi -.->|"complement: when vs what"| MemSkill MemPi -.->|"divergent object: entries vs orientation"| PEEK MCMA -.->|"shared: model > heuristic management"| PEEK

技术谱系要点


§5 技术线交错 #

Agent 架构设计制约训练算法选择 #

Memory management 的可学习化需要跨 agent 和 algorithm 两个 category 协同推进。三个系统选择了迥异的训练范式,直接受制于各自的架构设计决策:

推理时信号 vs 训练时奖励:PEEK 的无训练管理策略 #

PEEK 给出了与上述三者正交的第四种选择:完全不训练。它的 cache policy 是三个 prompted LLM 调用,全部运行在执行轨迹(reasoning/action/observation log)之上、无需 ground truth——Distiller 诊断轨迹中 orientation vs task-specific 的花费并给 map 条目打 helpful/harmful/neutral/stale 标签,Cartographer 把诊断翻成最小结构化编辑(ADD/DELETE/REPLACE),Evictor 在硬预算 B 下淘汰 [2605.19932]。这绕开了制约前三者的 agent×algorithm 耦合:没有 reward、没有偏好对、不需要环境 rollout。代价从训练时转移为一笔每次查询后的维护税(总成本的 6.2–17.9%,Distiller 约占 ⅔)[2605.19932],且可在 m=1 次查询后冻结 map 以摊销 [2605.19932]

PEEK 自己的"核心技术壁垒"恰好也落在架构边界上:把抽取(Distiller)与编辑(Cartographer)分离是 load-bearing 设计——把两者合并为单次 LLM 调用(Monolithic Update)平均掉 −7.7%,而 naive 的 runtime full-swap 掉 −14.86% [2605.19932]。这与三个训练系统的工程取舍互为镜像:它们把"如何学好"放在训练算法里,PEEK 把"如何抽得准"放在推理时的模块契约里。

认知科学框架启发系统设计但留下关键盲区 #

AI Meets Brain 综述的 extraction→updating→retrieval→utilization 闭环 [2512.23343] 为后续系统提供了概念骨架,但三个关键盲区被后续系统暴露:

  1. Abstention 缺失:闭环暗示 agent 应对所有交互执行记忆管理,但 Mem-π 发现在简单任务上最优 memory action 是不提供 memory [2605.21463]——闭环框架没有为"选择性忽略"提供一等公民地位 [2512.23343]
    1. Compression 粒度未建模:综述的 nature×scope 二维分类缺少压缩粒度维度,Experience Compression Spectrum 通过定义从 raw trace 到 declarative rule 的四级压缩层级弥补了这一缺失 [2604.15877] [2512.23343]
      1. "Memory 如何学习"未触及:综述覆盖了"记什么"和"如何管理",但完全未讨论"记忆管理本身如何学习"。PPO、DPO、decoupled GRPO 三条训练路径均在综述发表后涌现 [2512.23343]
        1. 记忆对象局限于交互经验:综述的 nature×scope 隐含地把记忆对象设为 agent 自身的交互产物。PEEK 指出还有一类正交对象——关于反复查询的外部上下文的定向知识——既不是轨迹也不是检索条目,并把它形式化为 active×external-context 空白象限 [2605.19932]
        2. Skill 生命周期管理跨越 agent 与 code 边界 #

          MUSE-Autoskill 将 skill 从行为描述升级为结构化代码包(SKILL.md + scripts/ + tests/),其 unit-test gating 机制要求每个 skill 在注册前必须通过自动化测试 [2605.27366]。这把 agent skill 管理推向了软件工程实践——创建、版本控制、测试、退役的流程与传统 code 资产管理高度同构。但 skill 创建者同时生成 tests,构成了"generator writes its own exam"的 verifier 问题 [2605.27366]


          §6 共识与分歧 #

          共识 #

          共识 1:固定记忆操作是根本瓶颈。全部七篇论文一致认为手工设计的 memory pipeline 无法适应 agent 面临的多样化交互场景。MemSkill 明确列出刚性、粒度受限、不可演化三个核心缺陷 [2602.02474];MCMA 将其归因于 abstraction reuse dilemma [2601.07470];Mem-π 识别了静态检索条目在参数化任务中的失配 [2605.21463];Experience Compression Spectrum 用 <1% 跨社区互引率佐证了研究社区对此问题的碎片化应对 [2604.15877];PEEK 则论证 shared chat/RAG/compaction/prompt-learning 各自保存了错误的对象、并主张 map 必须自动生长而非 hand-crafted [2605.19932] [2605.19932]

          共识 2:Memory 管理应从 task execution 中解耦为独立模块。四个系统不约而同把记忆管理与任务执行分离:MCMA 的 4B Copilot 服务 8B/32B Task Model [2601.07470],Mem-π 的 7B $\pi_{\text{mem}}$ 辅助 frontier model agent [2605.21463],MemSkill 的轻量 MLP controller 与冻结 LLM executor 分离 [2602.02474],PEEK 的 cache policy 是一个在每次查询后独立运行、更新下次查询所用 map 的进程 [2605.19932]。区别在于前三者的独立模块是经训练的小模型,PEEK 的独立模块是未经训练的 prompted LLM 调用 [2605.19932]——解耦是共识,是否需要训练则是分歧。

          共识 3:可学习 memory 系统支持跨模型迁移。系统均展示了产出可迁移到不同 backbone:MemSkill 的 skill bank 从 LLaMA 迁移到 Qwen 仍然 competitive [2602.02474];MCMA 的 Copilot 迁移到 GPT-4o-mini 获得 +20.71% 提升 [2601.07470];Mem-π 的 7B memory model 用于 gpt-5.4-mini 获得 3.7× RAG 的增益 [2605.21463];PEEK 的增益在不更改算法或 prompt 的情况下跨 base LM(GPT-5-mini→GPT-5.5、Qwen3-Coder-Next-FP8)以及不同 backbone agent(RLM→生产级 OpenAI Codex)保持 [2605.19932]

          共识 4:模型自身的语义判断优于启发式/统计管理。MCMA/Mem-π 用学到的策略替代手工原语,PEEK 的 Distiller 用 LLM 对轨迹分类打标而非用 attention-score 或频率启发式淘汰 [2605.19932],二者共享"让模型管理自己的上下文"这一底层范式 [2605.19932]

          分歧 #

          分歧 1:记忆保存的对象是什么。这是 PEEK 引入的新分歧轴。MemSkill/MCMA/Mem-π 抽象的是 agent 的交互经验(操作序列、偏好、生成式指导);PEEK 缓存的是关于外部上下文的定向知识——上下文包含什么、如何组织、关键常量/schema [2605.19932]——并明确论证保存 agent 自身轨迹(shared chat/compaction)是错误对象、甚至有害 [2605.19932]。检索式 memory 保存的是写入时固化的条目 [2605.21463],PEEK 保存的是有损蒸馏、丢弃 task-specific 规则的常量大小工件 [2605.19932]。三类对象(轨迹/经验条目/上下文定向知识)各自最优的管理策略并不相同。

          分歧 2:显式 skill 描述 vs 参数化策略(symbolic vs neural)。MemSkill 保留了 memory 操作的显式性——skill 以自然语言 description 存在,可被人类审计、手动编辑、选择性迁移 [2602.02474]。MCMA 和 Mem-π 将记忆管理完全参数化为模型权重,更强大但完全不透明 [2602.02474]。PEEK 站在 symbolic 一侧但走得更远:map 是带稳定 item ID 的人类可读结构化文本,编辑保持局部可追踪 [2605.19932],管理逻辑也未固化进权重。这反映了 AI 系统设计中经典的 symbolic vs neural 张力,在 agent memory 领域尚无明确胜者。

          分歧 3:训练范式的根本选择,以及"是否需要训练"。三条训练路径之间存在不可调和的 trade-off,而 PEEK 提出了第四种立场——根本不训练:

          系统范式信号来源优势代价
          MemSkillOnline PPO在线 reward实时 reward 反馈RL 在稀疏 reward 下不稳定 [2602.02474]
          MCMAOffline DPO离线偏好对训练成本低、无需环境交互无法学到部署分布下的在线反馈 [2601.07470]
          Mem-πSFT + Decoupled GRPO在线任务成功率最精细的 decision-content 分离每 RL step 需完整环境 rollout,成本极高 [2605.21463]
          PEEK无训练(prompted policy)推理时轨迹信号,无 ground truth零训练、跨 backbone 即插即用每查询 6.2–17.9% 维护税、纯实证无保证 [2605.19932]

          按部署便利性排序,PEEK 与 MCMA 位于易部署一端(前者零训练、后者离线训练),Mem-π 因每步 rollout 位于最重一端 [2601.07470] [2605.19932]

          分歧 4:是否需要 abstention 机制。Mem-π 的核心发现是在简单任务上约七成情况 abstention 是最优选择,SR improvement 仅 +1.3 pp [2605.21463]。MemSkill 对每个 span 无差别地应用 Top-K skills,没有"不处理"的选项 [2602.02474]。MCMA 在无匹配时迁移 Copilot 本身——即使不确定也尝试提供 guidance [2601.07470]。PEEK 没有 query 级 abstention,但通过 Distiller 的 helpful/harmful/neutral/stale 标签和 Evictor 的预算淘汰,对写入内容做选择性保留——丢弃 task-specific 与有害条目 [2605.19932],是一种"内容级"而非"动作级"的克制。分歧的本质是对 memory 的 default stance:Mem-π 认为 default 应是沉默,MemSkill/MCMA 认为 default 应是尝试帮助,PEEK 则认为总要维护一份 map、但要严格筛掉不可迁移的内容。

          分歧 5:Memory 输出的结构化程度。MCMA 在四种结构原语(text/kv/chain/tree)间选择 [2601.07470],MemSkill 通过 skill bank 生成结构化 memory updates [2602.02474],Mem-π 生成自由文本 guidance(≤256 tokens)[2605.21463],PEEK 用固定 5 段 schema(2 默认 + 3 可选)+ 稳定 item ID 的常量大小 map(默认 B=1024 tokens)[2605.19932]。结构化表示的优势在于可组合性与可定位编辑——MemSkill 的 Top-7 skills 在 200-doc 设置下持续提升性能 [2602.02474],PEEK 的 stable-ID schema 让 ADD/DELETE/REPLACE 编辑保持局部 [2605.19932],而 Mem-π 的单条 256 token guidance 可能在复杂任务上表达力不足 [2605.21463]


          §7 Open challenges (根本性困难) #

          Challenge 1:自适应跨层级压缩——missing diagonal #

          所有现有系统固定在单一压缩层级操作 [2604.15877]。Experience Compression Spectrum 识别了三个缺失能力:自适应选择压缩层级、向上推动知识(低层到高层)、以及向下回退知识(高层工件失败时降级)[2604.15877]

          为何是根本困难:跨层级 routing 需要一个 meta-controller 在无标注信号的情况下判断"这段经验应该被压缩到哪个层级"。不同层级的 reward 信号不可直接比较——episodic memory 的价值体现为 retrieval relevance,procedural skill 的价值体现为 task success rate,declarative rule 的价值体现为跨任务泛化性 [2604.15877]。需要统一的 utility metric 或 multi-objective RL formulation,目前无人尝试。

          需要协同的 category:agent(运行时路由架构)+ algorithm(multi-objective RL 或 bandit formulation)。MemSkill 的 variable-size action space + PPO 设计是潜在 building block [2604.15877],但需从单层级内部路由扩展到跨层级路由。

          预估难度:2–3 年。

          Challenge 2:Agent memory 安全——无人防御的攻击面 #

          AI Meets Brain 综述系统化了 extraction/poisoning/retrieval defense/response defense/privacy defense 五大类攻击 [2512.23343],但所有三个可学习 memory 系统均未讨论安全问题 [2512.23343]。可学习化引入了新的攻击向量:

          • MemSkill:攻击者可通过构造恶意 interaction trace 污染 hard-case buffer,诱导 Designer 进化出恶意 skill [2602.02474]
          • MCMA:层次化记忆库如果被注入恶意轨迹,Copilot 可能将其抽象为"高层级策略"并跨任务传播 [2601.07470]
          • Mem-π:参数化后的恶意 memory 无法通过"删除某条记录"来修复,训练数据 poisoning 的危害不可逆 [2605.21463]
          • PEEK:Distiller 从轨迹无 ground-truth 地提取 cache candidates [2605.19932],一段精心构造的轨迹可诱导其把误导性"定向知识"写入常驻 map,且该 map 注入每次后续查询的系统提示词,污染会跨 query 复利 [2605.19932]

          为何是根本困难:安全防御不应是事后补丁——需要在 extraction 阶段就有 adversarial filtering,在 retrieval 阶段有 provenance verification [2512.23343]。但当前所有系统的管理循环中都没有对抗性鲁棒性约束,加入后会显著增加复杂度并降低 signal quality。

          预估难度:3–5 年。

          Challenge 3:统一评测协议缺失 #

          三个可学习 memory 系统在不同 backbone、不同超参下报告结果,无法直接比较 [2601.07470]。MemSkill 评测于对话记忆(LoCoMo, LongMemEval)[2602.02474];MCMA 评测于确定性文本环境(ALFWorld, ScienceWorld)[2601.07470];Mem-π 评测于真实网页环境(WebArena)[2605.21463];PEEK 评测于 OOLONG 与 CL-bench 两类长上下文/上下文学习任务 [2605.19932]。PEEK 的"被拒 benchmark"分析本身放大了这一缺口:它弃用 BrowseComp-Plus/FanOutQA(per-task 证据近乎不相交)与 QuALITY(上下文太短无需缓存),并据此呼吁建立"在单一持久上下文上原生提出大量难题"的 benchmark [2605.19932] [2605.19932]

          为何是根本困难:标准化 benchmark 需要固定 Task Model、固定环境 split、报告 wall-clock 和 token cost,但不同方法对环境交互的需求截然不同(MCMA 不需要环境交互,Mem-π 的每个 RL step 都需要完整 rollout,PEEK 是 inter-query 复用且对 workload shape 敏感),统一 cost metric 与统一 workload 形态本身就是未解问题。

          预估难度:1–2 年(工程主导,但需社区协调)。

          Challenge 4:Memory 管理的持续在线适应 #

          所有三个训练系统在训练后模型即冻结,缺乏部署后持续改进能力。MCMA 的 DPO 训练是一次性的 [2601.07470],Mem-π 训练后 $\pi_{\text{mem}}$ 固化 [2605.21463]。仅 MemSkill 的 Designer 提供了有限的进化能力,但 Designer 本身不接受 online reward [2602.02474]。PEEK 的 map 是 inter-query 在线生长的——m=n 时每次查询都更新 map [2605.19932],但实践中常在 m=1 后冻结以摊销维护成本 [2605.19932],且 map 仅在单一持久上下文内积累、不跨 session 持久化 [2605.19932],因此仍不是真正的长期持续适应。

          认知科学中的 memory reconsolidation——检索本身改变记忆痕迹——是一个关键但无系统实现的启示 [2512.23343]。Idle-time consolidation(agent 空闲时执行离线巩固)也从未被实现 [2604.15877]

          预估难度:2–3 年(需要解决 catastrophic forgetting)。


          §8 成熟度判断 #

          整体成熟度:Research-frontier,加速中 #

          Agent memory 的可学习化在 2025–2026 年处于研究前沿的快速扩展阶段。三个可学习系统均发布于 2025 上半年,互不引用,说明这是一个自发涌现的方向而非单一团队推动的路线 [2601.07470]。PEEK(2026-05)从长上下文/上下文工程支线汇入,进一步把可学习记忆扩展到外部上下文对象 [2605.19932],显示该主题仍在向外吸纳相邻方向,而非收敛。

          分项评估 #

          维度评估证据
          方法多样性三条训练路径(PPO/DPO/GRPO)+ 一条无训练 orientation-cache 路径同时存在 [2601.07470] [2605.19932]
          实证验证各自在不同 benchmark 上显著提升(MemSkill +62.8% LongMemEval [2602.02474], MCMA +27.85% ALFWorld [2601.07470], Mem-π +59% WebArena [2605.21463], PEEK +6.3–34.0% OOLONG [2605.19932]),但缺乏 head-to-head 对比
          代码开放度三个训练系统截至 2026-06 均未公开完整实现 [2601.07470];PEEK 仅给出 code handle 但 ingest 材料无 file:line 级实现 [2605.19932]
          商业部署极低–中MUSE-Autoskill 提及 production 部署但未公开数据 [2605.27366];PEEK 展示 small GPT-5-mini + PEEK 在 CL-bench leaderboard 上可与 frontier 模型竞争,且无改动迁移到生产级 Codex [2605.19932]
          理论基础认知科学综述提供跨学科理论支撑 [2512.23343],但无形式化收敛保证或 regret bound;PEEK 亦明确为纯实证、无保证 [2605.19932]
          安全性综述系统化了威胁模型,但所有系统论文均未实现任何安全防御 [2512.23343]

          趋势方向:加速中 #

          Evidence:

          1. 三个训练系统在 5 个月内独立涌现,说明问题意识已普遍
          2. Experience Compression Spectrum 的"missing diagonal"概念被后续论文(Library Drift)显式采纳 [2604.15877]
          3. MUSE-Autoskill 的 production 系统表明工业界已在跟进
          4. AI Meets Brain 的分类体系被广泛引用作为 positioning anchor [2512.23343]
          5. PEEK 的跨 backbone 可移植性对一个全新范式而言异常之强(RLM→Codex、GPT-5-mini→Qwen3-Coder 无需改算法)[2605.19932],表明该方向正吸引新入口的工作
          6. 尚未出现 dead-end 信号或 migrating 信号——所有路径都展示了正面结果,处于并行发展阶段。


            §9 邻接 topic #

            Self-evolving agents #

            MemSkill 的 closed-loop skill evolution(Designer 从 hard cases 进化 skill bank)[2602.02474] 和 MUSE-Autoskill 的 5 阶段生命周期 [2605.27366] 与 self-evolving agents topic 高度重叠。边界区分在于:本 topic 聚焦"memory/skill 如何学习管理经验",self-evolving agents topic 聚焦"agent 如何整体性地自我改进"。两者在 MemSkill 的 Designer 和 MUSE 的 Refiner 上产生交集。

            RL for agent optimization #

            三个系统使用的 PPO [2602.02474]、DPO [2601.07470]、Decoupled GRPO [2605.21463] 均为 RL/alignment 训练方法。RL for agent optimization topic 关注训练算法本身的创新(如 Mem-π 的 structured counterfactual rollout 和 $\Delta$-gating),本 topic 关注这些算法在 memory management 上的应用。技术线在 algorithm category 上交叉。

            Long-context / context-engineering #

            PEEK 把本 topic 与长上下文/上下文工程方向缝合在一起:它的动机底座是"输入长度本身即使在完美检索下也损害推理",常量大小常驻 map 是 retrieve-then-solve 在 agent-loop 上的类比 [2605.19932],其 tag 直接包含 long-context / context-engineering / cache-policy。本 topic 关注"记忆作为可学习认知技能",长上下文 topic 关注"如何在窗口约束下保持推理质量";两者在 PEEK 的 orientation cache 上交汇——map 既是一份记忆工件,也是一种上下文管理策略 [2605.19932]

            Agent skill governance #

            Experience Compression Spectrum 的 lifecycle gap 发现 [2604.15877] 和 MUSE-Autoskill 的 unit-test gating [2605.27366] 与 skill governance topic(涵盖 SLIM、Library Drift 等同期工作)密切相关。两个 topic 在"如何管理可复用知识工件的生命周期"上共享问题域,但 skill governance 更聚焦于 retirement/pruning 策略,本 topic 更聚焦于 learning/acquisition 策略。

            潜在 topic 合并或分裂 #

            • 合并候选:本 topic 与 "self-evolving agents" 的 memory 维度存在 60%+ 重叠,若后续出现更多同时学习 memory 和 task skill 的统一系统,可考虑合并。
            • 分裂候选:若 Mem-π 的 abstention routing 或 PEEK 的 orientation-cache 范式各自催生出独立子方向("adaptive memory routing" / "external-context orientation memory"),可从本 topic 分裂为独立 topic。

            §10 参考 #

            EntityCategoriesRole in topicKey contribution
            [2602.02474] MemSkillagent, algorithm可学习 memory 范式之一RL-trained skill bank + Designer evolution, variable-size Top-K without-replacement policy
            [2602.02474] MemSkill L3agent范式定位与竞争分析三范式比较(Learn to Abstract / Select / When & What),symbolic vs neural 张力分析
            [2601.07470] MCMAagent, algorithm可学习 memory 范式之一DPO-trained Memory Copilot, multi-structure abstraction, continuous α parameter
            [2601.07470] MCMA L3agent跨模型迁移验证Copilot 本身可跨域跨模型迁移,deployment 便利性最高
            [2605.21463] Mem-πagent, algorithm可学习 memory 范式之一生成式 memory policy, calibrated abstention routing, decision-content decoupled GRPO
            [2605.21463] Mem-π L3agent端到端生成范式分析Memory as independent generative policy, 训练成本 vs 适应性 trade-off
            [2512.23343] AI Meets Brainagent认知科学理论基础Nature×scope taxonomy, management closed loop, security threat model
            [2512.23343] AI Meets Brain L3agent框架完备性分析Taxonomy 不完备(缺 compression 和 generative reconstruction 维度),安全与设计脱节
            [2604.15877] Experience Compressionagent统一元框架Compression spectrum 统一 memory/skill/rule, missing diagonal 定义, <1% 互引率发现
            [2604.15877] Experience Compression L3agent概念统一价值评估Framework without implementation, missing diagonal 尚未被任何系统填补
            [2605.27366] MUSE-AutoskillagentSkill 生命周期工程5-stage lifecycle, unit-test gating, self-generated skills > human skills, cross-agent transfer
            [2605.27366] MUSE-Autoskill L3agent生命周期竞争格局Creation-first vs retirement-first 路径分化,production 部署信号
            [2605.19932] PEEKagent外部上下文定向缓存范式Constant-size context map + Distiller/Cartographer/Evictor cache policy, 填补 active×external-context 象限
            [2605.19932] PEEK L3agent记忆对象新轴定位Orientation knowledge about context(非轨迹/非条目), 跨 backbone 可移植性, model-managed-context 共识