2025–2026 年间,agent memory 领域出现了一次范式级转向:记忆管理从人工设计的固定流水线走向数据驱动的可学习系统。这一方向同时整合了 agent 运行时架构和训练算法两个维度的创新,是一个天然跨 category 的前沿研究聚落。
驱动力来自三个方向的汇聚。首先,现有 agent memory 依赖手工设计的静态操作原语(add/update/delete/skip),面对交互模式多样化和分布漂移时表现脆弱 [2602.02474]。其次,检索式 memory 的三重失配问题被系统识别:条目在写入时固化无法适应新 query 参数,无法判断"不提供 memory"是否为最优选择,且 always-on 生成存在 hallucination 风险 [2605.21463]。第三,认知神经科学的跨学科综述为这一技术转向提供了理论合法性——人类记忆的核心特征是 constructive reconstruction 而非 verbatim replay [2512.23343]。
与此同时,一个被长期忽视的社区隔离问题浮出水面:agent memory 社区和 agent skill 社区在解决同一个问题——从交互经验中提取可复用知识——但跨社区互引率不到 1% [2604.15877]。统一框架的缺失不仅导致重复造轮子,还阻碍了跨粒度的自适应经验压缩。
这一转向最新的延伸是把可学习记忆的对象从"交互经验"扩展到"外部上下文本身"。PEEK 提出 agent 反复查询同一个大型外部上下文(语料库、代码仓库)时,应当缓存关于该上下文的可复用 orientation knowledge——它包含什么、如何组织、关键实体/常量/schema——以常量大小的 context map 常驻于系统提示词 [2605.19932]。它形式化了一个空白的设计象限:active × external-context——共享对话/压缩保存的是 agent 自身轨迹、RAG/offloading 保存的是对原始材料的被动访问、prompt learning(ACE/Reflexion/GEPA)保存的是 task 级策略,没有任何方法主动维护"关于上下文的定向知识" [2605.19932]。这正是本 topic 所说的"从固定流水线到可学习认知技能"在记忆对象维度上的又一次拓展:PEEK 的 map 不是 hand-crafted,而是由一个 programmable cache policy 从执行轨迹自动生长 [2605.19932],恰好填补了检索式 memory 因写入时固化、无 abstention、always-on hallucination 而留下的空缺 [2605.21463]。
本 topic 覆盖了这一转向中的七项关键工作:一篇奠定认知科学基础的综述、三个提出不同可学习 memory 范式的系统、一个统一 memory/skill/rule 的元框架、一个实现了完整 skill 生命周期管理的工程系统,以及一个把可学习记忆指向"外部上下文定向知识"的 orientation cache。它们分别从理论基础、训练算法设计、系统工程,以及记忆对象的重新定义四个层面推进了 agent memory 的可学习化进程。
| Category | 论文数量 | 代表作 |
|---|---|---|
| agent | 7 | MemSkill (2602.02474), MCMA (2601.07470), Mem-π (2605.21463), AI Meets Brain (2512.23343), Experience Compression (2604.15877), MUSE-Autoskill (2605.27366), PEEK (2605.19932) |
| algorithm | 3 | MemSkill (PPO + Gumbel-Top-K), MCMA (SFT + DPO), Mem-π (SFT + Decoupled GRPO) |
所有七篇论文的核心问题域在 agent category(记忆系统设计、skill 管理、运行时架构)。但三个可学习 memory 系统的核心创新同时深入 algorithm category:MemSkill 的 variable-size action space 上的 Top-K without-replacement RL policy [2602.02474]、MCMA 将记忆管理建模为 offline DPO 的偏好学习问题 [2601.07470]、Mem-π 的 decision-content decoupled policy optimization [2605.21463]——这三项均为训练算法层面的创新,而非仅仅是 agent 架构的重组。
PEEK 不进入 algorithm category:它的 cache policy(Distiller/Cartographer/Evictor)是 prompted LLM 调用而非可训练模型,全文无形式化证明、纯实证 [2605.19932]。它的贡献因此落在 agent 一侧,但引入了一个本 topic 此前没有的记忆维度——记忆对象不是交互轨迹或经验条目,而是关于外部上下文的定向知识,常量大小、常驻提示词 [2605.19932]。其 tag(long-context, context-engineering, cache-policy, prompt-learning)也把本 topic 与长上下文/上下文工程方向缝合在一起。
MUSE-Autoskill 涉及 code category 的边缘——其 skill 以结构化代码包(SKILL.md + scripts/ + tests/)的形式存在 [2605.27366],但主体贡献仍在 agent 生命周期管理。
| 时间 | 事件 | 贡献 |
|---|---|---|
| 2024-12 | AI Meets Brain (2512.23343) 发布 | 提出 nature×scope 双维分类体系和 extraction→updating→retrieval→utilization 闭环框架,覆盖 ~400 篇文献,首次系统化 agent memory 安全攻防 [2512.23343] |
| 2025-01 | MCMA (2601.07470) 发布 | 首个用独立小模型(Qwen3-4B)做 meta-cognitive memory management 的系统,通过 DPO 学习多结构记忆抽象,证明 Copilot 本身可跨模型迁移 [2601.07470] |
| 2025-02 | MemSkill (2602.02474) 发布 | 将 memory 操作提升为 RL 可学习的 skill bank,引入 Designer 从 hard cases 进化 skill 集合,首次实现 memory management 的 closed-loop evolution [2602.02474] |
| 2025-04 | Experience Compression Spectrum (2604.15877) 发布 | 统一 memory/skill/rule 为压缩轴上的不同层级,发现 missing diagonal(无系统支持自适应跨层级压缩)和 <1% 跨社区互引率 [2604.15877] |
| 2025-05 | Mem-π (2605.21463) 发布 | 将 memory 建模为端到端生成策略,引入 calibrated abstention routing——agent 学会在简单任务上不提供 memory [2605.21463] |
| 2025-05 | MUSE-Autoskill (2605.27366) 发布 | 实现最完整的单层级 skill 生命周期闭环(创建→记忆→管理→评估→迭代),自生成 skill 超越人工 skill 上限 [2605.27366] |
| 2026-05 | PEEK (2605.19932) 发布 | 把可学习记忆指向"外部上下文定向知识",以常量大小 context map 常驻提示词、由 Distiller→Cartographer→Evictor cache policy 从轨迹自动维护;填补 active×external-context 空白象限 [2605.19932] |
三个可学习 memory 系统(MCMA、MemSkill、Mem-π)在 2025 年 1–5 月间独立涌现,互不引用 [2601.07470],形成了一次自发的范式转向。PEEK 则在一年后从一个不同的入口(长上下文/上下文工程)汇入同一主题,把"可学习地管理记忆"从交互经验扩展到外部上下文本身 [2605.19932]。
技术谱系要点:
Memory management 的可学习化需要跨 agent 和 algorithm 两个 category 协同推进。三个系统选择了迥异的训练范式,直接受制于各自的架构设计决策:
PEEK 给出了与上述三者正交的第四种选择:完全不训练。它的 cache policy 是三个 prompted LLM 调用,全部运行在执行轨迹(reasoning/action/observation log)之上、无需 ground truth——Distiller 诊断轨迹中 orientation vs task-specific 的花费并给 map 条目打 helpful/harmful/neutral/stale 标签,Cartographer 把诊断翻成最小结构化编辑(ADD/DELETE/REPLACE),Evictor 在硬预算 B 下淘汰 [2605.19932]。这绕开了制约前三者的 agent×algorithm 耦合:没有 reward、没有偏好对、不需要环境 rollout。代价从训练时转移为一笔每次查询后的维护税(总成本的 6.2–17.9%,Distiller 约占 ⅔)[2605.19932],且可在 m=1 次查询后冻结 map 以摊销 [2605.19932]。
PEEK 自己的"核心技术壁垒"恰好也落在架构边界上:把抽取(Distiller)与编辑(Cartographer)分离是 load-bearing 设计——把两者合并为单次 LLM 调用(Monolithic Update)平均掉 −7.7%,而 naive 的 runtime full-swap 掉 −14.86% [2605.19932]。这与三个训练系统的工程取舍互为镜像:它们把"如何学好"放在训练算法里,PEEK 把"如何抽得准"放在推理时的模块契约里。
AI Meets Brain 综述的 extraction→updating→retrieval→utilization 闭环 [2512.23343] 为后续系统提供了概念骨架,但三个关键盲区被后续系统暴露:
MUSE-Autoskill 将 skill 从行为描述升级为结构化代码包(SKILL.md + scripts/ + tests/),其 unit-test gating 机制要求每个 skill 在注册前必须通过自动化测试 [2605.27366]。这把 agent skill 管理推向了软件工程实践——创建、版本控制、测试、退役的流程与传统 code 资产管理高度同构。但 skill 创建者同时生成 tests,构成了"generator writes its own exam"的 verifier 问题 [2605.27366]。
共识 1:固定记忆操作是根本瓶颈。全部七篇论文一致认为手工设计的 memory pipeline 无法适应 agent 面临的多样化交互场景。MemSkill 明确列出刚性、粒度受限、不可演化三个核心缺陷 [2602.02474];MCMA 将其归因于 abstraction reuse dilemma [2601.07470];Mem-π 识别了静态检索条目在参数化任务中的失配 [2605.21463];Experience Compression Spectrum 用 <1% 跨社区互引率佐证了研究社区对此问题的碎片化应对 [2604.15877];PEEK 则论证 shared chat/RAG/compaction/prompt-learning 各自保存了错误的对象、并主张 map 必须自动生长而非 hand-crafted [2605.19932] [2605.19932]。
共识 2:Memory 管理应从 task execution 中解耦为独立模块。四个系统不约而同把记忆管理与任务执行分离:MCMA 的 4B Copilot 服务 8B/32B Task Model [2601.07470],Mem-π 的 7B $\pi_{\text{mem}}$ 辅助 frontier model agent [2605.21463],MemSkill 的轻量 MLP controller 与冻结 LLM executor 分离 [2602.02474],PEEK 的 cache policy 是一个在每次查询后独立运行、更新下次查询所用 map 的进程 [2605.19932]。区别在于前三者的独立模块是经训练的小模型,PEEK 的独立模块是未经训练的 prompted LLM 调用 [2605.19932]——解耦是共识,是否需要训练则是分歧。
共识 3:可学习 memory 系统支持跨模型迁移。系统均展示了产出可迁移到不同 backbone:MemSkill 的 skill bank 从 LLaMA 迁移到 Qwen 仍然 competitive [2602.02474];MCMA 的 Copilot 迁移到 GPT-4o-mini 获得 +20.71% 提升 [2601.07470];Mem-π 的 7B memory model 用于 gpt-5.4-mini 获得 3.7× RAG 的增益 [2605.21463];PEEK 的增益在不更改算法或 prompt 的情况下跨 base LM(GPT-5-mini→GPT-5.5、Qwen3-Coder-Next-FP8)以及不同 backbone agent(RLM→生产级 OpenAI Codex)保持 [2605.19932]。
共识 4:模型自身的语义判断优于启发式/统计管理。MCMA/Mem-π 用学到的策略替代手工原语,PEEK 的 Distiller 用 LLM 对轨迹分类打标而非用 attention-score 或频率启发式淘汰 [2605.19932],二者共享"让模型管理自己的上下文"这一底层范式 [2605.19932]。
分歧 1:记忆保存的对象是什么。这是 PEEK 引入的新分歧轴。MemSkill/MCMA/Mem-π 抽象的是 agent 的交互经验(操作序列、偏好、生成式指导);PEEK 缓存的是关于外部上下文的定向知识——上下文包含什么、如何组织、关键常量/schema [2605.19932]——并明确论证保存 agent 自身轨迹(shared chat/compaction)是错误对象、甚至有害 [2605.19932]。检索式 memory 保存的是写入时固化的条目 [2605.21463],PEEK 保存的是有损蒸馏、丢弃 task-specific 规则的常量大小工件 [2605.19932]。三类对象(轨迹/经验条目/上下文定向知识)各自最优的管理策略并不相同。
分歧 2:显式 skill 描述 vs 参数化策略(symbolic vs neural)。MemSkill 保留了 memory 操作的显式性——skill 以自然语言 description 存在,可被人类审计、手动编辑、选择性迁移 [2602.02474]。MCMA 和 Mem-π 将记忆管理完全参数化为模型权重,更强大但完全不透明 [2602.02474]。PEEK 站在 symbolic 一侧但走得更远:map 是带稳定 item ID 的人类可读结构化文本,编辑保持局部可追踪 [2605.19932],管理逻辑也未固化进权重。这反映了 AI 系统设计中经典的 symbolic vs neural 张力,在 agent memory 领域尚无明确胜者。
分歧 3:训练范式的根本选择,以及"是否需要训练"。三条训练路径之间存在不可调和的 trade-off,而 PEEK 提出了第四种立场——根本不训练:
| 系统 | 范式 | 信号来源 | 优势 | 代价 |
|---|---|---|---|---|
| MemSkill | Online PPO | 在线 reward | 实时 reward 反馈 | RL 在稀疏 reward 下不稳定 [2602.02474] |
| MCMA | Offline DPO | 离线偏好对 | 训练成本低、无需环境交互 | 无法学到部署分布下的在线反馈 [2601.07470] |
| Mem-π | SFT + Decoupled GRPO | 在线任务成功率 | 最精细的 decision-content 分离 | 每 RL step 需完整环境 rollout,成本极高 [2605.21463] |
| PEEK | 无训练(prompted policy) | 推理时轨迹信号,无 ground truth | 零训练、跨 backbone 即插即用 | 每查询 6.2–17.9% 维护税、纯实证无保证 [2605.19932] |
按部署便利性排序,PEEK 与 MCMA 位于易部署一端(前者零训练、后者离线训练),Mem-π 因每步 rollout 位于最重一端 [2601.07470] [2605.19932]。
分歧 4:是否需要 abstention 机制。Mem-π 的核心发现是在简单任务上约七成情况 abstention 是最优选择,SR improvement 仅 +1.3 pp [2605.21463]。MemSkill 对每个 span 无差别地应用 Top-K skills,没有"不处理"的选项 [2602.02474]。MCMA 在无匹配时迁移 Copilot 本身——即使不确定也尝试提供 guidance [2601.07470]。PEEK 没有 query 级 abstention,但通过 Distiller 的 helpful/harmful/neutral/stale 标签和 Evictor 的预算淘汰,对写入内容做选择性保留——丢弃 task-specific 与有害条目 [2605.19932],是一种"内容级"而非"动作级"的克制。分歧的本质是对 memory 的 default stance:Mem-π 认为 default 应是沉默,MemSkill/MCMA 认为 default 应是尝试帮助,PEEK 则认为总要维护一份 map、但要严格筛掉不可迁移的内容。
分歧 5:Memory 输出的结构化程度。MCMA 在四种结构原语(text/kv/chain/tree)间选择 [2601.07470],MemSkill 通过 skill bank 生成结构化 memory updates [2602.02474],Mem-π 生成自由文本 guidance(≤256 tokens)[2605.21463],PEEK 用固定 5 段 schema(2 默认 + 3 可选)+ 稳定 item ID 的常量大小 map(默认 B=1024 tokens)[2605.19932]。结构化表示的优势在于可组合性与可定位编辑——MemSkill 的 Top-7 skills 在 200-doc 设置下持续提升性能 [2602.02474],PEEK 的 stable-ID schema 让 ADD/DELETE/REPLACE 编辑保持局部 [2605.19932],而 Mem-π 的单条 256 token guidance 可能在复杂任务上表达力不足 [2605.21463]。
所有现有系统固定在单一压缩层级操作 [2604.15877]。Experience Compression Spectrum 识别了三个缺失能力:自适应选择压缩层级、向上推动知识(低层到高层)、以及向下回退知识(高层工件失败时降级)[2604.15877]。
为何是根本困难:跨层级 routing 需要一个 meta-controller 在无标注信号的情况下判断"这段经验应该被压缩到哪个层级"。不同层级的 reward 信号不可直接比较——episodic memory 的价值体现为 retrieval relevance,procedural skill 的价值体现为 task success rate,declarative rule 的价值体现为跨任务泛化性 [2604.15877]。需要统一的 utility metric 或 multi-objective RL formulation,目前无人尝试。
需要协同的 category:agent(运行时路由架构)+ algorithm(multi-objective RL 或 bandit formulation)。MemSkill 的 variable-size action space + PPO 设计是潜在 building block [2604.15877],但需从单层级内部路由扩展到跨层级路由。
预估难度:2–3 年。
AI Meets Brain 综述系统化了 extraction/poisoning/retrieval defense/response defense/privacy defense 五大类攻击 [2512.23343],但所有三个可学习 memory 系统均未讨论安全问题 [2512.23343]。可学习化引入了新的攻击向量:
为何是根本困难:安全防御不应是事后补丁——需要在 extraction 阶段就有 adversarial filtering,在 retrieval 阶段有 provenance verification [2512.23343]。但当前所有系统的管理循环中都没有对抗性鲁棒性约束,加入后会显著增加复杂度并降低 signal quality。
预估难度:3–5 年。
三个可学习 memory 系统在不同 backbone、不同超参下报告结果,无法直接比较 [2601.07470]。MemSkill 评测于对话记忆(LoCoMo, LongMemEval)[2602.02474];MCMA 评测于确定性文本环境(ALFWorld, ScienceWorld)[2601.07470];Mem-π 评测于真实网页环境(WebArena)[2605.21463];PEEK 评测于 OOLONG 与 CL-bench 两类长上下文/上下文学习任务 [2605.19932]。PEEK 的"被拒 benchmark"分析本身放大了这一缺口:它弃用 BrowseComp-Plus/FanOutQA(per-task 证据近乎不相交)与 QuALITY(上下文太短无需缓存),并据此呼吁建立"在单一持久上下文上原生提出大量难题"的 benchmark [2605.19932] [2605.19932]。
为何是根本困难:标准化 benchmark 需要固定 Task Model、固定环境 split、报告 wall-clock 和 token cost,但不同方法对环境交互的需求截然不同(MCMA 不需要环境交互,Mem-π 的每个 RL step 都需要完整 rollout,PEEK 是 inter-query 复用且对 workload shape 敏感),统一 cost metric 与统一 workload 形态本身就是未解问题。
预估难度:1–2 年(工程主导,但需社区协调)。
所有三个训练系统在训练后模型即冻结,缺乏部署后持续改进能力。MCMA 的 DPO 训练是一次性的 [2601.07470],Mem-π 训练后 $\pi_{\text{mem}}$ 固化 [2605.21463]。仅 MemSkill 的 Designer 提供了有限的进化能力,但 Designer 本身不接受 online reward [2602.02474]。PEEK 的 map 是 inter-query 在线生长的——m=n 时每次查询都更新 map [2605.19932],但实践中常在 m=1 后冻结以摊销维护成本 [2605.19932],且 map 仅在单一持久上下文内积累、不跨 session 持久化 [2605.19932],因此仍不是真正的长期持续适应。
认知科学中的 memory reconsolidation——检索本身改变记忆痕迹——是一个关键但无系统实现的启示 [2512.23343]。Idle-time consolidation(agent 空闲时执行离线巩固)也从未被实现 [2604.15877]。
预估难度:2–3 年(需要解决 catastrophic forgetting)。
Agent memory 的可学习化在 2025–2026 年处于研究前沿的快速扩展阶段。三个可学习系统均发布于 2025 上半年,互不引用,说明这是一个自发涌现的方向而非单一团队推动的路线 [2601.07470]。PEEK(2026-05)从长上下文/上下文工程支线汇入,进一步把可学习记忆扩展到外部上下文对象 [2605.19932],显示该主题仍在向外吸纳相邻方向,而非收敛。
| 维度 | 评估 | 证据 |
|---|---|---|
| 方法多样性 | 高 | 三条训练路径(PPO/DPO/GRPO)+ 一条无训练 orientation-cache 路径同时存在 [2601.07470] [2605.19932] |
| 实证验证 | 中 | 各自在不同 benchmark 上显著提升(MemSkill +62.8% LongMemEval [2602.02474], MCMA +27.85% ALFWorld [2601.07470], Mem-π +59% WebArena [2605.21463], PEEK +6.3–34.0% OOLONG [2605.19932]),但缺乏 head-to-head 对比 |
| 代码开放度 | 低 | 三个训练系统截至 2026-06 均未公开完整实现 [2601.07470];PEEK 仅给出 code handle 但 ingest 材料无 file:line 级实现 [2605.19932] |
| 商业部署 | 极低–中 | MUSE-Autoskill 提及 production 部署但未公开数据 [2605.27366];PEEK 展示 small GPT-5-mini + PEEK 在 CL-bench leaderboard 上可与 frontier 模型竞争,且无改动迁移到生产级 Codex [2605.19932] |
| 理论基础 | 中 | 认知科学综述提供跨学科理论支撑 [2512.23343],但无形式化收敛保证或 regret bound;PEEK 亦明确为纯实证、无保证 [2605.19932] |
| 安全性 | 低 | 综述系统化了威胁模型,但所有系统论文均未实现任何安全防御 [2512.23343] |
Evidence:
尚未出现 dead-end 信号或 migrating 信号——所有路径都展示了正面结果,处于并行发展阶段。
MemSkill 的 closed-loop skill evolution(Designer 从 hard cases 进化 skill bank)[2602.02474] 和 MUSE-Autoskill 的 5 阶段生命周期 [2605.27366] 与 self-evolving agents topic 高度重叠。边界区分在于:本 topic 聚焦"memory/skill 如何学习管理经验",self-evolving agents topic 聚焦"agent 如何整体性地自我改进"。两者在 MemSkill 的 Designer 和 MUSE 的 Refiner 上产生交集。
三个系统使用的 PPO [2602.02474]、DPO [2601.07470]、Decoupled GRPO [2605.21463] 均为 RL/alignment 训练方法。RL for agent optimization topic 关注训练算法本身的创新(如 Mem-π 的 structured counterfactual rollout 和 $\Delta$-gating),本 topic 关注这些算法在 memory management 上的应用。技术线在 algorithm category 上交叉。
PEEK 把本 topic 与长上下文/上下文工程方向缝合在一起:它的动机底座是"输入长度本身即使在完美检索下也损害推理",常量大小常驻 map 是 retrieve-then-solve 在 agent-loop 上的类比 [2605.19932],其 tag 直接包含 long-context / context-engineering / cache-policy。本 topic 关注"记忆作为可学习认知技能",长上下文 topic 关注"如何在窗口约束下保持推理质量";两者在 PEEK 的 orientation cache 上交汇——map 既是一份记忆工件,也是一种上下文管理策略 [2605.19932]。
Experience Compression Spectrum 的 lifecycle gap 发现 [2604.15877] 和 MUSE-Autoskill 的 unit-test gating [2605.27366] 与 skill governance topic(涵盖 SLIM、Library Drift 等同期工作)密切相关。两个 topic 在"如何管理可复用知识工件的生命周期"上共享问题域,但 skill governance 更聚焦于 retirement/pruning 策略,本 topic 更聚焦于 learning/acquisition 策略。
| Entity | Categories | Role in topic | Key contribution |
|---|---|---|---|
| [2602.02474] MemSkill | agent, algorithm | 可学习 memory 范式之一 | RL-trained skill bank + Designer evolution, variable-size Top-K without-replacement policy |
| [2602.02474] MemSkill L3 | agent | 范式定位与竞争分析 | 三范式比较(Learn to Abstract / Select / When & What),symbolic vs neural 张力分析 |
| [2601.07470] MCMA | agent, algorithm | 可学习 memory 范式之一 | DPO-trained Memory Copilot, multi-structure abstraction, continuous α parameter |
| [2601.07470] MCMA L3 | agent | 跨模型迁移验证 | Copilot 本身可跨域跨模型迁移,deployment 便利性最高 |
| [2605.21463] Mem-π | agent, algorithm | 可学习 memory 范式之一 | 生成式 memory policy, calibrated abstention routing, decision-content decoupled GRPO |
| [2605.21463] Mem-π L3 | agent | 端到端生成范式分析 | Memory as independent generative policy, 训练成本 vs 适应性 trade-off |
| [2512.23343] AI Meets Brain | agent | 认知科学理论基础 | Nature×scope taxonomy, management closed loop, security threat model |
| [2512.23343] AI Meets Brain L3 | agent | 框架完备性分析 | Taxonomy 不完备(缺 compression 和 generative reconstruction 维度),安全与设计脱节 |
| [2604.15877] Experience Compression | agent | 统一元框架 | Compression spectrum 统一 memory/skill/rule, missing diagonal 定义, <1% 互引率发现 |
| [2604.15877] Experience Compression L3 | agent | 概念统一价值评估 | Framework without implementation, missing diagonal 尚未被任何系统填补 |
| [2605.27366] MUSE-Autoskill | agent | Skill 生命周期工程 | 5-stage lifecycle, unit-test gating, self-generated skills > human skills, cross-agent transfer |
| [2605.27366] MUSE-Autoskill L3 | agent | 生命周期竞争格局 | Creation-first vs retirement-first 路径分化,production 部署信号 |
| [2605.19932] PEEK | agent | 外部上下文定向缓存范式 | Constant-size context map + Distiller/Cartographer/Evictor cache policy, 填补 active×external-context 象限 |
| [2605.19932] PEEK L3 | agent | 记忆对象新轴定位 | Orientation knowledge about context(非轨迹/非条目), 跨 backbone 可移植性, model-managed-context 共识 |