这个方向不是被一篇论文催生的,而是被四条陆续到期的债务逼出来的,而且它们分别落在
该主题的历史起点是 DreamerV3:它用 RSSM 潜在世界模型在“想象轨迹”里训练 actor-critic,并以一组量纲无关变换(symlog、symexp twohot、KL free bits、百分位回报归一化)让一套固定超参跨 150+ 任务成立,首次确立了“世界模型是控制的操作性基础设施”这一范式。 [ref:L2:2301.04104#1-tl-dr] [ref:L2:2301.
这个主题追问一件事:当一个模型学会"预测世界的下一步",它离"成为一个会行动的 agent"还有多远?答案在 2026 年集中显形——世界模型不再只是被动的动力学预测器,而是被直接当成 agent 的**模拟器、策略与规划器**:先在脑中"想象"未来,再把想象读成动作。DreamZero 把世界动作模型明确定位为 zero-shot 策略,动作直接从"想象出的未来视频计划"里读出,无需任何 tes
KV-cache offloading 作为一个独立方向的形成,源于两股力量的碰撞:一方面,LLM 推理中 KV cache 随序列长度线性增长,直接成为 GPU VRAM 的首要瓶颈,限制可服务的 batch size 和最大上下文长度 [ref:2506.03296#q1-痛点];另一方面,CPU DRAM 容量通常是 GPU HBM 的 10–100 倍,且 CPU 内存带宽与 GPU 的差
这个主题聚合的动因是:一个原本只活在推理系统底层的加速范式——"用便宜的方式先猜,再用权威的方式验证,只保留验证通过的部分"——在 2025 年底到 2026 年中同时向两个截然不同的粒度扩张,并各自催生出一批工作,值得作为一个横跨类别的方向统一评价。
2025–2026 年间,agent memory 领域出现了一次范式级转向:**记忆管理从人工设计的固定流水线走向数据驱动的可学习系统**。这一方向同时整合了 agent 运行时架构和训练算法两个维度的创新,是一个天然跨 category 的前沿研究聚落。
Agent skill 在 2024–2025 年间从"有就好"(static injection)进入"怎么管"(dynamic lifecycle management)阶段。这一转折有三个触发事件:
LLM agents increasingly rely on external skill libraries — modular natural-language instruction packages — to extend their capabilities beyond pre-trained knowledge. As these libraries scale from doze
2023–2026 年,AI 服务平台经历了三次范式跃迁:IaaS 卖 GPU 算力 → MaaS 卖 Token → AaaS 卖结果。每一次跃迁都伴随着计费单位的抽象化、风险承担方的转移、以及基础设施栈的结构性重组。
2025–2026 年,coding agent 和 deep-research agent 成为 LLM 的主流使用模式。一个 agent 在执行复杂任务时,其 context 窗口会经历数十轮工具调用,累积大量文件内容、搜索结果、执行日志。这个过程暴露了五个分布在不同系统层级、但互相交织的问题:
2025–2026 年,LLM 的主流使用模式从单请求问答转向多轮自主工具调用(agentic workload)。这一转变使传统负载均衡算法系统性失效:agent 的长 session、持续增长的 KV Cache、bursty 的工具调用模式、以及不可迁移的 decode 状态,要求调度系统从"无状态请求分发"跃迁到"有状态工作流编排"。
2025–2026 年,agent 系统从"单轮推理优化"跃迁至"多轮工作流系统工程",而工作流中的不同阶段对模型能力的需求呈现出显著的**异构性**——规划与工具选择需要 frontier 大模型(LLM, 70B+),而子任务执行、结果组装、本地数据读取等环节完全可以交给小模型(SLM, 1B–8B)。这种异构需求催生了"强弱模型协作"这一跨 agent、framework、model 三个类
2018–2021 年间,AI 推理芯片(Habana Goya/Gaudi、Google TPU、Graphcore IPU)普遍采用 graph compilation 技术:编译期知道所有 tensor shape,静态规划执行流水,中间 activation 尽量驻留片上 SRAM。这一范式在 ASIC 上通过硬件支持(大 SRAM + 异构引擎 + 硬件 scheduler)获得了天然优
2024–2026 年,LLM 推理工作负载从大 batch 训练时代的规则化执行模式,全面转向延迟敏感的微 batch serving。Token-by-token decoding 每次 forward 仅涉及少量数据但触发上百个 μs 级小操作——attention QKV、softmax、activation、LayerNorm、KV cache update 等 [ref:2604.17
大规模 LLM 集群部署正在经历从"单节点单模型"到"千 GPU 级多模态流水线"的范式跃迁。这一跃迁受到六股力量的同时驱动。
2024 年 5 月到 2026 年 7 月的 26 个月里,开源 MoE 大模型走完了三代跨越,并在 2026 年分裂出两条互不通约的旗舰路线——**架构优先**(DeepSeek)与**训练/编排优先**(Moonshot)。到 2026 年 7 月 Kimi K3 发布,Moonshot 这条线也回到了架构轴,两家于是第一次在同一季度交付了同一类产品:原生 1M 上下文的开源稀疏 MoE 前
2025–2026 年,LLM 的主流使用模式正从**单请求问答**向**多轮自主工具调用**剧烈迁移。以 Cursor、Claude Code、Windsurf、Cline 为代表的编程 agent 成为最显著的工作负载形态——它们运行 12+ 小时的连续 session、在单次任务中产生 4000+ 工具调用、消耗 100K–262K tokens 的上下文窗口 [ref:L2:kimi-k2