2024 年 5 月到 2026 年 7 月的 26 个月里,开源 MoE 大模型走完了三代跨越,并在 2026 年分裂出两条互不通约的旗舰路线——架构优先(DeepSeek)与训练/编排优先(Moonshot)。到 2026 年 7 月 Kimi K3 发布,Moonshot 这条线也回到了架构轴,两家于是第一次在同一季度交付了同一类产品:原生 1M 上下文的开源稀疏 MoE 前沿模型 [kimi-k3] [deepseek-v4]。与此同时,为这些万亿到数万亿参数模型服务的推理与训练基础设施经历了同等量级的范式变迁:从单集群 RDMA serving 到跨数据中心 PD 分离 [2604.15039],从 request 级调度到 program-aware 编排 [2602.13692],从通用 kernel 到 persistent megakernel 与 chiplet 感知调度 [tile-ai-tilert] [2604.15379]。
模型侧,这条路线的根在 DeepSeek-V2(2024-05)——它以 236B/21B MoE 首次把 Multi-head Latent Attention(MLA,低秩 KV 联合压缩,KVCache 降 93.3%)与 DeepSeekMoE(共享专家 + 细粒度路由专家)组合,用 21B 激活参数达到接近 70B dense 的英文质量,训练成本节省 42.5%、单节点 8×H800 生成吞吐 5.76×,开创了"高效 attention + 高效 MoE = 经济 AI"范式 [2405.04434] [2405.04434]。DeepSeek-V3(2024-12)原样沿用 V2 的 MLA + DeepSeekMoE 主干 [2405.04434],以 671B/37B MoE + DualPipe 奠基了万亿参数训练的工程范式,仅 $5.576M 训练成本即达到闭源可比性能 [2412.19437]。V4(2026-04)做了三个替换级升级——MLA → hybrid CSA+HCA、标准 residual → mHC、AdamW → hybrid Muon——把 1M 上下文下的 KV cache 降至 V3.2 的 10%、FLOPs 降至 27% [deepseek-v4]。Kimi 这条线则从 K2(2025-07)到 K2.6(2026-04)四代复用同一 1.04T MoE + MLA 主干,config.json 逐字不变 [kimi-k2-6],把全部创新投入 MuonClip 优化器 [2507.20534]、多模态对接 [2602.02276]、长程 agentic RL 与 INT4 单节点部署 [kimi-k2-6];Kimi Linear(2025-10)在旁支上验证了第三条注意力路线,KDA 线性注意力在公平对比下首次于短上下文、长上下文、RL 三个场景同时超越全注意力 [2510.26692]。
K3(2026-07)是这条谱系上第一次同时动架构、模态、上下文三条轴的发布:2.8T 总参 / 104B 激活、16-of-896 路由专家、3:1 的 KDA–Gated MLA 混合注意力、Attention Residuals 深度聚合、原生视觉、1M 上下文、权重开放 [kimi-k3] [kimi-k3]。它把 Kimi Linear 的旁支实验提升为主干,也把本主题从"两条路线"重新收敛为"两家在同一产品类别上的正面对照"[kimi-k3]。
框架侧,这些模型的部署驱动了一整代基础设施创新。DualPath 把 PD 分离的存储带宽瓶颈从 prefill 端扩展到 decode 端聚合 [2602.21548];PrfaaS 利用混合注意力把 KV 吞吐降 4–13× 使跨 DC Ethernet PD 分离成为现实 [2604.15039];ThunderAgent、Halo、KVFlow 把调度粒度从 per-request 提升到 per-program / per-workflow [2602.13692] [2509.02121] [2507.07400];TileRT 把整个 DeepSeek-V3.2 提前编译为单个 persistent Engine Kernel [tile-ai-tilert];TokenSpeed 用静态 Placement 编译器专攻 MLA 内核 [tokenspeed];ZeRO-Prefill 反转 MoE 专家并行的数据流方向 [2605.02960];TensorHub 与 HybridFlow 支撑 RL 侧的权重分发与控制流 [2604.09107] [2409.19256]。
这两个维度已经深度耦合,而 K3 把耦合的方向讲得比任何前作都直白:多处架构改动的直接动机是解锁某条 kernel 路径,而不是模型质量 [kimi-k3]。要理解 2026 年的开源前沿 MoE,必须同时看模型设计与基础设施这两面 [model] [framework]。
| Category | Paper Count | Representative |
|---|---|---|
| model | 9 | Kimi K3(2.8T/104B、16-of-896、原生 1M 多模态)[kimi-k3]、DeepSeek-V2(MLA + DeepSeekMoE 谱系根)[2405.04434]、DeepSeek-V4(CSA+HCA 1M 上下文)[deepseek-v4]、Kimi K2(MuonClip + sparsity-48)[2507.20534]、Kimi K2.5(MoonViT-3D + PARL)[2602.02276]、Kimi K2.6(长程 agentic RL)[kimi-k2-6]、Kimi Linear(KDA 线性注意力)[2510.26692]、Attention Residuals(深度聚合)[2603.15031]、Massive Values(RoPE 机理分析)[2502.01563] |
| framework | 13 | DeepSeek-V3(DualPipe + FP8 训练范式)[2412.19437]、DualPath(PD 存储带宽)[2602.21548]、PrfaaS(跨 DC PD)[2604.15039]、ZeRO-Prefill(MoE 专家并行优化)[2605.02960]、ThunderAgent / Halo / KVFlow(agentic serving)[2602.13692] [2509.02121] [2507.07400]、TileRT / TokenSpeed(persistent kernel 与 MLA 专用引擎)[tile-ai-tilert] [tokenspeed]、TensorHub(RL 权重传输)[2604.09107]、Fleet(chiplet megakernel)[2604.15379]、FaaSMoE(serverless 专家服务)[2604.26881]、HybridFlow/veRL(RL 训练)[2409.19256] |
两个类目各自的横向格局见 [model] 与 [framework];本主题只取其中被 MoE + 开源前沿这条线穿起来的部分。
| 时间 | 事件 | 意义 |
|---|---|---|
| 2024-05 | DeepSeek-V2 发布 | 236B/21B MoE 首创 MLA + DeepSeekMoE,KVCache 压缩 93.3%、训练成本 −42.5%、推理吞吐 5.76×,开创"经济 AI"范式,是全部后续路线的谱系根 [2405.04434] [2405.04434] |
| 2024-09 | HybridFlow/veRL 发布 | Hybrid single/multi-controller + 3D-HybridEngine,开源 RL 训练框架的事实标准 [2409.19256] |
| 2024-12 | DeepSeek-V3 发布 | 671B/37B MoE + MLA + DualPipe,$5.576M 训练成本,万亿参数训练工程范式成型 [2412.19437] |
| 2025-02 | Massive Values 分析发表 | 揭示 RoPE 低频维度 massive values 是上下文知识理解的关键通路,直接指导量化策略选型 [2502.01563] |
| 2025-07 | Kimi K2 发布 | 1T MoE + MLA 主干首次亮相,MuonClip 解决 Muon 引发的 attention logit 爆炸,sparsity 48 scaling law 是本谱系唯一一条 controlled 的稀疏度曲线 [2507.20534] |
| 2025-07 | KVFlow 发布 | Workflow-aware steps-to-execution 替代 LRU 缓存驱逐 [2507.07400] |
| 2025-09 | Halo 发布 | 数据库 query optimizer 思想引入 agentic workflow 批处理 [2509.02121] |
| 2025-10 | Kimi Linear 发布 | KDA 线性注意力 3:1 混合首次在公平对比下于短/长/RL 三场景全面超越全注意力,并给出写清拟合形式的 1.16× scaling 效率 [2510.26692] |
| 2026-02 | Kimi K2.5 发布 | MoonViT-3D + 零视觉 SFT,10:90 低视觉比例优于 50:50,PARL Agent Swarm [2602.02276] |
| 2026-02 | DualPath 发布 | 聚合全部 SNIC 带宽突破 PD 存储瓶颈,1152 GPU 近线性扩展 [2602.21548] |
| 2026-02 | ThunderAgent 发布 | Agentic program 成为一等调度单元 [2602.13692] |
| 2026-03 | Attention Residuals 发表 | 深度 softmax 聚合替代恒定权重残差,在 Kimi Linear 48B 上 GPQA +7.5 [2603.15031] |
| 2026-04 | DeepSeek-V4 发布 | CSA+HCA 替换 MLA、mHC 替换 residual、Muon 替换 AdamW,原生 1M 上下文,并给出完整训练超参 [deepseek-v4] [deepseek-v4] |
| 2026-04 | Kimi K2.6 发布 | 架构冻结,长程 RL + Swarm 3× + INT4 默认 + Claw Groups,把"单 8 卡节点可部署"写进 load-bearing 论证 [kimi-k2-6] |
| 2026-04 | PrfaaS 发布 | 跨 DC Ethernet PD 分离,混合注意力使单实例 KV 吞吐降 4–13× [2604.15039] |
| 2026-04 | TensorHub 发布 | Reference-Oriented Storage 消除 RL 权重传输瓶颈,支持跨 DC 复制 [2604.09107] |
| 2026-04 | Fleet 发布 | Chiplet-task 四级抽象,把 XCD 私有缓存变成显式软件资源 [2604.15379] |
| 2026-04 | FaaSMoE 发布 | MoE 专家到 serverless 函数的结构映射,多租户专家池共享的 CPU-only 概念验证 [2604.26881] |
| 2026-05 | TileRT / TokenSpeed 生产验证 | Persistent Engine Kernel 与 MLA 专用引擎把超低延迟解码推到可交付状态 [tile-ai-tilert] [tokenspeed] |
| 2026-05 | ZeRO-Prefill 发布 | AsyncEP 反转 MoE 专家并行数据流,消除 AllToAll [2605.02960] |
| 2026-07 | Kimi K3 发布 | 2.8T/104B、16-of-896、3:1 KDA–MLA 混合、原生视觉、1M 上下文、权重开放;本谱系首次架构级 redesign,也是首次公开承认多处架构决策由 kernel 而非质量仲裁 [kimi-k3] [kimi-k3] |
时间线呈现两种节奏。其一是模型与框架的交替推进:每一代模型的架构创新(V3 的 MLA、V4 的 CSA+HCA、Kimi Linear 的 KDA)都在 3–6 个月后催生出对应的基础设施优化 [framework]。其二是旁支转主干:Kimi Linear 在 2025-10 以 48B 规模验证的 KDA,21 个月后成为 2.8T 主干的序列维支柱,而 K2.6 自己在 2026-04 就预测过 K3 应是架构级 redesign [kimi-k2-6]。
谱系的注意力主干始于 DeepSeek-V2 的 MLA——低秩 KV 联合压缩到 512 维 latent 加 decoupled RoPE,在两个 scale 的消融中严格优于 MHA [2405.04434];V3 原样沿用,V4 的 CSA+HCA 与 Kimi 线的 KDA:MLA 混合都是从这一根节点分叉出来的 [2405.04434]。
K3 的加入让谱系图出现三个新的结构特征。其一是旁支回流:Kimi Linear 的 KDA 与 Attention Residuals 两项 48B 级旁支实验,在 K3 中同时被提升为 2.8T 主干组件,且 3:1 混合比原样沿用、未在新规模复验 [kimi-k3]。其二是机制消失:K2 最著名的 QK-Clip 在 K3 中不再出现,一个可核的解释是 NoPE 删掉了 rotary 分量,而 QK-Clip 的分裂处理存在的唯一理由正是 MLA 的 compressed 与 rotary 分量必须区别对待——若成立,则解锁 1M 的那次架构改动顺带消灭了本谱系最著名的稳定性补丁 [kimi-k3]。其三是收敛点:负载均衡与 post-training 两条支线上,两家从不同方向到达了形态相近的终点——DeepSeek 的 sign-step 与 K3 的 Quantile Balancing 是同一对偶目标上的 SignSGD 与精确坐标极小点 [kimi-k3],而 V4 的 Specialist + OPD 与 K3 的 9 专家 + MOPD 是同一套"多教师 on-policy 合并"范式的两次独立实现 [kimi-k3]。
这条约束链的经济性基线由 DeepSeek-V2 的 MLA 奠定:缓存的是 512 维 latent 而非完整 K/V,从一开始就要求推理框架为异构 KVCache 格式做适配 [2405.04434] [2405.04434]。后续所有压缩注意力对推理栈的冲击,本质是这一设计的延续与放大。V4 的 CSA+HCA 引入 State Cache + Classical KV Cache + Lightning Indexer 三套并存的存储结构 [deepseek-v4],打破了 PagedAttention 的分页假设;相比之下 K2.6 的标准 MLA 可以直接复用现有生态的 DeepseekV3ForCausalLM 路径 [kimi-k2-6]。
K3 把这条约束推到了新的形态。它的 69 层 KDA 各持一份与序列长度无关的定长状态,状态只能在稀疏边界快照——如果缓存 hash 粒度绑定物理块,块大小会被迫拉到 1024–6144 token,短请求永远无法复用;解法是把 hash 粒度(512 token)与物理块粒度解耦,代价是三个并发一致性机制 [kimi-k3]。这与 V4 那侧的做法正好互补:压缩 entry 是位置对齐的,天然按最小公倍数粒度可缓存可复用 [kimi-k3]。同一个"1M 上下文"目标,在缓存层派生出两套互不兼容的复用语义,这是本主题当前最具体的一处 model 与 framework 交错。
Kimi Linear 的 KDA:MLA 3:1 混合最早展示了这种耦合的收益面:综合 KV 吞吐降到标准 MLA 的约四分之一 [2510.26692],PrfaaS 正是利用这一特性把单实例 KV 吞吐降到跨 DC Ethernet 可承受的量级 [2604.15039]。而 TokenSpeed 的 MLA q-head 折叠与静态 Placement 编译 [tokenspeed]、TileRT 的整模提前编译 [tile-ai-tilert] 则代表相反方向的应对——不追通用性,直接为单一架构定制整条执行路径。
K2 的 sparsity 48 是本谱系唯一一条 controlled 的稀疏度曲线:固定 8 个激活专家扫池子大小,48 相对 32 省 1.15× FLOPs [2507.20534]。此后两家走向表面相反:K3 把池子 384→896 且激活数 8→16,V4 把激活数降到 top-6 而把池子扩到 384 [deepseek-v4]。
这个矛盾的根源是计数单位而非策略。 按"每层每 token 激活的专家参数量"归一,K2 是 352M、K3 是 528M、V4-Pro 是 396M,三者同量级;两家其实都在往更细粒度的专家走,只是 K3 通过把专家输入宽度压窄到 $\ell = d/2$ 实现,V4 通过削减激活个数实现 [kimi-k3]。K3 的 LatentMoE 因此有一笔可以算清的净账:路由总量与 all-to-all 流量各自减半,代价是 4.73B 恒定激活的投影税 [kimi-k3]。这也带出一个与官方叙事相反的事实——从 K2 到 K3,稠密路径的增速是稀疏路径的 2.1 倍(非路由激活 4.84× vs 路由激活 2.30×),"增益押在稀疏扩张"的说法与实际参数流向不符 [kimi-k3]。
更高稀疏度意味着更大的 all-to-all 压力,而应对策略已分化为四条。V3 的 DualPipe 用专用 SM 做通信隐藏 [2412.19437];V4 的 MoE fused EP kernel 把 Dispatch/Linear-1/Linear-2/Combine 四阶段做 wave 粒度细粒度重叠 [deepseek-v4];ZeRO-Prefill 论证 AllToAll 是零价值通信、用 weight streaming 完全消除它 [2605.02960];K3 的 MoonEP 则走第四条——先用负载均衡拿到不变式,再用不变式换掉整类通信开销:$E/R$ 冗余专家上界使每 rank 恰好 $S\times K$ token,由此得到静态计算形状、免除逐层 host 同步、定长通信 buffer 与零拷贝 permute [kimi-k3]。这条链的下游赌注很大:一旦 Quantile Balancing 的残余不均衡不可忽略,$E/R$ 不变式即破,静态形状与零拷贝路径全部退化 [kimi-k3]。四条路线的取舍轴见 [framework] 与 [model]。
FaaSMoE 提出了第五条路线——把 MoE 的稀疏激活与 serverless 的 scale-to-zero 做结构映射,多租户共享同一专家池 [2604.26881]。但它的 CPU-only 原型与 GPU-native MoE serving 的现实脱节严重:函数调用开销相对专家前向计算高出两个数量级,且评估规模极小 [2604.26881] [2604.26881]。这一张力恰好界定了 MoE serving 的两个极端——ZeRO-Prefill 追求"所有专家本地可用"以消除通信,FaaSMoE 追求"仅活跃专家存在"以消除冗余 [2605.02960]。
K2.6 的 4000+ 工具调用、12–13 小时连续执行 [kimi-k2-6] 对框架提出三个要求:fault-tolerant rollout、TB 级权重分发、以及 agentic 推理调度。TensorHub 的 Reference-Oriented Storage 解决了第二项 [2604.09107],ThunderAgent 的 program-aware 调度与 KVFlow 的 workflow-aware 驱逐解决了第三项 [2602.13692] [2507.07400],HybridFlow 的混合控制器模型则是这整类 RL 训练框架的公共底座 [2409.19256]。
K3 把第一项推到了工程化的极致,同时暴露出一个新的隐含前提。它的 partial rollout 让一条轨迹跨迭代续跑,靠的是可恢复 microVM 沙箱舰队(累计 51,219,741 个沙箱),这条链在 1M 上下文下才成立 [kimi-k3]。但 MOPD 的逐 token reward 是 teacher 与 student 的裁剪 log-ratio,其数值直接依赖 logit 的可复现性;而 partial rollout 会改变 batch 组成,在非 batch-invariant 的 kernel 下就会改变归约顺序、改变 logit、从而改变 reward 本身 [kimi-k3]。K3 消除的是数值格式差(rollout 与 training 共用同一量化方案)[kimi-k3],V4 消除的是归约顺序差(放弃 split-k、全链路 bitwise 确定性)[deepseek-v4]——两者互不覆盖,而 K3 最精巧的后训练设计恰好需要它自己没有满足的那一半。这是本主题里 model 与 framework 耦合最深、也最容易被漏掉的一处。
三家在低精度部署上独立收敛到同一条边界:低精度只覆盖路由专家。V4 是 FP4 MoE 专家权重 + FP4 indexer QK 路径、其余 FP8 [deepseek-v4];K3 是 MXFP4 权重 / MXFP8 激活,attention、latent 投影、共享专家、router 全部保持高精度 [kimi-k3];K2.6 是 INT4 compressed-tensors [kimi-k2-6]。Massive Values 研究给出了这条边界的机理依据——Q/K 低频维度的集中大值承载上下文知识理解的关键功能,保护这些大值的量化方法显著优于不保护的 [2502.01563] [2502.01563]。取舍轴见 [model]。
AMD MI350 的 chiplet 架构与 MoE 的专家稀疏激活天然亲和。Fleet 的 Chiplet-task 抽象把"一颗 XCD 及其私有缓存"变成显式作用域 [2604.15379],但其 M-major 协作假设会被专家路由打破,论文自己也把 MoE 列为盲区并主动搜索了反方观点 [2604.15379]。V4 的 MoE fused kernel 对硬件提出的建议可以直接指导 chiplet 感知的专家调度设计 [deepseek-v4]。
这是 K3 带进本主题的最重要一条交错,也是唯一一条方向明确的历时趋势。沿谱系看这条曲线很干净:K2 的架构选择由一条 controlled 的稀疏度 scaling law 决定 [2507.20534];Kimi Linear 的 KDA 参数化由表达力-效率 Pareto 决定,配合成对照的合成任务与长上下文基准 [2510.26692]——都是质量论证,效率只是约束。到 K3,最有后果的那次参数化改动(把 log-decay 下界化到 $g_{\min} = -5$)只用计算收益论证,完全没有质量收益论证,报告自己也这么写:唯一目的是让倒数缩放因子留在 BF16 动态范围内,从而让全部因果 tile 走 Tensor Core [kimi-k3]。
V4 展示同一签名:indexer 走 FP4 加 Hadamard 旋转、cache 块按最小公倍数对齐、放弃 split-k 换 batch invariance [deepseek-v4]。两家独立到达同一结论——2026 年的前沿模型架构是 kernel 的函数 [kimi-k3]。
这一反转有一个可核的代价链。$g_{\min} = -5$ 意味着逐通道保留因子恒大于 $e^{-5}$,通道不再能一步清空状态,快遗忘能力被砍掉且无消融 [kimi-k3];而快遗忘正是长程精确检索最需要的能力,长程精确检索恰好是 K3 唯一没测的一类 [kimi-k3]。这条链的三段都可核,结论未定,但它精确地说明了仲裁权反转的后果:kernel 收益可验证,质量代价无人测量。
这一框架由 DeepSeek-V2 开创 [2405.04434],并被确立为开源高效 MoE 的标杆 [2405.04434]。V3、V4-Pro、K2/K2.5/K2.6、Kimi Linear 全部沿用 [2412.19437] [deepseek-v4] [2507.20534] [2510.26692]。K3 的 Stable LatentMoE 仍是这个框架,只是把路由专家的工作宽度压到 $\ell = d/2$、共享专家增到 2 个并走全宽旁路 [kimi-k3]。跨两个团队、六代模型的验证使这一结构成为当前万亿参数开源模型的事实标准 [model]。
V4 用 hybrid AdamW+Muon [deepseek-v4],K2/K2.5/K2.6 用 MuonClip [2507.20534],K3 用 Per-Head Muon [kimi-k3]。谱系根 V2 与 V3 都用纯 AdamW,V3 是最后一个使用纯 AdamW 的前沿开源 MoE [2405.04434]。
三个独立发布收敛到同一条精度边界,见 §5.4 [deepseek-v4] [kimi-k3] [kimi-k2-6]。
K3 的 SiTU-GLU 用光滑 softcap 把线性因子界到 100 [kimi-k3],V4 的 SwiGLU clamp 用硬截断界到 $[-10, 10]$ [deepseek-v4]。这是本主题里唯一一条有两次独立大规模确证的机制,比任何单篇自己的消融都更可信——而两篇都没有单独消融它,两者只在硬 clamp 与光滑 softcap、以及 10 vs 100 的截断值上不同 [kimi-k3]。这也是当前性价比最高的一个待办实验,代理规模即可完成 [kimi-k3]。
V3 的 post-training 仅占 5K GPU hours [2412.19437]。V4 用 10+ 领域专家走 SFT→GRPO 再做全词表 logit 级合并 [deepseek-v4],K2.6 把全部工程投入 post-training [kimi-k2-6],K3 则是 3 域 × 3 effort 共 9 个 RL 专家再由 MOPD 合并 [kimi-k3]。两家独立收敛到同一形态,只在合并信号的用法上分叉:V4 把 log-ratio 当约束项,K3 把同一统计量当 dense reward 喂进 RL 框架以保住 partial rollout 的可用性 [kimi-k3]。取舍轴见 [model]。
K3 是有状态压缩:69 层 KDA 各持定长状态、遗忘是内容相关的学习行为,同时 24 层 NoPE MLA 保留对全 1M 的精确全局注意力 [kimi-k3]。V4 是位置压缩加选择:CSA 每 4 个 token 压 1 条再 top-k 选,HCA 每 128 个 token 压 1 条做 dense attention,除滑窗外没有任何一层是未压缩的 [deepseek-v4] [deepseek-v4]。
失效模式正交:K3 的 KDA 层受容量饱和限制(1M token 与 8K token 共用同样字节的状态),但 26% 的层完全不受影响;V4 全程受分辨率损失限制,但每一条压缩 entry 仍是位置可寻址的 [kimi-k3]。KV 斜率上 V4 更激进 [deepseek-v4]。因为失效模式正交且 kernel 都已存在,两者叠加是本主题最具体的一个未探索方向 [kimi-k3]。位置编码上的三方分歧(RoPE / NoPE / Partial RoPE)见 [model],K3 把 NoPE 从 48B 旁支带到了 2.8T 主干 [2510.26692]。
K3 的 Quantile Balancing 是平衡指派对偶问题的精确坐标极小点,MoonEP 的冗余上界在 $E=896, R=32$ 时与紧性下界精确相等,这是本主题唯一给出可行性保证而非启发式的负载均衡方案 [kimi-k3]。但 V4 在同一规模上报告万亿参数 MoE 的 loss spike 与专家层 outlier 直接相关,routing 会放大 outlier,需要 Anticipatory Routing 加 SwiGLU clamping 两条补丁兜底 [deepseek-v4],而 K3 的立场是观察不到可测量的残余不均衡。
矛盾无法从两篇断定,但有一条可检验的线索:K3 界的是偏置本身的误差,训练关心的却是它诱导的负载误差,后者未被量化;且论文额外建议跨步 EMA 平滑,这句反过来承认了单步估计存在批间噪声 [kimi-k3]。而"刻意使用滞后统计量"正是 Anticipatory Routing 的思路——两家比表面上更接近,两条路线也并不互斥 [kimi-k3]。稳定性技术的分歧全景见 [model]。
K2.6 把"INT4 → 约 258 GB → 单 8 卡节点 → 普惠"列为 load-bearing 论证步骤,并注明 1T 模型不普惠部署就没有开源价值 [kimi-k2-6];其约束推导表更以"再大必须强制多节点、部署生态收窄"为由明确否决了 2T–3T 底模 [kimi-k2-6]。
K3 就是那个三个月前被自家否决的选项。 即便有 MXFP4,权重仍约 1.56 TB,量级落在 32 张 96 GB 或 16 张 141 GB 卡 [kimi-k3]——相对 K2.6 的 258 GB [kimi-k2-6] 是约 6× 的字节抬升、单节点变多节点,而报告没有回应这个判据 [kimi-k3]。这不是一家的口径变化,而是本主题一条延续两年的核心承诺(开源 = 可普惠部署)第一次被自己的旗舰打破。
V3 与 V4 花大量精力优化 AllToAll 调度 [2412.19437] [deepseek-v4],ZeRO-Prefill 论证它应被彻底消除 [2605.02960]。根源在 workload 差异:decode 与训练时每 token 计算窗口太短,无法隐藏权重 AllGather;大 batch prefill 时窗口足够长,weight streaming 更优 [framework]。K3 的 MoonEP 是第三种立场——不优化也不消除,而是先把负载压到精确目标再换取定长通信 [kimi-k3]。
这是 K3 引入的、最需要在主题层面记录的一条分歧,因为它不是任何单篇的疏漏,而是两家在同一季度的方向性差异。
K3 的 ~2.5× scaling 效率主张与本谱系自己的已发表数字不可通约。 Kimi Linear 报的是 MLA $L = 2.3092\,C^{-0.0536}$ 与 KDA $L = 2.2879\,C^{-0.0527}$、1.16× compute efficiency、5 个模型尺度,并坦承超参沿用 MLA 最优值因而 1.16× 是下界——函数形式、系数、拟合范围、保守方向四样俱全 [2510.26692]。K3 的 2.5× 数值大一倍以上,却无拟合形式、无指数、无残差、无置信区间,且拟合区间对应约 1.6B token 的代理模型,比 3T 级实际训练低 3–4 个数量级 [kimi-k3]。做一次量级核对:KDA 混合按实测 1.16×、稀疏度 48→56 按 K2 自己的幂律反推约 1.05×,二者合计约 1.22×,则 $2.5 / 1.22 \approx 2.05$——剩下约 2× 全部落在本谱系任何一篇都没有消融过的机制上,即 2.5× 里可被谱系内证据支撑的部分不到四分之一 [kimi-k3]。
披露标准同样单调下降:K2 给了 15.5T token、67M batch、2e-4 peak LR 与超参搜索结果 [2507.20534],K2.5 起逐代收缩 [2602.02276],到 K3 全部未披露——它披露了方法论的严谨性(对两种 LR schedule 各做一遍独立超参搜索),却扣留了让该严谨性可被利用的全部数字 [kimi-k3]。同期 V4 给出 32T/33T token、75.5M/94.4M batch、双 peak LR 与完整序列课程 [deepseek-v4]。两个方向相反。
与此同时开源策略在往相反方向走:K3 放出权重、MoonEP、AgentENV、FlashKDA、KCP、MiniTriton 与 nano-KPU,但预训练框架、RL 栈、数据管线、前缀缓存与三级调度全部未公开 [kimi-k3]。2026 年开源前沿的实际契约因此是"开放系统,封闭配方" [kimi-k3]——与 K2 时代"只放权重、训练码全闭"[2507.20534] 相比,系统层显著扩张而配方层显著收缩。
K3 的公开条目集中在 ProgramBench / SWE-Marathon / BrowseComp / FrontierSWE / MCPMark-Verified / OSWorld 2.0 [kimi-k3];V4 集中在 SimpleQA-Verified / LiveCodeBench-v6 / Codeforces / Putnam / SWE-Verified / MRCR 1M / CorpusQA [deepseek-v4]。唯一近似重叠是 Terminal-Bench,而 K3 用 2.1、V4 用 2.0,对照的闭源基线也分别是 GPT-5.6 Sol 与 GPT-5.4。2026 年两个旗舰开源 1M MoE 模型之间无法做任何一项直接比较,这与它们在九个设计位置上的独立收敛形成尖锐对比:设计层高度趋同,评测层完全脱钩 [kimi-k3]。上一代还不是这样——K2.6 与 V4 至少共享 SWE-Verified 与 Terminal-Bench 2.0 的可比数字 [kimi-k2-6]。
V4 的异构 KV 存储 [deepseek-v4] 与 K3 的"状态只能在稀疏边界快照" [kimi-k3] 是同一困难的两种形态:每一次注意力架构升级都要求重写推理引擎、重新验证正确性、重新设计缓存复用语义。K2.6 能直接复用现有生态 [kimi-k2-6],V4 与 K3 都不能。当前没有任何通用框架能同时高效支持 MLA、CSA+HCA 与 KDA 混合三种存储布局 [framework]。
为什么它是根本性的而非工程量问题:这一系列压缩注意力连理论依据都尚未闭合。即便是谱系根 MLA,用 512 维 latent 替代 32768 维完整 K/V 却能质量超 MHA,其原因至今只有假说、无验证 [2405.04434]。缺乏这一理论,每种新布局都只能靠经验消融试错,无法预测何种压缩在何种 scale 下无损。取舍轴见 [model]。
部分尝试:TileRT 的整模提前编译 [tile-ai-tilert] 与 TokenSpeed 的静态 Placement 编译 [tokenspeed] 展示了"为单一架构定制整条路径"的思路,但两者都受限于极小 batch 且不支持动态批处理 [tile-ai-tilert]。
预估难度:2–3 年,需要编译器与推理框架团队的深度协作。
K2.6 把单次 rollout 推到 4000+ 工具调用,但未披露 gradient signal 在数千步后的衰减程度 [kimi-k2-6]。这是理论性瓶颈:在数千步轨迹中,某个关键决策对最终 reward 的归因信号极其微弱。K3 的 MOPD 用逐 token log-ratio 提供 dense reward,是本主题目前对这一困难最直接的一次回应 [kimi-k3]——但它把问题转移到了确定性上(见困难 3),且 MOPD 相对单教师或无合并无对照 [kimi-k3]。
新的证据:K3 是本谱系第一次测量过程质量,而一测就测出了最大的单点差距——Agent Behavior Bench 65.0 vs 76.4,方向与"agentic 任务全面领先"的主叙事相反 [kimi-k3]。结合 K2.6 的长程案例只有 happy path、没有失败率 [kimi-k2-6],"长程自主"这条叙事线在整个主题里始终缺少过程侧证据 [kimi-k3]。
预估难度:3–5 年,需要 RL 理论与系统工程共同突破。
V4 投入大量工程实现 batch-invariant 确定性 kernel,这是全词表 logit 匹配的技术前提 [deepseek-v4];K3 消除的是量化格式差 [kimi-k3]。两者互不覆盖,而两家各自的后训练设计都需要两半同时具备:K3 的 MOPD reward 依赖 logit 可复现性,却没有 batch invariance;V4 的确定性方案明显更贵 [kimi-k3]。
更深一层,这套保证深度绑定单一硬件。迁移到 chiplet 架构时确定性需要从头重建,而 Fleet 已经展示了私有缓存行为作为非确定性来源 [2604.15379]。预估难度:未知,取决于硬件厂商是否提供 ISA 级的确定性执行保证。
K2.6 的 300 sub-agent × 4000 步 Swarm [kimi-k2-6]、V4 的跨消息保留推理内容 [deepseek-v4]、K3 的 1M partial rollout 跨迭代续跑 [kimi-k3],都要求推理引擎在小时级跨度内管理海量缓存。当前最先进的方案——ThunderAgent 的时间衰减缓存 [2602.13692]、KVFlow 的 steps-to-execution 优先级 [2507.07400]、Halo 的 epoch 级优化 [2509.02121]——仍各自为政 [framework]。K3 的混合架构又叠加了一层新约束:有状态层与分页层的复用粒度不同,统一框架必须同时容纳两种语义 [kimi-k3]。
预估难度:1–2 年,技术可行但需要 model 与 framework 协同设计。
这是本主题最新、也最结构性的一条困难,且它不是任何一家的疏漏。K3 自己给出了正确的解释:一旦架构决策必须在 3T 级训练启动前一次性拍板、选错的代价是一次重训,那么公开的架构报告在方法学上就会系统性地从"消融支撑"退化为"事后合理化" [kimi-k3]。
证据在本主题内已经三重叠加:K3 的三个稳定性补丁全部无 loss 消融 [kimi-k3];有界 GLU 有两次万亿级独立确证却零次相互比较 [kimi-k3];Attention Residuals 这一被 K3 提升为主干的机制,其关键常数直接取自外部预印本、未在 2.8T 规模复验 [kimi-k3],而它自己的 scaling 指数不变、增益分布不均、且全部实验来自同一团队 [2603.15031]。
为什么无法靠单一领域解决:这不是"没人做",而是做一次的代价等于一次前沿训练。唯一可见的出路是代理规模上的协议标准化——Kimi Linear 已经在同一实验室同一技术线上验证过一次可行的报告格式 [2510.26692],在 $10^{20}$–$10^{21}$ FLOPs 区间多跑几组消融的成本相对主训练可忽略 [kimi-k3]。困难 6 说明了这条出路为何仍未被走通:它需要的不是能力,而是跨实验室的评测与报告约定。
设计层的九处独立收敛本应是本主题最强的证据来源,但它恰好发生在评测层完全脱钩的同一时刻 [kimi-k3]。更具体的一处缺口是:1M 是两家共同的头条特性,K3 的训练课程里专门合成了长上下文数据,结果里却没有任何检索类测量 [kimi-k3] [kimi-k3];而向下对照,48B 的 Kimi Linear 在 128K 上给了完整的检索基准与消融 [2510.26692],向外对照 V4 报了 1M 检索类结果 [deepseek-v4]。谱系在 48B / 128K 上报检索,到 2.8T / 1M 反而不报了 [kimi-k3]。
为什么它是根本性的:这需要多个互为竞争关系的实验室就评测版本与配置达成约定,属于协调问题而非技术问题,没有任何单一团队能单方面解决。预估难度:不确定;历史上此类协调通常由第三方评测机构而非模型作者推动,而 K3 恰好是首个把第三方榜单成绩作为主要外部证据的本主题模型 [kimi-k3]。
整体判断:Research-frontier,部分 Production-ready;本次新增一个方向相反的信号。
Production-ready 组件:
Research-frontier 组件:
趋势方向:能力轴加速,可审计性与可部署性轴倒退。
能力侧,开源前沿在 2026 年已能在多个核心基准上与最强闭源正面对话:K3 在第三方综合指数上排 580 个模型中第 4、在 WebDev Arena 上成为首个登顶的开源模型,并在成本轴上以约一半价格拿到最高分 [kimi-k3];V4 在 1M 长上下文学术基准上超越闭源前沿 [deepseek-v4];K2.6 在开源 agentic coding 上占据"部署门槛低 + 工具调用强"的独特生态位 [kimi-k2-6]。
但两条反向信号必须同时记录。其一,可部署性首次倒退:本主题延续两年的"开源 = 可普惠部署"承诺被自家旗舰打破,权重体积从 258 GB 抬升到约 1.56 TB [kimi-k3]。其二,可审计性下降:最响亮的效率主张恰好是证据最薄的一环,而同期竞品在同一位置给出了完整超参 [kimi-k3]。本主题的正确读法因此是"能力在加速、方法学在退化",而不是单一的加速叙事。
1. attention-optimization:MLA、KDA、CSA+HCA、Attention Residuals 都属于广义注意力优化 [2405.04434]。本主题聚焦这些技术在开源前沿 MoE 中的集成应用,而 attention-optimization 更关注单一技术的理论与 kernel 实现。边界本次显著模糊:K3 把"改模型数学以解锁 kernel 路径"变成公开的设计原则 [kimi-k3],注意力优化与模型集成已不再能干净切分。
2. linear-attention:Kimi Linear 时期这还是一个可以独立讨论的旁支 [2510.26692],K3 之后线性注意力已进入万亿级主干且权重开放 [kimi-k3]。建议:若后续再有非 Moonshot 团队在 100B+ 规模采用 channel-wise gated 线性注意力,应升格为独立 topic;在此之前它作为本主题的一条主干支线处理更合适。
3. agent-serving:ThunderAgent、Halo、KVFlow 在本主题中作为支撑基础设施讨论 [framework]。当前两者高度耦合——K2.6 与 K3 的长程 RL 直接驱动了这类系统的设计需求 [kimi-k3]。若 agentic serving 研究扩展到非 MoE 模型,应独立成 topic。
4. PD-disagg:PrfaaS 与 DualPath 因直接服务于本主题的模型而被纳入 [2604.15039] [2602.21548]。PD 分离作为通用推理架构趋势,应有独立 topic 覆盖非 MoE 场景。
5. multimodal-omni:本次边界发生实质变化。 K2.5 时期多模态只是 K2 系列演进的一环 [2602.02276],而 K3 已是原生多模态 MoE——视觉塔从零用 next-token prediction 训练、放弃对比学习初始化、无独立对齐阶段 [kimi-k3],视觉 token 直接进入同一条 NoPE 流。与此同时 V4 明确仅支持文本 [deepseek-v4]。建议:本主题与 multimodal-omni 就"原生多模态稀疏 MoE"这一交集设立共享章节,而非各自复述;需要一并记录的是 K3 的视觉配方翻转发生在零受控对照的情况下——两代都没做 SigLIP 初始化 vs 从零训练的消融 [kimi-k3]。
6. quantization:低精度只覆盖路由专家已成三方共识(见 §6 共识 3),机理依据来自 massive values 研究 [2502.01563]。这条边界稳定且可检验,适合从本主题剥离到 quantization topic 独立追踪,本主题只保留"部署门槛"这一后果面 [model]。
| Entity | Categories | Role in topic | Key contribution |
|---|---|---|---|
| [kimi-k3] | model | 本次新增 · 谱系首次架构级 redesign | 2.8T/104B、16-of-896、3:1 KDA–MLA、原生视觉、1M 上下文、权重开放;与 V4 九处独立收敛、四处分叉且无共同评测地面 |
| [kimi-k3] | model | 新增 · 三维信息流架构 | 序列维 KDA、深度维 Block AttnRes、宽度维 Stable LatentMoE,每维各配一处数值补丁 |
| [2405.04434] | model | 谱系根 · MLA + MoE 起源 | 236B/21B,KVCache 压缩 93.3%,共享 + 细粒度路由专家,训练成本 −42.5% |
| [2412.19437] | framework | 工程范式起点 | DualPipe + FP8 + MLA,$5.576M 训练 671B MoE |
| [deepseek-v4] | model | 架构优先路线 | CSA+HCA + mHC + Muon,1M 下 FLOPs 27% / KV 10%,训练超参完整披露 |
| [2507.20534] | model | Kimi 线起点 | MuonClip 零 spike,本谱系唯一 controlled 的稀疏度 scaling law |
| [2602.02276] | model | 多模态扩展 | MoonViT-3D + 零视觉 SFT + PARL Agent Swarm |
| [kimi-k2-6] | model | 训练/编排优先路线 | 架构冻结 + 长程 agentic RL + INT4 单节点,把普惠部署写进 load-bearing 论证 |
| [2510.26692] | model | 第三条注意力路线 · K3 主干来源 | KDA 3:1 混合,短/长/RL 三场景超越全注意力,1.16× 效率含完整拟合形式 |
| [2603.15031] | model | 残差创新 · K3 主干来源 | 深度 softmax 聚合替代恒定权重残差,与序列维优化正交 |
| [2502.01563] | model | 机理分析 | RoPE 低频 massive values 承载上下文知识,为"低精度只覆盖路由专家"提供依据 |
| [2602.21548] | framework | PD 存储瓶颈突破 | 聚合全部 SNIC 带宽 + CNIC-centric 隔离,1152 GPU 近线性扩展 |
| [2604.15039] | framework | 跨 DC PD 分离 | 混合注意力使 KV 吞吐降 4–13×,跨 DC Ethernet 成为可行部署形态 |
| [2605.02960] | framework | MoE 专家并行优化 | AsyncEP 消除 AllToAll,与 DualPipe 路线正面冲突 |
| [2602.13692] | framework | Agentic 推理调度 | Program 作为一等调度单元 + lifecycle-aware 工具管理 |
| [2509.02121] | framework | 批量 agentic 优化 | 数据库 query optimizer 思想用于 workflow DAG 整合 |
| [2507.07400] | framework | Workflow 缓存优化 | Steps-to-execution 替代 LRU 驱逐 |
| [2604.09107] | framework | RL 权重传输 | Reference-Oriented Storage,千卡 stall 大幅下降,支持跨 DC |
| [tile-ai-tilert] | framework | 超低延迟引擎 | Persistent Engine Kernel 提前编译整模 |
| [tokenspeed] | framework | MLA 专用引擎 | C++ 状态机 + 静态 Placement 编译器 |
| [2604.15379] | framework | Chiplet MoE kernel | Chiplet-task 抽象把私有缓存变成显式资源,并自陈 MoE 盲区 |
| [2409.19256] | framework | RL 训练框架 | Hybrid single/multi-controller,开源 RL 训练事实标准 |
| [2604.26881] | framework | Serverless MoE serving | 专家到函数的结构映射,界定"仅活跃专家存在"这一极端 |
| [model] | model | 类目综述 | 模型侧取舍轴:KV 压缩、稀疏度、长上下文路径、量化门槛、post-training 范式 |
| [framework] | framework | 类目综述 | 框架侧取舍轴:延迟-吞吐、通信隐藏、灵活性、开源生态 |