model Survey

11 papers

Model 类综述 #

基于 11 篇 L2 论文综合:DeepSeek-V4、Kimi K2/K2.5/K2.6、Kimi Linear、Attention Residuals、Qwen2.5-Omni、Qwen3-Omni、LongCat-Video、Seedance 2.0、Massive Values in Self-Attention。

§1 现状快照 #

2025–2026 年大模型设计正经历三重范式转型。MoE 架构主导化——DeepSeek-V4 以 1.6T/49B 的 hybrid compressed attention + mHC 残差刷新了 1M 上下文效率的上限(FLOPs 仅 V3.2 的 27%,KV cache 仅 10%)[deepseek-v4],Kimi K2 系列三代复用 1T MoE backbone 把创新杠杆从架构转向训练和部署 [kimi-k2-6]注意力机制多元化——线性注意力(KDA)首次在公平对比下全面超越全注意力 [2510.26692],compressed sparse attention 实现序列维度的真实存储缩减 [deepseek-v4]全模态端到端——Thinker-Talker MoE 把文本/音频/视频统一在一条推理链路中 [2509.17765],DiT-centric 路线在音视频联合生成上全面领先(Arena Elo 1450)[2604.14148]


§2 Taxonomy #

三个正交维度定义本类论文的分布:

维度 A: 注意力/架构范式 #

范式定义代表论文
标准 softmax (MLA/GQA)Multi-head Latent Attention 或 Grouped Query Attention,per-token KV cacheK2, K2.5, K2.6
压缩 softmax (CSA+HCA)序列维度压缩后再做 sparse/dense attention,KV 条目数级缩减DeepSeek-V4
混合线性+softmax (KDA+MLA)Linear attention 层 + 全注意力层交错,fixed-size recurrent stateKimi Linear
Diffusion Transformer (DiT)基于去噪的生成模型,3D self-attention + cross-attentionLongCat-Video, Seedance 2.0
组件/分析非完整模型,改进残差连接或分析注意力机理Attention Residuals, Massive Values

维度 B: 模态覆盖 #

覆盖范围定义代表论文
纯文本仅文本输入输出K2, K2.6, DeepSeek-V4, Kimi Linear, Attention Residuals, Massive Values
文本+视觉文本+图像/视频理解K2.5
全模态 (omni)text/image/audio/video 感知 + 语音生成Qwen2.5-Omni, Qwen3-Omni
生成专用 (video/AV)视频或音视频联合生成,无感知/理解LongCat-Video, Seedance 2.0

维度 C: 主要创新层 #

创新层定义代表论文
架构设计新注意力、残差、路由机制DeepSeek-V4, Kimi Linear, Attention Residuals, Qwen3-Omni
训练方法优化器、稳定性、数据策略K2 (MuonClip), Qwen3-Omni (非退化 co-training), Massive Values
后训练与部署RL、量化、agent 编排K2.6 (长程 RL + INT4), LongCat-Video (GRPO), Seedance 2.0 (RLHF)
跨代集成主干不改,创新在对接层与训练管线K2.5 (MoonViT + 零视觉 SFT), K2.6 (swarm + Claw Groups)

Taxonomy 矩阵 (A × B) #

纯文本文本+视觉全模态生成专用
标准 softmaxK2, K2.6K2.5
压缩 softmaxDeepSeek-V4
混合线性+softmaxKimi Linear
DiTLongCat-Video, Seedance 2.0
标准 Transformer (dense/MoE)Qwen2.5-Omni, Qwen3-Omni
组件/分析Attention Residuals, Massive Values

§3 主线与分支 #

3.1 主线 A: MoE 架构主流化与效率极限 #

DeepSeek-V4 代表当前 MoE 效率的技术上限。V4-Pro(1.6T/49B)通过 hybrid CSA+HCA attention 将 1M 上下文下 FLOPs 降至 V3.2 的 27%、KV cache 降至 10% [deepseek-v4]。CSA 做"先 4× 压缩再 sparse top-k 选择",HCA 做"128× 压缩 + dense attention",两者交错排列分别捕获精细局部和粗粒度全局依赖 [deepseek-v4]。配套的 mHC 把残差流宽度扩展 4× 并通过 Birkhoff polytope 约束保证非扩张性 [deepseek-v4],Muon optimizer 加速收敛 [deepseek-v4]。Anticipatory Routing + SwiGLU Clamping 解决万亿参数 MoE 的 loss spike [deepseek-v4]。Post-training 用 Specialist + OPD(On-Policy Distillation with full-vocabulary logit distillation)替代传统 mixed RL [deepseek-v4]。V4-Pro-Max 在 Codeforces 3206 超过 GPT-5.4,Putnam-2025 满分 120/120,首次在 1M 学术 benchmark 上超越 Gemini-3.1-Pro [deepseek-v4]

Kimi K2 系列 走"架构到此为止、创新全在训练与编排"路线。K2(1T/32B,384 experts top-8,sparsity 48)用 MuonClip 实现零 loss spike 的 15.5T token 预训练 [2507.20534];K2.5 在不改主干前提下接 MoonViT-3D + 零视觉 SFT 激活多模态 [2602.02276];K2.6 通过长程 agentic RL(4000+ 工具调用,12–13 小时 rollout)+ INT4 默认量化把 1T MoE 拉到单 8×H200 节点 [kimi-k2-6]。config.json 三代逐字未变 [kimi-k2-6]

3.2 主线 B: 注意力机制多元化 #

Kimi Linear 的 KDA 用 per-channel diagonal gate 替代 scalar gate,通过 DPLR 约束(a=b=k)使 chunkwise kernel 比通用 DPLR 快 ~2× [2510.26692]。3:1 KDA:MLA(NoPE) 的混合比例在 48B/3B 规模下首次在公平对比下全面超越全注意力 [2510.26692]。长上下文 decode 吞吐 +75%,KV cache 减 ~75% [2510.26692]

Attention Residuals 把"恒定权重 1 的残差累加"替换为"沿深度做 softmax-attention 加权求和"——每层学习一个伪 query 对所有先前层输出做选择性聚合 [2603.15031]。Block-AttnRes 训练 overhead < 4%,在 Kimi Linear 上验证 GPQA +7.5,scaling law 显示节省 ~1.25× compute [2603.15031]

Massive Values 分析 揭示 RoPE 低频维度的 Q/K concentrated massive values 是上下文知识理解的功能信号——破坏后 GSM8K 从 76.9% 暴跌至 4.0% [2502.01563]。所有 RoPE 模型均存在此现象,非 RoPE 模型均不存在 [2502.01563]

3.3 主线 C: 全模态端到端 #

Qwen2.5-Omni → Qwen3-Omni 是 Thinker-Talker 框架的两代演进。2.5-Omni 是首个开源 omni-modal 端到端模型(dense 7B + 单 codebook + DiT vocoder)[2503.20215]。Qwen3-Omni 做五轴系统性重构:Thinker/Talker 均 MoE、AuT 从头训(20M 小时)、多 codebook RVQ、ConvNet 降首包延迟至 234ms、Talker 解耦允许 RAG/safety 介入 [2509.17765]

3.4 分支: 视频与音视频生成 #

LongCat-Video(13.6B DiT)统一 T2V/I2V/VC 为 video continuation + Block Causal Attention + KV caching [2510.22200]。为 Flow Matching 定制的多 reward GRPO + coarse-to-fine + 3D Block Sparse Attention 实现 12.3× 推理加速 [2510.22200]。VBench 2.0 Commonsense 70.94% 全场最佳 [2510.22200]

Seedance 2.0 以 dual-branch MMDiT 做原生音视频联合生成,T2V 全维度领先,Arena Elo 1450 以 720p 击败 1080p [2604.14148]。20/22 多模态任务支持,7 个独家 [2604.14148]。架构/训练完全不披露 [2604.14148]


§4 跨论文对比表 #

论文总参/活跃参注意力最大 context核心指标 (best reported)训练 tokens代码开源可复现性
DeepSeek-V4-Pro1.6T / 49BCSA+HCA (hybrid compressed)1MCodeforces 3206, Putnam 120/120, SWE-V 80.6, 1M MRCR SOTA33T推理代码开源部分(训练代码未开源)
DeepSeek-V4-Flash284B / 13BCSA+HCA1MMMLU 88.7, FLOPs 仅 V3.2 的 10%32T推理代码开源部分
Kimi K21.04T / 32BMLA, 64 heads128K→YaRNLiveCodeBench 53.7, SWE-V 65.8, Tau2-Bench 66.115.5T开源部分(训练细节有限)
Kimi K2.51.04T / 32BMLA + MoonViT-3D262K (YaRN 64×)MMMU 70.8, GPQA 76.8, SWE-V 76.815T text + 1T ViT + 15T joint开源部分(GPU-hours 未披露)
Kimi K2.61.04T / 32BMLA (同 K2.5)262KSWE-Pro 58.6, Toolathlon 50.0, MCPMark 55.9未报告(post-training 为主)开源 (INT4)部分(RL 细节缺失)
Kimi Linear48B / 3BKDA 20L + MLA(NoPE) 7L1Mdecode 吞吐 +75%, KV cache −75%, GPQA +7.5 (vs no-AttnRes)5.7T (release)开源部分(KDA kernel 开源)
Attention Residuals48B / 3B (Kimi Linear 上验证)N/A(组件)N/Ascaling law 节省 ~1.25× compute, GPQA +7.51.4T (fair-cmp)开源(伪代码)可复现
Massive Values7–9B(分析对象)N/A(分析)N/AGSM8K 76.9→4.0% (disruption), RoPE↔massive values 完美对应N/A开源可复现
Qwen2.5-Omni~9–10B (dense)GQA 28Q/4KV32K首个开源 omni-modal, parity w/ Qwen2.5-VL-7B1.2T+ multimodal开源 (Apache 2.0)部分(训练 infra 未披露)
Qwen3-Omni~34.5B / ~4.8BMoE (未公开 GQA/MLA 细节)32K32/36 audio SOTA, MMMU-Pro 57.0, 234ms 首包2.26T multimodal开源 (Apache 2.0)不可(20M hr 数据不可获取)
LongCat-Video13.6B (dense DiT)3D MHA 32 headsN/A (video frames)VBench 2.0 62.11% (OS #1), Commonsense 70.94% (全场 #1), 12.3× 加速~678k iters开源可复现
Seedance 2.0未报告未报告 (MMDiT inferred)N/AArena Elo 1450 T2V, Motion Quality 3.75, 20/22 R2V tasks未报告未公开不可

§5 Strength-weakness matrix #

论文StrengthWeaknessBest-for scenario
DeepSeek-V41M 上下文效率革命(FLOPs 27%, KV 10%);端到端 bitwise 确定性训练;推理+竞赛全面 SOTA架构极度复杂(CSA+HCA+mHC+Muon+TileLang 全套必须同时 work);仅文本模态;Agent 能力略逊闭源需要 1M+ 上下文的知识密集/长推理任务
Kimi K2MuonClip 零 loss spike;sparsity 48 scaling law 验证;agentic 数据合成完善SimpleQA 31.0 事实性知识弱;不必要 tool use 时性能下降开源 agentic 非 thinking 场景
Kimi K2.51T MoE + 多模态成功验证;零视觉 SFT 创新;DEP 让多模态训练 ~90% 纯文本吞吐训练 GPU-hours/infra 完全未披露;mid-train 描述含混需要视觉理解的 agentic 任务
Kimi K2.6长程 coding 12h rollout 能力独一无二;INT4 把 1T 模型拉到单节点;Claw Groups 异构编排纯 reasoning 仍逊闭源 3–8 分;RL 细节不透明;INT4 vs BF16 长程消融缺失小时级自主编程 / 代码仓库重构
Kimi Linear首个 production-scale 线性注意力超全注意力;KV 减 75%;NoPE 支持 1M仅 48B 验证未到 100B+;1M 实测 needle test 不完整;与 K2 主干比 total 参数差异使公平比较有争议长上下文高吞吐推理(decode-bound)
Attention Residuals仅 <4% overhead 节省 1.25× compute;已 production 验证仅 MoE 一例验证;block size 无理论指导;I/O 增 1.8× 对推理有压力深层 Transformer 的 drop-in 升级
Massive Values首次建立 RoPE→massive values→上下文理解完整因果链;直接指导量化策略仅 7–9B 验证;disruption 方法粗暴;未给如何主动利用的方案量化策略选型 / attention 机理研究
Qwen2.5-Omni首个开源 omni-modal;Thinker-Talker 框架开创性;Apache 2.0Talker 紧耦合阻止 RAG 介入;单 codebook 限制语音表达力;首包 640ms+Qwen3-Omni 的学习/对比基线
Qwen3-Omni五轴系统性升级;32/36 audio SOTA;234ms 首包;非退化训练MoE 细节全部未披露;MVBench 退化未讨论;6-concurrency 首包 1172ms开源全模态感知+生成统一模型
LongCat-VideoGRPO for Flow Matching 有理论贡献;12.3× 加速;Commonsense 全场 #1;完整开源I2V 落后 Seedance;Human Fidelity 80.20% 最低;RLHF 仅 T2V 无 I2V reward开源视频生成(尤其长视频/物理常识)
Seedance 2.0AV 联合生成质量全面碾压;20/22 任务覆盖;7 独家任务架构/训练/数据/算力完全不披露;闭源;video extension 仍逊 Veo 3.1商业级高质量音视频生成

§6 核心 trade-off 轴 #

轴 1: KV cache 压缩 vs 实现复杂度 #

三种方案构成连续谱:KDA fixed state (128×128/head,O(1),与序列无关) [2510.26692]CSA/HCA 压缩条目 (每 4/128 token 压为 1 条,O(n/m),真实存储缩减) [deepseek-v4]MLA latent (576 floats/token,O(n),但常数小) [2507.20534]标准 GQA (O(n),常数大)。V4 在 1M 下 KV cache 仅 V3(MLA) 的 10%,但需要 CSA compressor + Lightning Indexer(FP4) + HCA compressor + SWA + Attention Sink + Partial RoPE 的完整复杂体系 [deepseek-v4]。Kimi Linear 通过 recurrence 获得 O(1) 但需要 chunkwise kernel 的数值正确性保障 [2510.26692]

轴 2: MoE 稀疏度 vs 通信开销 #

K2 sparsity 48 (384/8) 比 sparsity 8 节省 1.69× FLOPs [2507.20534]。V4-Pro 用 384 routed + 1 shared、top-6(比 V3 的 top-8 减少),同时用 fine-grained EP overlap 实现 1.50–1.96× 加速 [deepseek-v4]。Qwen3-Omni ~10:1 sparsity ratio 暗示更温和的设计 [2509.17765]。V4 提出的"C/B ≤ 6144 FLOPs/Byte"准则将通信带宽与可隐藏计算量化挂钩 [deepseek-v4]

轴 3: 长上下文支持路径 #

路径代表最大 ctx机制
原生压缩 attentionV41M4K→16K→64K→1M 渐进训练 + CSA/HCA 压缩
NoPE + 线性注意力Kimi Linear1MKDA gates 提供隐式 recency,无 RoPE 外推问题
YaRN 外推K2.5/K2.6262KYaRN factor=64,4K 原生
TM-RoPEQwen3-Omni32K绝对时间对齐的多模态 RoPE

V4 和 Kimi Linear 都支持 1M 但路径截然不同:V4 保留 softmax attention 的建模能力通过压缩+稀疏削减计算量,Kimi Linear 用 recurrent state 从根本上消除序列长度依赖 [deepseek-v4] [2510.26692]

轴 4: 量化精度 vs 部署门槛 #

K2.6 INT4 routed-only(~258 GB 总权重)把 1T MoE 从 16+ GPU 拉到单 8×H200 [kimi-k2-6]。V4 在训练阶段引入 FP4 QAT(MoE expert 权重 + CSA indexer),推理直接使用真实 FP4 权重确保 train-deploy 一致 [deepseek-v4]。Massive Values 研究表明保护 Q/K 低频维度的量化方法在上下文任务上显著优于不保护的方法 [2502.01563]

轴 5: LLM-centric vs DiT-centric 多模态 #

Qwen3-Omni 以 LLM 为中心(Thinker MoE 统一理解+生成),在跨模态推理上占优(WorldSense 54.0 SOTA)[2509.17765]。Seedance 2.0 以 MMDiT 为中心,在生成质量和 AV 同步上全面领先(Motion Quality 3.75 vs 行业次优 3.10)[2604.14148]。LongCat-Video 的 Commonsense 70.94% 表明开源 DiT 在物理理解上可与闭源竞争 [2510.22200]

轴 6: Post-training 范式——Specialist+OPD vs 长程 RL #

V4 用 domain specialist + multi-teacher OPD(full-vocabulary logit distillation)合并 10+ specialist 为统一模型 [deepseek-v4]。K2.6 把 RL rollout horizon 推到 4–13 小时 / 4000+ 工具调用 [kimi-k2-6]。LongCat-Video 用多 reward GRPO(HPSv3 + MQ + TA)训仅 500 iterations [2510.22200]。三种 post-training 范式瞄准不同目标:OPD 整合多能力,长程 RL 刻入长程规划,GRPO 对齐人类偏好。


§7 冲突与调和 #

冲突 1: 位置编码——RoPE vs NoPE vs Partial RoPE #

K2 系列沿用 RoPE + YaRN 扩展到 262K [2602.02276]。Kimi Linear 完全放弃 RoPE,MLA 层用 NoPE,位置信息靠 KDA gates 提供,context 1M 且无外推问题 [2510.26692]。DeepSeek-V4 用 Partial RoPE(仅最后 64 维),并在输出上施加反向补偿 [deepseek-v4]。三种方案来自三个独立团队。

矛盾根源: 目标不同。K2 优先生态兼容性(RoPE 是推理框架标配),Kimi Linear 追求极限长度外推(NoPE 无理论长度上限),V4 在压缩 KV 场景下需要位置感知但又不能让 RoPE 的全维度旋转干扰压缩后的 KV entries。Massive Values 研究 [2502.01563] 揭示 RoPE 低频维度承载语义功能,Kimi Linear 的 NoPE 方案需要 KDA 的 data-dependent gate 隐式补偿这一功能——但缺乏对应的机理分析。

冲突 2: 架构创新 vs 训练/编排创新 #

V4 通过根本性架构创新(CSA+HCA + mHC + Muon)实现效率突破 [deepseek-v4]。K2.6 证明"架构不动、RL/编排做极限"仍可获得巨大能力提升(Toolathlon +80%)[kimi-k2-6]

矛盾根源: 优化目标不同。V4 瞄准 1M 上下文推理效率(计算 bound),K2.6 瞄准长程 agentic 稳定性(能力 bound)。两者并非互斥——V4 的架构 + K2.6 的长程 RL 可能叠加。K2.6 config 三代未变暗示 Moonshot 内部也认识到架构创新和训练创新可以解耦 [kimi-k2-6]

冲突 3: "非退化"多模态训练 #

Qwen3-Omni 声称多模态训练不损害单模态性能 [2509.17765],但受控消融显示 MVBench 从 71.87 降至 69.50(−2.4),作者未讨论 [2509.17765]。K2.5 反直觉地发现 10:90 低视觉比例优于 50:50,且零视觉 SFT 优于 text+vision SFT [2602.02276]

矛盾根源: 评测粒度不同。Qwen3-Omni 在多数 benchmark 上确实不退化,但 MVBench 这一视频理解子任务退化了——"non-degradation"是统计意义上的(多数不退化),而非逐任务保证。K2.5 的"零视觉 SFT 更好"则暗示联合预训已经足够强,额外视觉 SFT 反而干扰已对齐的表征——两者均为经验发现,在各自实验范围内都正确,但不能互相推翻。

冲突 4: 视频生成——开源 GRPO vs 闭源产品化 #

LongCat-Video 的多 reward GRPO 有理论贡献(GRPO as stochastic noise search)且完整开源 [2510.22200]。Seedance 2.0 在所有评测维度全面领先但零架构披露 [2604.14148]

矛盾根源: LongCat 在开源约束下(数据/算力有限)做到 Commonsense 维度全场最佳,但 Human Fidelity 最低(80.20%)[2510.22200];Seedance 依靠字节内部短视频数据生态 + RewardDance/DanceGRPO 实现全面领先。差距根源不在方法论而在数据资产和计算预算——LongCat 的方法论贡献(GRPO 理论洞察 + 3D BSA 开源)对学术界价值更高。

冲突 5: 训练稳定性——MuonClip vs Anticipatory Routing #

K2 的 MuonClip(QK-clip) 解决 Muon 导致的 attention logit 爆炸,self-deactivating 且 12.7% heads 触发 [2507.20534]。V4 的 Anticipatory Routing 解耦 backbone 和 routing 参数更新,仅在 loss spike 发生时启用 [deepseek-v4]

矛盾根源: 两者针对不同 failure mode。MuonClip 针对 Muon optimizer 的 spectral 特性导致的 QK 累加增长(optimizer-level),Anticipatory Routing 针对 MoE routing 放大 outlier 的效应(architecture-level)。V4 同时使用 Muon + Anticipatory Routing + SwiGLU Clamping 三管齐下,说明在万亿参数 MoE 中单一稳定性技术不够。


§8 Gaps #

以下 gaps 均为"技术上可做但尚无人做"的空白,非根本性困难。

  1. 压缩 attention × 多模态: V4 的 CSA+HCA 仅验证文本模态 [deepseek-v4],将其引入 Qwen3-Omni 的 Thinker 层可大幅降低长音频/视频的 KV cache 压力。核心挑战在于 TM-RoPE 的时间对齐与 CSA 的压缩粒度如何兼容。
    1. KDA 在 100B+ 规模验证: Kimi Linear 仅 48B [2510.26692]。KDA 的 per-channel diagonal gate 在更大模型中的 expressiveness 和数值稳定性未经检验。
      1. Attention Residuals × dense 大模型: 仅 MoE Kimi Linear 一例 production 验证 [2603.15031],70B+ dense 模型的收益未知。
        1. INT4/FP4 对长程 agentic rollout 的累积影响: K2.6 未给 BF16 vs INT4 在 4000 步 rollout 上的消融 [kimi-k2-6]。V4 的 FP4 QAT 保证了 train-deploy 一致性 [deepseek-v4],但 K2.6 的 post-training INT4 无此保障。
          1. 多 reward GRPO 用于语音生成后训练: LongCat-Video 验证了多 reward GRPO 比单 reward 更稳定 [2510.22200]。将类似设计(WER + 韵律 + 情感 + 多语言一致性)用于 Qwen3-Omni Talker 后训练可能优于当前的 DPO 链路。
            1. Specialist + OPD × 多模态: V4 的 OPD 在纯文本上验证 [deepseek-v4]。将 domain specialist 扩展到视觉、音频、代码等模态,再用 full-vocabulary logit distillation 合并,是多模态 post-training 的自然延伸。
              1. DiT 模型 weight quantization: LongCat-Video 13.6B 未探索 INT8/INT4 量化 [2510.22200]。对于部署到消费 GPU 的需求,这是低挂水果。
                1. Massive values 的主动利用: 目前仅用于量化指导。如何在训练中主动塑造 massive value 分布以提升特定能力未探索 [2502.01563]
                  1. mHC + KDA 组合: V4 的 mHC 解决压缩 attention 下的残差流稳定性 [deepseek-v4],Kimi Linear 的 KDA 有类似的数值漂移问题。将 mHC 的 Birkhoff polytope 约束引入 KDA 层间的残差连接是未探索的稳定性增强方向。

                  2. §9 Practical recommendation #

                    场景 1: 需要 1M+ 上下文的知识密集型推理 #

                    选 DeepSeek-V4-Pro。CSA+HCA 在 1M 下 FLOPs 仅 V3.2 的 27%、KV cache 10%,是唯一在 1M 学术 benchmark 上超越 Gemini-3.1-Pro 的开源模型 [deepseek-v4]。若推理吞吐是瓶颈且 context ≤262K,Kimi Linear 的 KDA 层 decode 吞吐 +75% 是更轻量替代 [2510.26692]

                    场景 2: 长程自主编程 / 代码仓库重构 #

                    选 Kimi K2.6。唯一验证了 12–13 小时 / 4000+ 工具调用连续 coding 的开源模型(SWE-Bench Pro 58.6 全场最高)[kimi-k2-6]。INT4 默认量化使单 8×H200 节点可服务。若数学/科学推理是首要需求,V4-Pro-Max 更强(Putnam 满分,AIME 2025 61.3)[deepseek-v4]

                    场景 3: 开源全模态感知+语音生成 #

                    选 Qwen3-Omni。唯一涵盖 text/image/audio/video 感知 + 实时语音生成的开源模型(Apache 2.0)。32/36 audio benchmark SOTA,234ms 首包延迟 [2509.17765]。注意 Thinking 变体会退化 ASR(WER 1.22→2.22)[2509.17765]——感知密集任务用 Instruct 变体。

                    场景 4: 开源视频生成 #

                    选 LongCat-Video。VBench 2.0 开源第一,Commonsense 全场最佳,完整开源含 3D BSA Triton 实现 [2510.22200]。12.3× 推理加速使单 H800 可生成 720p 视频。若音视频同步质量是核心需求且可接受闭源 API,Seedance 2.0 在全维度领先 [2604.14148]

                    场景 5: 多模态理解 (无语音生成需求) #

                    选 Kimi K2.5。1T MoE + MoonViT-3D,MMMU 70.8 接近 Gemini-2.5-Pro 71.4,且具备完整 agentic 能力(GAIA 70.0)[2602.02276]。若需最强文本+视觉推理但不需语音,K2.5 在 agent 场景优于 Qwen3-Omni(后者的 MoE 细节不透明使独立优化困难)。

                    场景 6: 量化策略选型 #

                    参考 Massive Values 研究:对于上下文理解密集场景(RAG、agent),优先 AWQ/SmoothQuant 而非 GPTQ [2502.01563]。K2.6 的 routed-only INT4 + attention FP16 保留策略是 MoE 量化的 reference point [kimi-k2-6]。V4 的 FP4 QAT 可保证 train-deploy 一致但需要训练阶段引入 [deepseek-v4]


                    §10 参考 #

                    ID标题子主题
                    [deepseek-v4]DeepSeek-V4: Towards Highly Efficient Million-Token Context IntelligenceCSA+HCA, mHC, Muon, 1M 原生, OPD, bitwise 确定性
                    [2507.20534]Kimi K2: Open Agentic IntelligenceMoE 1T, MuonClip, MLA, sparsity 48 scaling law, agentic 数据合成
                    [2602.02276]Kimi K2.5: Visual Agentic Intelligence1T MoE + MoonViT, 零视觉 SFT, PARL, DEP
                    [kimi-k2-6]Kimi K2.6: Advancing Open-Source CodingINT4 量化, 长程 agentic RL, Agent Swarm 3×, Claw Groups
                    [2510.26692]Kimi Linear: An Expressive, Efficient Attention ArchitectureKDA 线性注意力, NoPE, 3:1 hybrid, chunkwise DPLR kernel
                    [2603.15031]Attention Residuals深度 softmax 聚合, Block-AttnRes, scaling law 1.25× compute 节省
                    [2502.01563]Massive Values in Self-Attention ModulesRoPE massive values, 上下文知识因果链, 量化策略指导
                    [2503.20215]Qwen2.5-Omni Technical ReportDense Thinker-Talker, TM-RoPE, 首个开源 omni-modal
                    [2509.17765]Qwen3-Omni Technical ReportMoE Thinker-Talker, AuT, RVQ, 234ms 首包, 非退化训练
                    [2510.22200]LongCat-Video Technical ReportDiT, GRPO for Flow Matching, 3D BSA, C2F 12.3× 加速
                    [2604.14148]Seedance 2.0: Advancing Video Generation for World ComplexityDual-branch MMDiT, AV 联合生成, Arena Elo 1450, 20/22 R2V tasks

Papers in model (24)

kimi-k3 · Synthesis
2005.14165 · Synthesis
2210.03629 · Synthesis
2302.04761 · Synthesis
2309.17453 · Synthesis
2311.18677 · Synthesis
2403.0231
2403.06833 · Synthesis
2404.13208 · Synthesis
2410.09102 · Synthesis
2603.03305 · Synthesis
2604.06066 · Synthesis
2607.00678 · Synthesis
2405.04434 · Synthesis
2510.05381 · Synthesis
2512.13507 · Synthesis
2510.26692 · Synthesis
2404.16811 · Synthesis
2412.10079 · Synthesis
2506.08371 · Synthesis
2601.15300 · Synthesis
deepseek-v4 · Synthesis
kimi-k2-6 · Synthesis
2509.17765 · Synthesis