基于 11 篇 L2 论文综合:DeepSeek-V4、Kimi K2/K2.5/K2.6、Kimi Linear、Attention Residuals、Qwen2.5-Omni、Qwen3-Omni、LongCat-Video、Seedance 2.0、Massive Values in Self-Attention。
2025–2026 年大模型设计正经历三重范式转型。MoE 架构主导化——DeepSeek-V4 以 1.6T/49B 的 hybrid compressed attention + mHC 残差刷新了 1M 上下文效率的上限(FLOPs 仅 V3.2 的 27%,KV cache 仅 10%)[deepseek-v4],Kimi K2 系列三代复用 1T MoE backbone 把创新杠杆从架构转向训练和部署 [kimi-k2-6]。注意力机制多元化——线性注意力(KDA)首次在公平对比下全面超越全注意力 [2510.26692],compressed sparse attention 实现序列维度的真实存储缩减 [deepseek-v4]。全模态端到端——Thinker-Talker MoE 把文本/音频/视频统一在一条推理链路中 [2509.17765],DiT-centric 路线在音视频联合生成上全面领先(Arena Elo 1450)[2604.14148]。
三个正交维度定义本类论文的分布:
| 范式 | 定义 | 代表论文 |
|---|---|---|
| 标准 softmax (MLA/GQA) | Multi-head Latent Attention 或 Grouped Query Attention,per-token KV cache | K2, K2.5, K2.6 |
| 压缩 softmax (CSA+HCA) | 序列维度压缩后再做 sparse/dense attention,KV 条目数级缩减 | DeepSeek-V4 |
| 混合线性+softmax (KDA+MLA) | Linear attention 层 + 全注意力层交错,fixed-size recurrent state | Kimi Linear |
| Diffusion Transformer (DiT) | 基于去噪的生成模型,3D self-attention + cross-attention | LongCat-Video, Seedance 2.0 |
| 组件/分析 | 非完整模型,改进残差连接或分析注意力机理 | Attention Residuals, Massive Values |
| 覆盖范围 | 定义 | 代表论文 |
|---|---|---|
| 纯文本 | 仅文本输入输出 | K2, K2.6, DeepSeek-V4, Kimi Linear, Attention Residuals, Massive Values |
| 文本+视觉 | 文本+图像/视频理解 | K2.5 |
| 全模态 (omni) | text/image/audio/video 感知 + 语音生成 | Qwen2.5-Omni, Qwen3-Omni |
| 生成专用 (video/AV) | 视频或音视频联合生成,无感知/理解 | LongCat-Video, Seedance 2.0 |
| 创新层 | 定义 | 代表论文 |
|---|---|---|
| 架构设计 | 新注意力、残差、路由机制 | DeepSeek-V4, Kimi Linear, Attention Residuals, Qwen3-Omni |
| 训练方法 | 优化器、稳定性、数据策略 | K2 (MuonClip), Qwen3-Omni (非退化 co-training), Massive Values |
| 后训练与部署 | RL、量化、agent 编排 | K2.6 (长程 RL + INT4), LongCat-Video (GRPO), Seedance 2.0 (RLHF) |
| 跨代集成 | 主干不改,创新在对接层与训练管线 | K2.5 (MoonViT + 零视觉 SFT), K2.6 (swarm + Claw Groups) |
| 纯文本 | 文本+视觉 | 全模态 | 生成专用 | |
|---|---|---|---|---|
| 标准 softmax | K2, K2.6 | K2.5 | — | — |
| 压缩 softmax | DeepSeek-V4 | — | — | — |
| 混合线性+softmax | Kimi Linear | — | — | — |
| DiT | — | — | — | LongCat-Video, Seedance 2.0 |
| 标准 Transformer (dense/MoE) | — | — | Qwen2.5-Omni, Qwen3-Omni | — |
| 组件/分析 | Attention Residuals, Massive Values | — | — | — |
DeepSeek-V4 代表当前 MoE 效率的技术上限。V4-Pro(1.6T/49B)通过 hybrid CSA+HCA attention 将 1M 上下文下 FLOPs 降至 V3.2 的 27%、KV cache 降至 10% [deepseek-v4]。CSA 做"先 4× 压缩再 sparse top-k 选择",HCA 做"128× 压缩 + dense attention",两者交错排列分别捕获精细局部和粗粒度全局依赖 [deepseek-v4]。配套的 mHC 把残差流宽度扩展 4× 并通过 Birkhoff polytope 约束保证非扩张性 [deepseek-v4],Muon optimizer 加速收敛 [deepseek-v4]。Anticipatory Routing + SwiGLU Clamping 解决万亿参数 MoE 的 loss spike [deepseek-v4]。Post-training 用 Specialist + OPD(On-Policy Distillation with full-vocabulary logit distillation)替代传统 mixed RL [deepseek-v4]。V4-Pro-Max 在 Codeforces 3206 超过 GPT-5.4,Putnam-2025 满分 120/120,首次在 1M 学术 benchmark 上超越 Gemini-3.1-Pro [deepseek-v4]。
Kimi K2 系列 走"架构到此为止、创新全在训练与编排"路线。K2(1T/32B,384 experts top-8,sparsity 48)用 MuonClip 实现零 loss spike 的 15.5T token 预训练 [2507.20534];K2.5 在不改主干前提下接 MoonViT-3D + 零视觉 SFT 激活多模态 [2602.02276];K2.6 通过长程 agentic RL(4000+ 工具调用,12–13 小时 rollout)+ INT4 默认量化把 1T MoE 拉到单 8×H200 节点 [kimi-k2-6]。config.json 三代逐字未变 [kimi-k2-6]。
Kimi Linear 的 KDA 用 per-channel diagonal gate 替代 scalar gate,通过 DPLR 约束(a=b=k)使 chunkwise kernel 比通用 DPLR 快 ~2× [2510.26692]。3:1 KDA:MLA(NoPE) 的混合比例在 48B/3B 规模下首次在公平对比下全面超越全注意力 [2510.26692]。长上下文 decode 吞吐 +75%,KV cache 减 ~75% [2510.26692]。
Attention Residuals 把"恒定权重 1 的残差累加"替换为"沿深度做 softmax-attention 加权求和"——每层学习一个伪 query 对所有先前层输出做选择性聚合 [2603.15031]。Block-AttnRes 训练 overhead < 4%,在 Kimi Linear 上验证 GPQA +7.5,scaling law 显示节省 ~1.25× compute [2603.15031]。
Massive Values 分析 揭示 RoPE 低频维度的 Q/K concentrated massive values 是上下文知识理解的功能信号——破坏后 GSM8K 从 76.9% 暴跌至 4.0% [2502.01563]。所有 RoPE 模型均存在此现象,非 RoPE 模型均不存在 [2502.01563]。
Qwen2.5-Omni → Qwen3-Omni 是 Thinker-Talker 框架的两代演进。2.5-Omni 是首个开源 omni-modal 端到端模型(dense 7B + 单 codebook + DiT vocoder)[2503.20215]。Qwen3-Omni 做五轴系统性重构:Thinker/Talker 均 MoE、AuT 从头训(20M 小时)、多 codebook RVQ、ConvNet 降首包延迟至 234ms、Talker 解耦允许 RAG/safety 介入 [2509.17765]。
LongCat-Video(13.6B DiT)统一 T2V/I2V/VC 为 video continuation + Block Causal Attention + KV caching [2510.22200]。为 Flow Matching 定制的多 reward GRPO + coarse-to-fine + 3D Block Sparse Attention 实现 12.3× 推理加速 [2510.22200]。VBench 2.0 Commonsense 70.94% 全场最佳 [2510.22200]。
Seedance 2.0 以 dual-branch MMDiT 做原生音视频联合生成,T2V 全维度领先,Arena Elo 1450 以 720p 击败 1080p [2604.14148]。20/22 多模态任务支持,7 个独家 [2604.14148]。架构/训练完全不披露 [2604.14148]。
| 论文 | 总参/活跃参 | 注意力 | 最大 context | 核心指标 (best reported) | 训练 tokens | 代码开源 | 可复现性 |
|---|---|---|---|---|---|---|---|
| DeepSeek-V4-Pro | 1.6T / 49B | CSA+HCA (hybrid compressed) | 1M | Codeforces 3206, Putnam 120/120, SWE-V 80.6, 1M MRCR SOTA | 33T | 推理代码开源 | 部分(训练代码未开源) |
| DeepSeek-V4-Flash | 284B / 13B | CSA+HCA | 1M | MMLU 88.7, FLOPs 仅 V3.2 的 10% | 32T | 推理代码开源 | 部分 |
| Kimi K2 | 1.04T / 32B | MLA, 64 heads | 128K→YaRN | LiveCodeBench 53.7, SWE-V 65.8, Tau2-Bench 66.1 | 15.5T | 开源 | 部分(训练细节有限) |
| Kimi K2.5 | 1.04T / 32B | MLA + MoonViT-3D | 262K (YaRN 64×) | MMMU 70.8, GPQA 76.8, SWE-V 76.8 | 15T text + 1T ViT + 15T joint | 开源 | 部分(GPU-hours 未披露) |
| Kimi K2.6 | 1.04T / 32B | MLA (同 K2.5) | 262K | SWE-Pro 58.6, Toolathlon 50.0, MCPMark 55.9 | 未报告(post-training 为主) | 开源 (INT4) | 部分(RL 细节缺失) |
| Kimi Linear | 48B / 3B | KDA 20L + MLA(NoPE) 7L | 1M | decode 吞吐 +75%, KV cache −75%, GPQA +7.5 (vs no-AttnRes) | 5.7T (release) | 开源 | 部分(KDA kernel 开源) |
| Attention Residuals | 48B / 3B (Kimi Linear 上验证) | N/A(组件) | N/A | scaling law 节省 ~1.25× compute, GPQA +7.5 | 1.4T (fair-cmp) | 开源(伪代码) | 可复现 |
| Massive Values | 7–9B(分析对象) | N/A(分析) | N/A | GSM8K 76.9→4.0% (disruption), RoPE↔massive values 完美对应 | N/A | 开源 | 可复现 |
| Qwen2.5-Omni | ~9–10B (dense) | GQA 28Q/4KV | 32K | 首个开源 omni-modal, parity w/ Qwen2.5-VL-7B | 1.2T+ multimodal | 开源 (Apache 2.0) | 部分(训练 infra 未披露) |
| Qwen3-Omni | ~34.5B / ~4.8B | MoE (未公开 GQA/MLA 细节) | 32K | 32/36 audio SOTA, MMMU-Pro 57.0, 234ms 首包 | 2.26T multimodal | 开源 (Apache 2.0) | 不可(20M hr 数据不可获取) |
| LongCat-Video | 13.6B (dense DiT) | 3D MHA 32 heads | N/A (video frames) | VBench 2.0 62.11% (OS #1), Commonsense 70.94% (全场 #1), 12.3× 加速 | ~678k iters | 开源 | 可复现 |
| Seedance 2.0 | 未报告 | 未报告 (MMDiT inferred) | N/A | Arena Elo 1450 T2V, Motion Quality 3.75, 20/22 R2V tasks | 未报告 | 未公开 | 不可 |
| 论文 | Strength | Weakness | Best-for scenario |
|---|---|---|---|
| DeepSeek-V4 | 1M 上下文效率革命(FLOPs 27%, KV 10%);端到端 bitwise 确定性训练;推理+竞赛全面 SOTA | 架构极度复杂(CSA+HCA+mHC+Muon+TileLang 全套必须同时 work);仅文本模态;Agent 能力略逊闭源 | 需要 1M+ 上下文的知识密集/长推理任务 |
| Kimi K2 | MuonClip 零 loss spike;sparsity 48 scaling law 验证;agentic 数据合成完善 | SimpleQA 31.0 事实性知识弱;不必要 tool use 时性能下降 | 开源 agentic 非 thinking 场景 |
| Kimi K2.5 | 1T MoE + 多模态成功验证;零视觉 SFT 创新;DEP 让多模态训练 ~90% 纯文本吞吐 | 训练 GPU-hours/infra 完全未披露;mid-train 描述含混 | 需要视觉理解的 agentic 任务 |
| Kimi K2.6 | 长程 coding 12h rollout 能力独一无二;INT4 把 1T 模型拉到单节点;Claw Groups 异构编排 | 纯 reasoning 仍逊闭源 3–8 分;RL 细节不透明;INT4 vs BF16 长程消融缺失 | 小时级自主编程 / 代码仓库重构 |
| Kimi Linear | 首个 production-scale 线性注意力超全注意力;KV 减 75%;NoPE 支持 1M | 仅 48B 验证未到 100B+;1M 实测 needle test 不完整;与 K2 主干比 total 参数差异使公平比较有争议 | 长上下文高吞吐推理(decode-bound) |
| Attention Residuals | 仅 <4% overhead 节省 1.25× compute;已 production 验证 | 仅 MoE 一例验证;block size 无理论指导;I/O 增 1.8× 对推理有压力 | 深层 Transformer 的 drop-in 升级 |
| Massive Values | 首次建立 RoPE→massive values→上下文理解完整因果链;直接指导量化策略 | 仅 7–9B 验证;disruption 方法粗暴;未给如何主动利用的方案 | 量化策略选型 / attention 机理研究 |
| Qwen2.5-Omni | 首个开源 omni-modal;Thinker-Talker 框架开创性;Apache 2.0 | Talker 紧耦合阻止 RAG 介入;单 codebook 限制语音表达力;首包 640ms+ | Qwen3-Omni 的学习/对比基线 |
| Qwen3-Omni | 五轴系统性升级;32/36 audio SOTA;234ms 首包;非退化训练 | MoE 细节全部未披露;MVBench 退化未讨论;6-concurrency 首包 1172ms | 开源全模态感知+生成统一模型 |
| LongCat-Video | GRPO for Flow Matching 有理论贡献;12.3× 加速;Commonsense 全场 #1;完整开源 | I2V 落后 Seedance;Human Fidelity 80.20% 最低;RLHF 仅 T2V 无 I2V reward | 开源视频生成(尤其长视频/物理常识) |
| Seedance 2.0 | AV 联合生成质量全面碾压;20/22 任务覆盖;7 独家任务 | 架构/训练/数据/算力完全不披露;闭源;video extension 仍逊 Veo 3.1 | 商业级高质量音视频生成 |
三种方案构成连续谱:KDA fixed state (128×128/head,O(1),与序列无关) [2510.26692] → CSA/HCA 压缩条目 (每 4/128 token 压为 1 条,O(n/m),真实存储缩减) [deepseek-v4] → MLA latent (576 floats/token,O(n),但常数小) [2507.20534] → 标准 GQA (O(n),常数大)。V4 在 1M 下 KV cache 仅 V3(MLA) 的 10%,但需要 CSA compressor + Lightning Indexer(FP4) + HCA compressor + SWA + Attention Sink + Partial RoPE 的完整复杂体系 [deepseek-v4]。Kimi Linear 通过 recurrence 获得 O(1) 但需要 chunkwise kernel 的数值正确性保障 [2510.26692]。
K2 sparsity 48 (384/8) 比 sparsity 8 节省 1.69× FLOPs [2507.20534]。V4-Pro 用 384 routed + 1 shared、top-6(比 V3 的 top-8 减少),同时用 fine-grained EP overlap 实现 1.50–1.96× 加速 [deepseek-v4]。Qwen3-Omni ~10:1 sparsity ratio 暗示更温和的设计 [2509.17765]。V4 提出的"C/B ≤ 6144 FLOPs/Byte"准则将通信带宽与可隐藏计算量化挂钩 [deepseek-v4]。
| 路径 | 代表 | 最大 ctx | 机制 |
|---|---|---|---|
| 原生压缩 attention | V4 | 1M | 4K→16K→64K→1M 渐进训练 + CSA/HCA 压缩 |
| NoPE + 线性注意力 | Kimi Linear | 1M | KDA gates 提供隐式 recency,无 RoPE 外推问题 |
| YaRN 外推 | K2.5/K2.6 | 262K | YaRN factor=64,4K 原生 |
| TM-RoPE | Qwen3-Omni | 32K | 绝对时间对齐的多模态 RoPE |
V4 和 Kimi Linear 都支持 1M 但路径截然不同:V4 保留 softmax attention 的建模能力通过压缩+稀疏削减计算量,Kimi Linear 用 recurrent state 从根本上消除序列长度依赖 [deepseek-v4] [2510.26692]。
K2.6 INT4 routed-only(~258 GB 总权重)把 1T MoE 从 16+ GPU 拉到单 8×H200 [kimi-k2-6]。V4 在训练阶段引入 FP4 QAT(MoE expert 权重 + CSA indexer),推理直接使用真实 FP4 权重确保 train-deploy 一致 [deepseek-v4]。Massive Values 研究表明保护 Q/K 低频维度的量化方法在上下文任务上显著优于不保护的方法 [2502.01563]。
Qwen3-Omni 以 LLM 为中心(Thinker MoE 统一理解+生成),在跨模态推理上占优(WorldSense 54.0 SOTA)[2509.17765]。Seedance 2.0 以 MMDiT 为中心,在生成质量和 AV 同步上全面领先(Motion Quality 3.75 vs 行业次优 3.10)[2604.14148]。LongCat-Video 的 Commonsense 70.94% 表明开源 DiT 在物理理解上可与闭源竞争 [2510.22200]。
V4 用 domain specialist + multi-teacher OPD(full-vocabulary logit distillation)合并 10+ specialist 为统一模型 [deepseek-v4]。K2.6 把 RL rollout horizon 推到 4–13 小时 / 4000+ 工具调用 [kimi-k2-6]。LongCat-Video 用多 reward GRPO(HPSv3 + MQ + TA)训仅 500 iterations [2510.22200]。三种 post-training 范式瞄准不同目标:OPD 整合多能力,长程 RL 刻入长程规划,GRPO 对齐人类偏好。
K2 系列沿用 RoPE + YaRN 扩展到 262K [2602.02276]。Kimi Linear 完全放弃 RoPE,MLA 层用 NoPE,位置信息靠 KDA gates 提供,context 1M 且无外推问题 [2510.26692]。DeepSeek-V4 用 Partial RoPE(仅最后 64 维),并在输出上施加反向补偿 [deepseek-v4]。三种方案来自三个独立团队。
矛盾根源: 目标不同。K2 优先生态兼容性(RoPE 是推理框架标配),Kimi Linear 追求极限长度外推(NoPE 无理论长度上限),V4 在压缩 KV 场景下需要位置感知但又不能让 RoPE 的全维度旋转干扰压缩后的 KV entries。Massive Values 研究 [2502.01563] 揭示 RoPE 低频维度承载语义功能,Kimi Linear 的 NoPE 方案需要 KDA 的 data-dependent gate 隐式补偿这一功能——但缺乏对应的机理分析。
V4 通过根本性架构创新(CSA+HCA + mHC + Muon)实现效率突破 [deepseek-v4]。K2.6 证明"架构不动、RL/编排做极限"仍可获得巨大能力提升(Toolathlon +80%)[kimi-k2-6]。
矛盾根源: 优化目标不同。V4 瞄准 1M 上下文推理效率(计算 bound),K2.6 瞄准长程 agentic 稳定性(能力 bound)。两者并非互斥——V4 的架构 + K2.6 的长程 RL 可能叠加。K2.6 config 三代未变暗示 Moonshot 内部也认识到架构创新和训练创新可以解耦 [kimi-k2-6]。
Qwen3-Omni 声称多模态训练不损害单模态性能 [2509.17765],但受控消融显示 MVBench 从 71.87 降至 69.50(−2.4),作者未讨论 [2509.17765]。K2.5 反直觉地发现 10:90 低视觉比例优于 50:50,且零视觉 SFT 优于 text+vision SFT [2602.02276]。
矛盾根源: 评测粒度不同。Qwen3-Omni 在多数 benchmark 上确实不退化,但 MVBench 这一视频理解子任务退化了——"non-degradation"是统计意义上的(多数不退化),而非逐任务保证。K2.5 的"零视觉 SFT 更好"则暗示联合预训已经足够强,额外视觉 SFT 反而干扰已对齐的表征——两者均为经验发现,在各自实验范围内都正确,但不能互相推翻。
LongCat-Video 的多 reward GRPO 有理论贡献(GRPO as stochastic noise search)且完整开源 [2510.22200]。Seedance 2.0 在所有评测维度全面领先但零架构披露 [2604.14148]。
矛盾根源: LongCat 在开源约束下(数据/算力有限)做到 Commonsense 维度全场最佳,但 Human Fidelity 最低(80.20%)[2510.22200];Seedance 依靠字节内部短视频数据生态 + RewardDance/DanceGRPO 实现全面领先。差距根源不在方法论而在数据资产和计算预算——LongCat 的方法论贡献(GRPO 理论洞察 + 3D BSA 开源)对学术界价值更高。
K2 的 MuonClip(QK-clip) 解决 Muon 导致的 attention logit 爆炸,self-deactivating 且 12.7% heads 触发 [2507.20534]。V4 的 Anticipatory Routing 解耦 backbone 和 routing 参数更新,仅在 loss spike 发生时启用 [deepseek-v4]。
矛盾根源: 两者针对不同 failure mode。MuonClip 针对 Muon optimizer 的 spectral 特性导致的 QK 累加增长(optimizer-level),Anticipatory Routing 针对 MoE routing 放大 outlier 的效应(architecture-level)。V4 同时使用 Muon + Anticipatory Routing + SwiGLU Clamping 三管齐下,说明在万亿参数 MoE 中单一稳定性技术不够。
以下 gaps 均为"技术上可做但尚无人做"的空白,非根本性困难。
选 DeepSeek-V4-Pro。CSA+HCA 在 1M 下 FLOPs 仅 V3.2 的 27%、KV cache 10%,是唯一在 1M 学术 benchmark 上超越 Gemini-3.1-Pro 的开源模型 [deepseek-v4]。若推理吞吐是瓶颈且 context ≤262K,Kimi Linear 的 KDA 层 decode 吞吐 +75% 是更轻量替代 [2510.26692]。
选 Kimi K2.6。唯一验证了 12–13 小时 / 4000+ 工具调用连续 coding 的开源模型(SWE-Bench Pro 58.6 全场最高)[kimi-k2-6]。INT4 默认量化使单 8×H200 节点可服务。若数学/科学推理是首要需求,V4-Pro-Max 更强(Putnam 满分,AIME 2025 61.3)[deepseek-v4]。
选 Qwen3-Omni。唯一涵盖 text/image/audio/video 感知 + 实时语音生成的开源模型(Apache 2.0)。32/36 audio benchmark SOTA,234ms 首包延迟 [2509.17765]。注意 Thinking 变体会退化 ASR(WER 1.22→2.22)[2509.17765]——感知密集任务用 Instruct 变体。
选 LongCat-Video。VBench 2.0 开源第一,Commonsense 全场最佳,完整开源含 3D BSA Triton 实现 [2510.22200]。12.3× 推理加速使单 H800 可生成 720p 视频。若音视频同步质量是核心需求且可接受闭源 API,Seedance 2.0 在全维度领先 [2604.14148]。
选 Kimi K2.5。1T MoE + MoonViT-3D,MMMU 70.8 接近 Gemini-2.5-Pro 71.4,且具备完整 agentic 能力(GAIA 70.0)[2602.02276]。若需最强文本+视觉推理但不需语音,K2.5 在 agent 场景优于 Qwen3-Omni(后者的 MoE 细节不透明使独立优化困难)。
参考 Massive Values 研究:对于上下文理解密集场景(RAG、agent),优先 AWQ/SmoothQuant 而非 GPTQ [2502.01563]。K2.6 的 routed-only INT4 + attention FP16 保留策略是 MoE 量化的 reference point [kimi-k2-6]。V4 的 FP4 QAT 可保证 train-deploy 一致但需要训练阶段引入 [deepseek-v4]。
| ID | 标题 | 子主题 |
|---|---|---|
| [deepseek-v4] | DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence | CSA+HCA, mHC, Muon, 1M 原生, OPD, bitwise 确定性 |
| [2507.20534] | Kimi K2: Open Agentic Intelligence | MoE 1T, MuonClip, MLA, sparsity 48 scaling law, agentic 数据合成 |
| [2602.02276] | Kimi K2.5: Visual Agentic Intelligence | 1T MoE + MoonViT, 零视觉 SFT, PARL, DEP |
| [kimi-k2-6] | Kimi K2.6: Advancing Open-Source Coding | INT4 量化, 长程 agentic RL, Agent Swarm 3×, Claw Groups |
| [2510.26692] | Kimi Linear: An Expressive, Efficient Attention Architecture | KDA 线性注意力, NoPE, 3:1 hybrid, chunkwise DPLR kernel |
| [2603.15031] | Attention Residuals | 深度 softmax 聚合, Block-AttnRes, scaling law 1.25× compute 节省 |
| [2502.01563] | Massive Values in Self-Attention Modules | RoPE massive values, 上下文知识因果链, 量化策略指导 |
| [2503.20215] | Qwen2.5-Omni Technical Report | Dense Thinker-Talker, TM-RoPE, 首个开源 omni-modal |
| [2509.17765] | Qwen3-Omni Technical Report | MoE Thinker-Talker, AuT, RVQ, 234ms 首包, 非退化训练 |
| [2510.22200] | LongCat-Video Technical Report | DiT, GRPO for Flow Matching, 3D BSA, C2F 12.3× 加速 |
| [2604.14148] | Seedance 2.0: Advancing Video Generation for World Complexity | Dual-branch MMDiT, AV 联合生成, Arena Elo 1450, 20/22 R2V tasks |