| 相关实体 | 关系类型 | 关联理由 |
|---|---|---|
| Seedance 2.0 (2604.14148) | 直接后继 | ByteDance Seed Vision Team 的下一代模型,继承并扩展 1.5 pro 的 dual-branch MMDiT + RLHF 路线,在 Arena.AI T2V/I2V 双榜 Elo #1 |
| LongCat-Video (2510.22200) | 技术对比 | 美团的视频生成系统,同赛道竞争者;采用 GRPO + flow matching 的不同 RLHF 策略和 sparse attention 加速路线 |
| SLA (2509.24006) | 底层加速 | Sparse-linear attention 是 Seedance 系列潜在采用的 attention 加速技术,SLA/SLA2 在 Wan2.1(与 Seedance 同赛道的 DiT 模型)上验证 |
| 维度 | Seedance 1.5 Pro (2512.13507) | Seedance 2.0 (2604.14148) |
|---|---|---|
| 发布时间 | 2025-12 | 2026-04 |
| 核心架构 | Dual-branch MMDiT + cross-modal joint module [2512.13507] | 继承 dual-branch MMDiT + cross-modal joint denoising [2604.14148] |
| 输入模态 | Text, Image → Audio-Video | Text, Image, Video, Audio 混合输入 [2604.14148] |
| 任务覆盖 | T2VA, I2VA, T2V, I2V | + VFX 参考、创意参考、视频续写/扩展 [2604.14148] |
| RLHF | Multi-dimensional reward (motion + aesthetics + audio) [2512.13507] | Extended RLHF + "更精细的奖励维度"(具体未披露)[2604.14148] |
| Evaluation | SeedVideoBench 1.5 (proprietary) | Arena.AI public leaderboard: T2V Elo 1450 #1, I2V Elo 1449 #1 [2604.14148] |
| 技术披露 | 极少(无 equations/algorithms/model size) [2512.13507] | 同样极少(evaluation report 性质)[2604.14148] |
演进逻辑: 1.5 pro → 2.0 的核心进化是 输入模态扩展(从 text/image 到混合多模态引用)和 任务覆盖泛化(从基础生成到 VFX/续写/扩展)。架构骨架(dual-branch MMDiT + RLHF)保持不变,说明 ByteDance 将此视为 scalable foundation 而非需要重新设计的方向。
| 维度 | Seedance 1.5 Pro | LongCat-Video |
|---|---|---|
| 组织 | ByteDance (197 authors) | 美团 (~10 authors) [2510.22200] |
| 架构 | Dual-branch MMDiT (video + audio) | 13.6B 稠密 DiT (video only) [2510.22200] |
| RLHF 方法 | "Multi-dimensional reward model" (undisclosed) [2512.13507] | GRPO adapted to flow matching, 理论证明等价于随机噪声搜索 [2510.22200] |
| Anti-reward-hacking | 未讨论 | 多 reward 加权 $\hat{A}_\text{total} = \sum_k w_k \hat{A}_k$ 防止静态视频 hacking [2510.22200] |
| 推理加速 | >10× (distillation + quant + parallelism) [2512.13507] | 12.3× (coarse-to-fine + 3D BSA) [2510.22200] |
| 音频 | Native joint generation | 无音频 |
| Benchmark | Proprietary (SeedVideoBench 1.5) | VBench 2.0 开源 #1, Commonsense 全场最佳 [2510.22200] |
关键差异: LongCat-Video 的技术透明度远高于 Seedance 1.5 pro——GRPO 适配 flow matching 的理论推导 [2510.22200] 提供了可复现的方法论,而 Seedance 的 "multi-dimensional reward model" 完全不透明。但 Seedance 1.5 pro 的 native audio 能力是 LongCat-Video 完全不具备的差异化优势。
Seedance 1.5 pro 声称 >10× inference acceleration [2512.13507],但未披露 attention 层的具体加速手段。SLA/SLA2 在 Wan2.1(同赛道 DiT 模型)上实现 13.7–18.7× attention speedup [2509.24006]。推测 Seedance 的加速栈中可能包含类似的 sparse attention 技术(但采用何种方案未知)。
SLA 的 sparse-linear decomposition 适用于 DiT 的条件:(1) attention weights 分解为 high-rank sparse + low-rank dense [2509.24006],(2) model 可通过 fine-tuning 适应 sparse pattern。Seedance 的 dual-branch 架构引入了额外的 cross-modal attention,其 sparsity pattern 可能与 single-modal video attention 显著不同——cross-modal 对齐通常需要更 dense 的 attention。
Seedance 1.5 pro 在视频生成赛道中的定位:
| 模型 | 组织 | 音频 | 分辨率 | 开源 | 技术透明度 |
|---|---|---|---|---|---|
| Wan 2.5 | 阿里 | Post-processing | 720p+ | 部分开源 | 中 |
| Kling 2.6 | 快手 | Post-processing | 1080p | 闭源 | 低 |
| Sora 2 | OpenAI | Joint | 1080p | 闭源 | 极低 |
| Veo 3.1 | Joint | 1080p | 闭源 | 低 | |
| Seedance 1.5 pro | ByteDance | Native joint | 720p | 闭源 | 极低 |
| Seedance 2.0 | ByteDance | Native joint | 720p | 闭源 | 极低 |
| LongCat-Video | 美团 | 无 | 720p | 部分开源 | 高 |
Seedance 1.5 pro 的生态位优势在于 中文语境的 native AV 联合生成(方言支持、唇语同步),但技术透明度是赛道中最低的——这使其科学贡献有限,更多是产品定位文档。