Team Seedance (ByteDance) | 2026-04 | https://arxiv.org/abs/2604.14148 Category: algorithm | Tags: video-generation, audio-video-joint, diffusion-transformer, multimodal-generation, RLHF, evaluation-report
ByteDance 的统一多模态音视频联合生成模型,采用 dual-branch MMDiT + cross-modal joint denoising + RLHF 后训练,在 Arena.AI T2V/I2V 双榜 Elo #1 (1450/1449),720p 击败 1080p 竞品。论文为评测报告,算法细节全部未披露。
2025–2026 年视频生成进入原生音视频联合赛道,但现存系统面临三个结构性缺陷:

Paper's Figure 4, verbatim (caption: "Visualization of text-to-video (T2V) and image-to-video (I2V) generation.").
图中展示了 Seedance 2.0 在高难度场景下的生成能力:双人花样滑冰的多人协调运动、武侠竹林对决的慢镜头物理特效、以及油画破框广告创意。这些场景体现了上述三个痛点在实际应用中的表现——需要精确的运动物理、多主体一致性和创意参考能力。
Seedance 2.0 沿用 Seedance 1.5 Pro 的 dual-branch MMDiT 架构,以统一框架同时处理视频和音频两个扩散分支,通过 cross-modal joint module 在每个去噪步实现深度 AV 交互。完整训练流程为 pre-train → SFT → RLHF (DanceGRPO) 三阶段,推理侧通过多阶段蒸馏获得 Fast 变体。
但需明确前置:本文是一份模型发布 + 评测报告,全文无任何架构图、损失函数、训练配置或消融实验。以上方法描述全部基于前作 Seedance 1.5 Pro (arXiv:2512.13507) 倒推。
Objective: [论文未披露] — 论文不包含任何损失函数或训练目标的数学表达。
基于前作推断,训练目标大致包含:
Assumptions: [论文未披露]
单步输入/输出: [论文未披露] — 论文仅描述用户侧 I/O:text + up to 9 images + 3 videos + 3 audio clips → 4–15s audio-video at 480p/720p。
多模态音视频联合训练数据 pipeline — ByteDance 拥有抖音/TikTok/剪映生态中海量的视频+音频对齐数据,经过多阶段 curation、专业级 captioning、课程式调度 (curriculum-based scheduling)。这是任何学术机构或竞争对手最难复制的资产,因为等同规模、等同质量、等同 caption 密度的音视频语料不可公开获取。
| 指标 | 数值 | 对比 |
|---|---|---|
| Arena.AI T2V Elo | 1450 ±15 (#1) | vs veo-3.1-audio-1080p 1371 (+79) |
| Arena.AI I2V Elo | 1449 ±11 (#1) | vs grok-imagine-video-720p 1420 (+29) |
| SeedVideoBench T2V Motion | 3.75/5 | vs Kling 3.0 3.10 (+0.65) |
| SeedVideoBench T2V Audio Quality | 3.63/5 | vs Seedance 1.5 2.88 (+0.75) |
| SeedVideoBench I2V 所有 6 维度 | 全部第一 | 唯一 ≥87% usability 全轴达标 |
| R2V 多模态任务覆盖 | 20/22 | 竞品最高 13/22,7 个任务独家 |
| 输出规格 | 4–15s, 480p/720p, binaural stereo | — |
关键发现:720p 输出在 Arena.AI 上击败所有 1080p 竞品 (Veo 3.1, Sora 2 Pro),说明感知质量由运动一致性和视觉连贯性主导,而非分辨率。
Seedance 2.0 的核心算法机制是 unified cross-modal joint denoising:视频 DiT branch 和音频 DiT branch 在每个扩散去噪步通过 cross-modal attention 交换信息,实现帧级 AV 同步。这区别于先生成视频再配音频的流水线方案。
| 方面 | Before (独立 AV pipeline) | After (Seedance 2.0 统一架构) |
|---|---|---|
| AV 同步 | 后处理对齐,长视频漂移 | 每步联合去噪,步级耦合 |
| 输入模态 | Text / image only | Text + image + video + audio |
| 任务覆盖 | T2V / I2V 两类 | 20/22 R2V 任务统一模型 |
| 音频质量 | 单声道、低保真 | Binaural stereo、multi-track |
| conditioning | 单一 task token | 多任务统一 prompt template + @-tag 引用 |
论文本身不包含任何架构图。以下 Mermaid 基于前作 Seedance 1.5 Pro 的描述重构:

Paper's Figure 1, verbatim (caption: "Overall performance comparison across T2V, I2V, and R2V tasks. Seedance 2.0 achieves comprehensive leading performance over all competing models across every evaluated dimension in all three generation tasks.").
三张雷达图分别对应 T2V、I2V 和 Multimodal Task 评测。Seedance 2.0(红色)在所有维度均占据最外圈,覆盖 motion quality、video/audio prompt following、aesthetics、AV sync 等 18 个细分指标。这是论文的核心结论可视化——全维度领先。
无形式化作者证明 — 仅实证
论文不包含任何数学公式、定理、命题或引理。所有主张完全依赖经验评测支撑。
| # | 检查项 | 结果 |
|---|---|---|
| 1 | 是否陈述形式化命题? | 否。所有声明均为定性描述("industry-leading"、"remarkable leap")+ benchmark 分数 |
| 2 | 是否给出收敛保证? | 否 |
| 3 | 是否给出样本复杂度界? | 否 |
| 4 | 是否指定损失函数? | 否。连 diffusion 去噪目标的具体形式都未写出 |
| 5 | 是否列出假设条件? | 否 |
| 6 | 是否有消融实验分解方法贡献? | 否。无任何消融 |
| Stage | Purpose | Data | Steps | LR | Batch | Technique |
|---|---|---|---|---|---|---|
| 1. Pre-train | 多任务联合 AV 生成 | [论文未披露] | [论文未披露] | [论文未披露] | [论文未披露] | T2V/I2V/T2VA/I2VA 混合训练 |
| 2. SFT | 高质量对齐 | [论文未披露] | [论文未披露] | [论文未披露] | [论文未披露] | 前作 1.5 pro 确认存在 |
| 3. RLHF | 多维度人类偏好对齐 | [论文未披露] | [论文未披露] | [论文未披露] | [论文未披露] | RewardDance + DanceGRPO |
| 4. Distillation | 推理加速 | — | [论文未披露] | — | — | 多阶段蒸馏 (Hyper-SD lineage), ≥10× speedup |
[论文未披露][论文未披露][论文未披露][论文未披露][论文未披露][论文未披露]| Model | Motion | Video Prompt | Aesthetics | Audio Quality | AV Sync | Audio Prompt |
|---|---|---|---|---|---|---|
| Kling 2.6 | 2.72 | 2.39 | 3.21 | 2.46 | 2.67 | 2.00 |
| Kling 3.0 | 3.10 | 2.78 | 3.36 | 2.74 | 2.78 | 2.54 |
| Sora 2 Pro | 2.69 | 2.81 | 2.82 | 2.76 | 2.65 | 2.92 |
| Veo 3.1 | 2.73 | 2.59 | 2.88 | 2.62 | 2.54 | 2.24 |
| Seedance 1.5 | 2.39 | 2.59 | 3.19 | 2.88 | 2.91 | 2.69 |
| Seedance 2.0 | 3.75 | 3.43 | 3.67 | 3.63 | 3.75 | 3.56 |
唯一所有维度 > 3.4 的模型。相较 1.5 版本平均提升 +0.86,最大单维度提升在 Motion Quality (+1.36)。T2V 30 个 Motion 子类中 29 个排名第一。
| Model | Motion | VPF | Image Pres. | Audio | AV Sync | APF |
|---|---|---|---|---|---|---|
| Wan 2.6 | 2.32 | 2.74 | 2.61 | 2.20 | 2.18 | 2.55 |
| Kling 3.0 | 2.80 | 2.78 | 3.18 | 2.89 | 2.83 | 2.85 |
| Veo 3.1 | 2.65 | 2.87 | 2.69 | 2.68 | 2.69 | 2.79 |
| Seedance 2.0 | 3.35 | 3.46 | 3.31 | 3.61 | 3.54 | 3.70 |
I2V 最接近的赛道是 Image Preservation (Kling 3.0 3.18 vs Seedance 3.31,差距仅 0.13)。音频维度领先幅度达 0.54–1.43 分。
| Model | 支持任务 / 22 | 独家能力 |
|---|---|---|
| Seedance 2.0 | 20 | VFX/Creative ref (3), Continuation/Extension (4) |
| Vidu Q2 Pro | 13 | — |
| Kling O1 | 10 | — |
| Kling 3 Omni | 9 | — |
7 个任务 (VFX 参考 × 3 + 续写/扩展 × 4) 为 Seedance 2.0 独家,构成真实产品差异化。

Paper's Figure 2, verbatim (caption: "Leaderboards on Arena.AI (Accessed: April 8, 2026, Eastern Time).").
Arena.AI 是基于用户两两盲投的 Elo 排名系统,是对自研 SeedVideoBench 分数的独立校验。T2V Elo 1450 领先 veo-3.1-audio-1080p 79 分,I2V Elo 1449 领先 grok-imagine-video-720p 29 分。值得注意的是 Seedance 2.0 仅输出 720p 却击败所有 1080p 竞品,佐证了运动一致性对感知质量的贡献超过分辨率。

Paper's Figure 3, verbatim (caption: "T2V performance comparison across six scenarios.").
六个生产场景(Ad 广告 / Fiction 小说改编 / PGC 专业内容 / Consumer Effects 消费视效 / Social 社媒 / Basic 基础)各自的 6 维雷达图均显示 Seedance 2.0 占据最外圈。这回应了"全维度第一是否仅在 cherry-picked 提示词上成立"的质疑——能力在各场景下是均衡的。
[论文未披露]。前作 1.5 Pro 提到 "comprehensive audio-visual data framework",音频覆盖 17+ 类(多语言、中文方言、戏曲、ASMR、binaural 等),视频覆盖 6 大生产场景。[论文未披露]。前作提到 "multi-stage curation pipeline"。[论文未披露]。SeedVideoBench 2.0 本身未公开 prompt 集,无法评估是否与训练数据重叠。[论文未披露]。前作提到 "advanced captioning system",推测为自动+人工混合标注。[论文未披露]。[论文未披露]。论文未提供任何训练 loss 曲线、reward 演化、稳定性分析或超参敏感度实验。无法评估 RLHF 阶段是否存在 reward hacking、KL explosion 或 length exploitation。
| Step | 论文主张 | 支撑证据 | 有效性评估 |
|---|---|---|---|
| 1 | 统一 dual-branch MMDiT 能联合生成音视频 | 前作 1.5 Pro 描述架构;2.0 声明继承 | 架构有效性已由 1.5 Pro 验证,但 2.0 本身无架构细节 |
| 2 | 联合去噪优于流水线方案的 AV 同步 | T2V AV Sync 3.75 vs runner-up 2.91 (+0.84) | benchmark 支持,但缺乏联合 vs 流水线的控制消融 |
| 3 | 4 模态输入 + 22 任务统一模型可行 | R2V 评测:20/22 任务支持,7 独家 | 任务覆盖数量有力支撑;但部分任务(video extension)质量仍落后竞品 |
| 4 | SFT + RLHF 后训练提升多维度质量 | 相较 1.5 版本平均 +0.86 分 | 有力支撑,但无法分离 SFT vs RLHF 各自贡献 |
| 5 | 整体能力达到行业 SOTA | Arena.AI Elo #1 (T2V 1450, I2V 1449) | 最强证据:第三方盲测独立验证,非自评 |
| 6 | 720p 足以在感知质量上超越 1080p | Arena.AI 中 720p 击败全部 1080p 竞品 | 支持但存在混淆因素——差异可能来自 motion/coherence 而非分辨率无关 |
[实现未公开]
Seedance 2.0 为 ByteDance 闭源商业模型,无开源权重、无 modeling 代码、无训练代码。仅通过 Doubao / Jimeng / Volcano Engine API 提供推理服务 (doubao-seedance-2-0-260128)。
本文最难复现的单一要素是 多模态音视频联合训练数据 pipeline。具体而言:
@Image 1、@Video 2 等 tag 在自然语言 prompt 中引用特定输入资产。这意味着 tokenizer 和 conditioning injection 需要支持动态数量的引用锚点,且每个锚点对应不同模态的 encoder 输出。实现上可能需要为每个 @-tag 维护独立的 cross-attention mask。