Seedance 2.0: Advancing Video Generation for World Complexity

algorithm 2604.14148
video-generationaudio-video-jointdiffusion-transformermultimodal-generationRLHFevaluation-report

Seedance 2.0: Advancing Video Generation for World Complexity — L2 #

Team Seedance (ByteDance) | 2026-04 | https://arxiv.org/abs/2604.14148 Category: algorithm | Tags: video-generation, audio-video-joint, diffusion-transformer, multimodal-generation, RLHF, evaluation-report

§1 TL;DR #

ByteDance 的统一多模态音视频联合生成模型,采用 dual-branch MMDiT + cross-modal joint denoising + RLHF 后训练,在 Arena.AI T2V/I2V 双榜 Elo #1 (1450/1449),720p 击败 1080p 竞品。论文为评测报告,算法细节全部未披露。


§2 Q1 / Q2 / Q3 #

Q1 痛点 #

2025–2026 年视频生成进入原生音视频联合赛道,但现存系统面临三个结构性缺陷:

  1. AV 同步漂移:多数模型 (Wan 2.5, Sora 2, Kling 2.6) 采用视频先生成、音频后配的流水线架构,导致唇同步和音效-画面节奏在长视频上累积偏移。
  2. 输入模态受限:竞品大多只接受 text 或 text+image,无法在一次生成中混合引用视频片段、音频片段、多张图片和自然语言。
  3. 任务覆盖碎片化:VFX 参考、创意参考、视频续写、视频扩展等高阶任务需要多个独立模型拼接,工作流断裂。
  4. Figure 4: T2V and I2V visual examples showing complex motion, physical interaction, and creative scenario generation

    Paper's Figure 4, verbatim (caption: "Visualization of text-to-video (T2V) and image-to-video (I2V) generation.").

    图中展示了 Seedance 2.0 在高难度场景下的生成能力:双人花样滑冰的多人协调运动、武侠竹林对决的慢镜头物理特效、以及油画破框广告创意。这些场景体现了上述三个痛点在实际应用中的表现——需要精确的运动物理、多主体一致性和创意参考能力。

    Q2 方法 #

    Seedance 2.0 沿用 Seedance 1.5 Pro 的 dual-branch MMDiT 架构,以统一框架同时处理视频和音频两个扩散分支,通过 cross-modal joint module 在每个去噪步实现深度 AV 交互。完整训练流程为 pre-train → SFT → RLHF (DanceGRPO) 三阶段,推理侧通过多阶段蒸馏获得 Fast 变体。

    但需明确前置:本文是一份模型发布 + 评测报告,全文无任何架构图、损失函数、训练配置或消融实验。以上方法描述全部基于前作 Seedance 1.5 Pro (arXiv:2512.13507) 倒推。

    Problem Formulation #

    Objective: [论文未披露] — 论文不包含任何损失函数或训练目标的数学表达。

    基于前作推断,训练目标大致包含:

    • 扩散去噪损失:标准 flow-matching 或 DDPM 目标,作用于视频和音频两个 latent 分支
    • RLHF 目标:DanceGRPO 系列,使用多维度 reward model (motion quality / aesthetics / audio fidelity) 的组合奖励
    • 蒸馏损失:Hyper-SD / RayFlow 系列的 trajectory segmented consistency

    Assumptions: [论文未披露]

    单步输入/输出: [论文未披露] — 论文仅描述用户侧 I/O:text + up to 9 images + 3 videos + 3 audio clips → 4–15s audio-video at 480p/720p。

    核心技术壁垒 #

    多模态音视频联合训练数据 pipeline — ByteDance 拥有抖音/TikTok/剪映生态中海量的视频+音频对齐数据,经过多阶段 curation、专业级 captioning、课程式调度 (curriculum-based scheduling)。这是任何学术机构或竞争对手最难复制的资产,因为等同规模、等同质量、等同 caption 密度的音视频语料不可公开获取。

    Q3 结果 #

    指标数值对比
    Arena.AI T2V Elo1450 ±15 (#1)vs veo-3.1-audio-1080p 1371 (+79)
    Arena.AI I2V Elo1449 ±11 (#1)vs grok-imagine-video-720p 1420 (+29)
    SeedVideoBench T2V Motion3.75/5vs Kling 3.0 3.10 (+0.65)
    SeedVideoBench T2V Audio Quality3.63/5vs Seedance 1.5 2.88 (+0.75)
    SeedVideoBench I2V 所有 6 维度全部第一唯一 ≥87% usability 全轴达标
    R2V 多模态任务覆盖20/22竞品最高 13/22,7 个任务独家
    输出规格4–15s, 480p/720p, binaural stereo

    关键发现:720p 输出在 Arena.AI 上击败所有 1080p 竞品 (Veo 3.1, Sora 2 Pro),说明感知质量由运动一致性和视觉连贯性主导,而非分辨率。


    §3 架构 / 方法图 #

    Method Core #

    Seedance 2.0 的核心算法机制是 unified cross-modal joint denoising:视频 DiT branch 和音频 DiT branch 在每个扩散去噪步通过 cross-modal attention 交换信息,实现帧级 AV 同步。这区别于先生成视频再配音频的流水线方案。

    方面Before (独立 AV pipeline)After (Seedance 2.0 统一架构)
    AV 同步后处理对齐,长视频漂移每步联合去噪,步级耦合
    输入模态Text / image onlyText + image + video + audio
    任务覆盖T2V / I2V 两类20/22 R2V 任务统一模型
    音频质量单声道、低保真Binaural stereo、multi-track
    conditioning单一 task token多任务统一 prompt template + @-tag 引用

    Architecture (从 Seedance 1.5 Pro 推断) #

    论文本身不包含任何架构图。以下 Mermaid 基于前作 Seedance 1.5 Pro 的描述重构:

    flowchart TB subgraph inputs["Multi-modal Inputs"] txt["Text (storyboard / dialogue)"] img["Images (≤9)"] vid["Video clips (≤3)"] aud["Audio clips (≤3)"] end subgraph encoders["Encoders"] enc_t["Text Encoder"] enc_v["Visual Encoder + 3D-VAE"] enc_a["Audio Encoder"] end subgraph backbone["Unified MMDiT Backbone (× N blocks)"] vb["Video DiT Branch\n(noisy latent video)"] ab["Audio DiT Branch\n(noisy latent binaural audio)"] cm["Cross-Modal Joint Module\n(AV cross-attention per step)"] tc["Text Conditioning\n(cross-attn / AdaLN)"] end subgraph decoders["Decoders"] dec_v["Video VAE Decoder\n→ 480p/720p, 4-15s"] dec_a["Audio Decoder\n→ binaural waveform"] end out["Synchronized Audio + Video Output"] txt --> enc_t --> tc img --> enc_v --> vb vid --> enc_v aud --> enc_a --> ab vb <--> cm ab <--> cm tc --> vb tc --> ab vb --> dec_v --> out ab --> dec_a --> out

    Figure 1: Overall performance radar across T2V, I2V, and R2V tasks

    Paper's Figure 1, verbatim (caption: "Overall performance comparison across T2V, I2V, and R2V tasks. Seedance 2.0 achieves comprehensive leading performance over all competing models across every evaluated dimension in all three generation tasks.").

    三张雷达图分别对应 T2V、I2V 和 Multimodal Task 评测。Seedance 2.0(红色)在所有维度均占据最外圈,覆盖 motion quality、video/audio prompt following、aesthetics、AV sync 等 18 个细分指标。这是论文的核心结论可视化——全维度领先。


    §4 作者证明 #

    无形式化作者证明 — 仅实证

    论文不包含任何数学公式、定理、命题或引理。所有主张完全依赖经验评测支撑。

    6 项基本检查 #

    #检查项结果
    1是否陈述形式化命题?否。所有声明均为定性描述("industry-leading"、"remarkable leap")+ benchmark 分数
    2是否给出收敛保证?
    3是否给出样本复杂度界?
    4是否指定损失函数?否。连 diffusion 去噪目标的具体形式都未写出
    5是否列出假设条件?
    6是否有消融实验分解方法贡献?否。无任何消融

    理想中应有但缺失的保证 #

    • 联合 vs 流水线消融:将 cross-modal joint module 替换为独立 AV 生成 + 后处理对齐,量化 AV sync 和 motion quality 的退化幅度
    • 蒸馏质量-速度曲线:Fast 变体相对完整版在不同 NFE 下的质量损失
    • 多任务统一 vs 专用模型:22 个 R2V 任务在统一模型 vs 任务专用模型上的性能差异
    • RLHF 消融:SFT-only vs SFT+RLHF 在各维度上的增益分解
    • 训练 loss 曲线:pre-train → SFT → RLHF 各阶段的 loss/reward 演化

    §5 实验与数据 #

    Training Recipe & Scale #

    StagePurposeDataStepsLRBatchTechnique
    1. Pre-train多任务联合 AV 生成[论文未披露][论文未披露][论文未披露][论文未披露]T2V/I2V/T2VA/I2VA 混合训练
    2. SFT高质量对齐[论文未披露][论文未披露][论文未披露][论文未披露]前作 1.5 pro 确认存在
    3. RLHF多维度人类偏好对齐[论文未披露][论文未披露][论文未披露][论文未披露]RewardDance + DanceGRPO
    4. Distillation推理加速[论文未披露]多阶段蒸馏 (Hyper-SD lineage), ≥10× speedup
    • Total tokens / samples: [论文未披露]
    • GPU hours: [论文未披露]
    • Model parameters: [论文未披露]
    • MFU: [论文未披露]
    • Critical hyperparameters (GRPO group size $G$, KL coefficient, clip ratio): [论文未披露]
    • Stability tricks: [论文未披露]

    Key Results: T2V #

    ModelMotionVideo PromptAestheticsAudio QualityAV SyncAudio Prompt
    Kling 2.62.722.393.212.462.672.00
    Kling 3.03.102.783.362.742.782.54
    Sora 2 Pro2.692.812.822.762.652.92
    Veo 3.12.732.592.882.622.542.24
    Seedance 1.52.392.593.192.882.912.69
    Seedance 2.03.753.433.673.633.753.56

    唯一所有维度 > 3.4 的模型。相较 1.5 版本平均提升 +0.86,最大单维度提升在 Motion Quality (+1.36)。T2V 30 个 Motion 子类中 29 个排名第一。

    Key Results: I2V #

    ModelMotionVPFImage Pres.AudioAV SyncAPF
    Wan 2.62.322.742.612.202.182.55
    Kling 3.02.802.783.182.892.832.85
    Veo 3.12.652.872.692.682.692.79
    Seedance 2.03.353.463.313.613.543.70

    I2V 最接近的赛道是 Image Preservation (Kling 3.0 3.18 vs Seedance 3.31,差距仅 0.13)。音频维度领先幅度达 0.54–1.43 分。

    Key Results: R2V Task Coverage #

    Model支持任务 / 22独家能力
    Seedance 2.020VFX/Creative ref (3), Continuation/Extension (4)
    Vidu Q2 Pro13
    Kling O110
    Kling 3 Omni9

    7 个任务 (VFX 参考 × 3 + 续写/扩展 × 4) 为 Seedance 2.0 独家,构成真实产品差异化。

    Arena.AI 第三方验证 #

    Figure 2: Arena.AI public leaderboards for T2V and I2V

    Paper's Figure 2, verbatim (caption: "Leaderboards on Arena.AI (Accessed: April 8, 2026, Eastern Time).").

    Arena.AI 是基于用户两两盲投的 Elo 排名系统,是对自研 SeedVideoBench 分数的独立校验。T2V Elo 1450 领先 veo-3.1-audio-1080p 79 分,I2V Elo 1449 领先 grok-imagine-video-720p 29 分。值得注意的是 Seedance 2.0 仅输出 720p 却击败所有 1080p 竞品,佐证了运动一致性对感知质量的贡献超过分辨率。

    场景泛化 #

    Figure 3: T2V performance across six production scenarios

    Paper's Figure 3, verbatim (caption: "T2V performance comparison across six scenarios.").

    六个生产场景(Ad 广告 / Fiction 小说改编 / PGC 专业内容 / Consumer Effects 消费视效 / Social 社媒 / Basic 基础)各自的 6 维雷达图均显示 Seedance 2.0 占据最外圈。这回应了"全维度第一是否仅在 cherry-picked 提示词上成立"的质疑——能力在各场景下是均衡的。

    Dataset Analysis #

    • Composition: [论文未披露]。前作 1.5 Pro 提到 "comprehensive audio-visual data framework",音频覆盖 17+ 类(多语言、中文方言、戏曲、ASMR、binaural 等),视频覆盖 6 大生产场景。
    • Quality filters: [论文未披露]。前作提到 "multi-stage curation pipeline"。
    • Contamination check: [论文未披露]。SeedVideoBench 2.0 本身未公开 prompt 集,无法评估是否与训练数据重叠。
    • Annotation: [论文未披露]。前作提到 "advanced captioning system",推测为自动+人工混合标注。
    • Synthetic data: [论文未披露]

    Convergence & Stability #

    [论文未披露]。论文未提供任何训练 loss 曲线、reward 演化、稳定性分析或超参敏感度实验。无法评估 RLHF 阶段是否存在 reward hacking、KL explosion 或 length exploitation。


    §6 论证链 #

    Step论文主张支撑证据有效性评估
    1统一 dual-branch MMDiT 能联合生成音视频前作 1.5 Pro 描述架构;2.0 声明继承架构有效性已由 1.5 Pro 验证,但 2.0 本身无架构细节
    2联合去噪优于流水线方案的 AV 同步T2V AV Sync 3.75 vs runner-up 2.91 (+0.84)benchmark 支持,但缺乏联合 vs 流水线的控制消融
    34 模态输入 + 22 任务统一模型可行R2V 评测:20/22 任务支持,7 独家任务覆盖数量有力支撑;但部分任务(video extension)质量仍落后竞品
    4SFT + RLHF 后训练提升多维度质量相较 1.5 版本平均 +0.86 分有力支撑,但无法分离 SFT vs RLHF 各自贡献
    5整体能力达到行业 SOTAArena.AI Elo #1 (T2V 1450, I2V 1449)最强证据:第三方盲测独立验证,非自评
    6720p 足以在感知质量上超越 1080pArena.AI 中 720p 击败全部 1080p 竞品支持但存在混淆因素——差异可能来自 motion/coherence 而非分辨率无关

    §7 实现 cross-reference #

    [实现未公开]

    Seedance 2.0 为 ByteDance 闭源商业模型,无开源权重、无 modeling 代码、无训练代码。仅通过 Doubao / Jimeng / Volcano Engine API 提供推理服务 (doubao-seedance-2-0-260128)。

    核心技术壁垒(展开) #

    本文最难复现的单一要素是 多模态音视频联合训练数据 pipeline。具体而言:

    1. 数据规模与质量不可复制:ByteDance 拥有来自抖音/TikTok/剪映生态的海量视频+音频对齐数据,经多阶段 curation、专业级 captioning 和 curriculum scheduling 处理。等同规模 + 等同质量 + 等同 caption 密度的音视频语料不存在于公共领域。
    2. 跨模态对齐标注:音频与视频在帧级的对齐标注(唇同步、音效-动作同步、情感-旋律同步)需要大规模半自动化 pipeline,这依赖字节内部的音频理解模型和视频理解模型。
    3. 多任务数据配方:22 种 R2V 任务各需要特定形式的训练样本(编辑前后对、续写上下文对、VFX 参考对等),任务配比是 months-level 的调参过程。
    4. 关键实现细节 #

      1. @-tag 引用系统:多模态参考输入使用 @Image 1@Video 2 等 tag 在自然语言 prompt 中引用特定输入资产。这意味着 tokenizer 和 conditioning injection 需要支持动态数量的引用锚点,且每个锚点对应不同模态的 encoder 输出。实现上可能需要为每个 @-tag 维护独立的 cross-attention mask。
      2. Binaural audio 双声道输出:音频分支输出的是双声道(左右耳)信号而非单声道,这要求 audio latent 空间编码空间信息,且 cross-modal joint module 需要将视觉场景中的声源位置映射到立体声定位。
      3. Reproducibility & Ecosystem #

        • 训练代码开源:否。最接近的开源参考:DanceGRPO (arXiv:2505.07818) 提供 RL 算法;HunyuanVideo 1.5 / Wan 2.6 提供开源 AV 联合生成 baseline。
        • 社区复现:无。作为闭源商业模型,无已知的独立复现尝试。
        • 生产部署:已通过 Doubao / Jimeng / Volcano Engine 部署到亿级 DAU 产品。
        • 使用本文方法的后续模型:Seedance 系列后续版本(预期);DanceGRPO 作为 RL 组件已被其他视觉生成模型引用。