Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model

model 2512.13507
video-generationaudio-video-jointmmditdiffusion-transformer

§1 TL;DR #

Seedance 1.5 pro 基于 dual-branch MMDiT 实现 native 音视频联合生成,通过 multi-stage data pipeline + SFT + RLHF 后训练 + >10× distillation 加速,在中文语境的唇语同步、方言支持和镜头调度上建立竞争优势。

§2 痛点 / 方法 / 结果 #

Q1 痛点 #

视频生成已从视觉质量竞赛进入"实用生产工具"阶段,但音视频一致性仍是核心瓶颈:

Q2 方法 #

四大技术贡献:

贡献内容
Data FrameworkMulti-stage curation pipeline + captioning system (视频/音频双模态) + curriculum scheduling
ArchitectureDual-branch MMDiT: video branch + audio branch + cross-modal joint module
Post-trainingSFT on high-quality AV data → RLHF with multi-dimensional reward model (motion + aesthetics + audio fidelity);RLHF pipeline 3× training speed
AccelerationMulti-stage distillation (NFE reduction) + quantization + parallelism → >10× end-to-end

核心技术壁垒: Cross-modal joint module 在 MMDiT 架构内实现 deep interaction(非简单拼接或后处理),使音视频在 denoising 过程中逐步对齐。具体机制论文未披露。

Q3 结果 #

§3 架构 / 方法图 #

flowchart TB subgraph Training["Training Pipeline"] D["Multi-stage Data Curation"] --> PT["Video-Audio Joint Pre-training"] PT --> SFT["SFT on High-quality AV"] SFT --> RLHF["RLHF (multi-dim reward: motion + aesthetics + audio)"] end subgraph Architecture["Dual-Branch MMDiT"] TE["Text Encoder"] --> VB["Video Branch (DiT)"] TE --> AB["Audio Branch (DiT)"] VB <-->|"Cross-Modal Joint Module"| AB VB --> VD["Video Decoder"] AB --> AD["Audio Decoder"] end subgraph Inference["Inference Pipeline"] UP["User Prompt"] --> PE["Prompt Engineering"] PE --> TE2["Text Encoder"] TE2 --> DIT["Video-Audio Joint DiT"] DIT --> REF["Refiner"] REF --> OUT["Video + Audio Output"] end subgraph Accel["Acceleration (>10×)"] DIST["Multi-stage Distillation (NFE↓)"] QUANT["Quantization"] PAR["Parallelism"] end

§4 作者证明 #

无形式化作者证明 — 仅实证

论文为产品技术报告,无任何数学公式、算法伪代码或理论分析。所有 claims 基于人工评估(SeedVideoBench 1.5, proprietary benchmark)。

期望但缺失的形式化内容 #

期望现状
Audio representation (waveform? spectrogram? codec tokens?)未披露
Cross-modal attention 具体计算方式仅说 "deep cross-modal interaction"
Distillation loss function 和 NFE 曲线仅说 ">10×"
Model size / layer count / hidden dim外部信息约 4.5B, 论文未写
RLHF reward model architecture仅说 "multi-dimensional"
Inference latency breakdown未披露

评估可信度分析 #

  1. Benchmark proprietary: SeedVideoBench 1.5 未公开 — 无法第三方复现
  2. Human evaluators: "professional film directors" + "experts from film production" — 专业但主观
  3. Comparative claims 有选择性: 承认 Sora 2 expressiveness 更强 → 部分诚实
  4. No quantitative tables: 所有比较结果以 Figure (bar chart) 形式呈现,无 exact numbers
  5. Self-critique of competitors: 批评其他模型 "slow-motion trick" — 未提供证据
  6. 197 authors, no attribution: 最大规模作者列表但零贡献声明
  7. §5 实验与数据 #

    训练配置 #

    StageDetails
    Pre-trainingLarge-scale mixed-modality (video + audio + text); curriculum scheduling
    SFTHigh-quality audio-video pairs (dataset size undisclosed)
    RLHFMulti-dimensional reward model; 3× pipeline speed improvement via infra optimization
    DistillationMulti-stage, NFE reduction (references: Mean Flows, Hyper-SD, RayFlow)

    评估框架 (SeedVideoBench 1.5) #

    Video 维度: Motion Quality (stability + vividness), Prompt Following (intent-aligned), Visual Aesthetics

    Audio 维度: Audio Prompt Following, Audio Quality, Audio-Visual Sync, Audio Expressiveness

    关键比较结果 #

    Video (T2V, absolute 5-point Likert, Fig. 3):

    • Instruction following: Seedance 1.5 > Veo 3.1 > Kling 2.6 > Seedance 1.0
    • Motion dynamics: competitive with Veo 3.1

    Audio (GSB pairwise, Fig. 5-6):

    • vs Veo 3.1: Win on Chinese vocal, lip-sync; Lose on expressiveness
    • vs Kling 2.6: Win on AV synchronization
    • vs Sora 2: Lose on emotional expressiveness; Win on stability/control
    • vs Wan 2.5: Win overall

    Deployment #

    Platform: Volcano Engine (火山引擎), integrated into Doubao (豆包) and Jimeng (即梦) by Dec 2025.

    §6 论证链 #

    Step论据证据结论
    1Native joint generation > post-processingArchitecture: dual-branch MMDiT with cross-modal module (vs separate video + TTS)音视频在 denoising 中共同优化 → 更好时序对齐
    2Post-training 提升质量SFT + RLHF → human eval shows improvement over Seedance 1.0 (Fig. 3-4)证据: 相比前代全面提升
    3中文语境优势Dialect support (Sichuanese, Cantonese, etc.) + lip-sync accuracy超越 Veo 3.1 在中文生成
    4加速不损质量>10× acceleration claimed "while preserving model performance"实用部署可行 (具体数据未给)

    §7 实现 cross-reference #

    代码: 未开源。模型通过 Volcano Engine API 商业提供。

    关键实现细节:

    1. Multi-task pre-training: 同一模型同时支持 T2VA, I2VA, T2V, I2V — 通过 task token 或 conditioning 切换。
    2. RLHF 加速: "nearly 3× improvement in training speed" 通过基础设施优化(具体方法未披露,可能涉及 selective rollout、gradient accumulation 优化或 reward model 推理加速)。
    3. 参考实现 (related):

      • MMDiT backbone: Esser et al. 2024 (SD3)
      • Distillation: Mean Flows (Geng et al. 2025), Hyper-SD (Ren et al. 2025), RayFlow (Shao et al. 2025)
      • RLHF: Flow-GRPO (Liu et al. 2025), DanceGRPO (Xue et al. 2025), RewardDance (Wu et al. 2025)

      [实现未公开]