UniVideo: Unified Understanding, Generation, and Editing for Videos

algorithm 2510.08377
unified-multimodalvideo-generationvideo-editingdual-streamdiffusion-transformer

§1 TL;DR #

UniVideo 将冻结 MLLM(Qwen2.5VL-7B)与 MMDiT(HunyuanVideo-13B)组成双流架构,通过 MLP 连接器 + self-attention 对齐,以三阶段训练统一视频理解/生成/编辑,并展现图像编辑→视频编辑的零样本迁移能力。ICLR 2026。

§2 核心三问 #

Q1 痛点 #

统一多模态模型仅覆盖文本+图像;视频领域存在三个断层:(1) T2V / I2V / 视频编辑各需独立模型,(2) 纯文本编码器无法解析含多参考图+参考视频的复杂指令,(3) 编辑流水线依赖 mask 输入和任务特定模块(bias embedding / context adapter),扩展性差。

Figure 1: UniVideo task coverage

Paper Figure 1, verbatim (caption: "UniVideo is a unified system that can understand multi-modal instructions and generate multi-modal content").

Figure 1 展示 UniVideo 的全任务谱系——T2V、I2V、多 ID 上下文生成、ID 替换/删除/添加/风格迁移、视觉提示理解——所有任务共享同一模型、同一指令范式,无任务特定分支。

Q2 方法 #

双流架构:冻结 MLLM 提供语义理解流,MMDiT 提供视觉生成流。MLLM 最后一层 hidden states 经可训练 MLP($4\times$ 扩展)投射后,作为 token 参与 MMDiT 的 self-attention;与此并行,VAE 编码的视觉条件(参考图/视频)进入生成分支保留精细细节。三阶段训练:Stage 1 仅训 MLP(15K 步),Stage 2 微调 MLP+MMDiT(5K 步),Stage 3 多任务联合训练(15K 步)。全程 MLLM 冻结。

核心技术壁垒:MMDiT 的 self-attention 架构使 MLLM 特征自然地成为 token 序列的一部分参与联合注意力,仅需训练 MLP 连接器即可高效对齐——而 cross-attention 方案即使解冻整个 DiT 仍表现不佳。这一 self-attention > cross-attention 的经验发现是本文最难复现的洞察:它不是理论推导可得,而是需要系统性地对比三种架构变体(cross-attn DiT / cross-attn + learnable query / MMDiT self-attn),在相同 15K 步训练后观察文本跟随质量差异才能确认。

Q3 结果 #

问题形式化 #

目标函数:标准 rectified flow matching 损失(继承 HunyuanVideo):

$$\mathcal{L} = \mathbb{E}_{t,\epsilon}\bigl[\lVert \text{MMDiT}(z_t, c_{\text{MLLM}}, c_{\text{VAE}}, t) - \epsilon \rVert^2\bigr]$$

其中 $z_t$ 为时刻 $t$ 的噪声视频 latent,$c_{\text{MLLM}}$ 为 MLLM hidden states 经 MLP 投射后的语义条件,$c_{\text{VAE}}$ 为 VAE 编码的视觉条件(参考图/视频),timestep shift = 5.0。

假设

一步算法的输入/输出

§3 架构 / 方法图 #

Figure 2: UniVideo dual-stream architecture

Paper Figure 2, verbatim (caption: "UniVideo is a dual-stream model consisting of an MLLM for understanding and an MMDiT module for generation").

架构核心:左侧 MLLM(Qwen2.5VL-7B,冻结)接收文本/图像/视频 tokens,输出最后一层 hidden states;这些 states 经 MLP connector($4\times$ 维度扩展)映射到 MMDiT embedding 空间后进入 understanding stream。右侧 MMDiT(HunyuanVideo-13B)有两条并行分支——understanding branch 接收 MLLM 语义特征,generation branch 接收 VAE 编码的视觉 latents。两者通过 self-attention 层交互,实现语义锚定 + 高保真视觉细节的联合生成。

关键设计创新:self-attention 对齐 vs cross-attention #

Figure 4: Three design choices for MLLM-DiT alignment

Paper Figure 4, verbatim (caption: "We keep the MLLM fixed and vary the connector and DiT architecture across three variants").

论文系统对比三种 MLLM–DiT 对齐方案,均在 Stage 1 训练 15K 步、MLLM 冻结条件下评估。方案 (c) UniVideo MMDiT 仅训练 MLP 即实现最佳文本跟随,而 (a)(b) 即使解冻整个 DiT 仍不如。这是因为 self-attention 允许 MLLM tokens 与视频 tokens 双向交互,而 cross-attention 中 MLLM features 只能单向注入。

维度Before (cross-attention DiT)After (UniVideo MMDiT)
MLLM–DiT 交互单向:MLLM features 仅作 cross-attn key/value双向:MLLM tokens 参与 self-attn,与视频 tokens 互注意
可训参数MLP + 整个 DiT(数十亿参数)仅 MLP connector(~10M 参数)
文本跟随质量组合性 prompt 跟随差(Fig 5)高质量文本跟随,含复杂组合指令
容量瓶颈learnable query 变体将视频压缩到 512 tokens,信息损失所有 MLLM hidden states 直接参与,无压缩
训练效率需解冻 DiT 才能有效对齐MLP-only 训练即收敛

多条件统一 #

多个视觉条件(参考图 × N + 参考视频)经 VAE 编码后 padding 到统一形状,沿时间轴拼接,与噪声视频 latent 一起输入 MMDiT。3D 位置编码保持空间索引不变、仅递增时间维度,区分条件 latent 与噪声 latent——优于 Qwen2-VL 的 MRoPE(每引入新视觉输入偏移所有轴)。

两种推理变体 #

变体条件来源训练开销推理开销
UniVideo (hidden)MLLM 所有 image/video/text hidden states无需 MLLM 反向传播,内存友好条件 token 数随输入长度变化
UniVideo (query)512 learnable queries + text tokens需通过 MLLM 计算图反向传播固定 512 条件 tokens,推理更快

默认使用 (hidden) 变体。

§4 作者证明 #

无形式化作者证明 — 仅实证

本文无定理、命题或引理。所有核心主张均通过消融实验和基准比较支撑。

以下为理想情况下可期望的形式化保证:

  1. 对齐收敛性:在 MLLM 冻结条件下,MLP connector 的梯度下降是否保证收敛到使 MMDiT 输出与 ground truth 视频分布匹配的解?当前仅有 15K 步的经验收敛。
  2. 多任务不干扰:多任务联合训练是否在理论上保证各任务性能不低于单任务基线?Table 6 消融显示经验上成立,但无形式化界。
  3. 泛化界:从图像编辑到视频编辑的零样本迁移需要什么条件?论文未分析域差距或迁移学习理论。
  4. 6 项基础检查

    检查项结果
    核心数学是否 self-consistentN/A(无显式方程,仅标准 flow matching 损失)
    实验设置是否与方法匹配✓ 消融严格控制变量(冻结/解冻、架构变体)
    Baseline 是否公平✓ 含开源(VACE)和商业(Kling1.6, Pika2.2);但 UniVideo mask-free vs baseline mask-based 不完全对称
    度量与主张一致性✓ SC 度量直接衡量主体一致性主张
    消融是否充分✓ 架构设计(Fig 4)、多任务 vs 单任务(Table 6)、双流 vs 单流(Table 7)三组消融
    局限性是否坦诚✓ 论文承认 delete 任务 PSNR 落后、free-form 编辑成功率有限、motion 保持不足

    §5 实验与数据 #

    训练配方与规模 #

    Stage目的数据步数LR可训参数分辨率帧数
    1 — Connector Alignment对齐 MLLM→MMDiT 特征空间T2I $\mathcal{O}(40)$M + T2V $\mathcal{O}(10)$M + Img Recon $\mathcal{O}(40)$M15K$1\times10^{-4}$MLP only240–4801
    2 — Fine-tuning提升生成质量HQ T2I $\mathcal{O}(10)$K + HQ T2V $\mathcal{O}(10)$K5K$2\times10^{-5}$MLP + MMDiT480–8541–129
    3 — Multi-task统一多任务混合(见数据采样比)15K$2\times10^{-5}$MLP + MMDiT480–8541–129
    • 总训练步数仅 35K——对 20B 参数规模的模型而言极短
    • GPU hours: [论文未披露],仅提及 32× H100
    • MFU: [论文未披露]
    • 优化器:AdamW($\beta_1=0.9$, $\beta_2=0.95$, $\epsilon=10^{-15}$)
    • 稳定性技巧:gradient clip 1.0,EMA 0.9999(Stage 2–3),constant LR + 50 步 warmup
    • Diffusion timestep shift: 5.0

    Stage 3 数据采样比:T2I(HQ) 5% / T2V(HQ) 5% / I2V 10% / Image Editing 30% / Image Style Transfer 10% / In-Context Video Editing 10% / In-Context Video Gen 20% / In-Context Image Style Transfer 10%。图像编辑占比最高(30%),是视频编辑零样本迁移的数据基础。

    收敛与稳定性 #

    • 学习曲线形态:[论文未披露],但 35K 步内完成训练暗示快速收敛
    • 冻结 MLLM 是稳定性关键:防止理解能力的灾难性遗忘,同时为 connector 提供稳定梯度信号
    • 已知失败模式:偶尔过度编辑非目标区域(空间 grounding 不精确)
    • 超参数敏感性:[论文未披露]

    关键实验结果 #

    理解 + 生成基准(Table 3)

    模型类型MMB ↑MMMU ↑MM-Vet ↑VBench T2V ↑
    BAGEL统一85.055.367.2×
    OmniGen2统一79.153.161.8×
    Show-o2统一79.348.956.681.34
    Wan2.1视频生成×××84.70
    HunyuanVideo视频生成×××83.24
    UniVideo统一83.558.666.682.58

    UniVideo 是唯一同时在理解和视频生成上有竞争力分数的统一模型。理解分数 = 冻结 MLLM 原始水平,验证零退化。VBench 落后 Wan2.1 约 2 分,反映 HunyuanVideo 骨干与最新 T2V 模型的差距。

    上下文生成对比(Table 4, 人工评估)

    SettingModelSC ↑PF ↑Overall ↑
    Single RefVACE0.310.650.42
    Kling1.60.680.950.88
    Pika2.20.450.430.15
    UniVideo0.880.930.95
    Multi RefVACE0.480.530.48
    Kling1.60.730.450.95
    Pika2.20.710.480.43
    UniVideo0.810.750.85

    UniVideo 在 SC 上大幅领先(single-ref 超 Kling1.6 达 +0.20),证明双流设计在身份保持上的优势。Multi-ref 场景中 baseline 常对多 ID 指令理解失败,而 UniVideo 准确跟随。

    Figure 7: Qualitative comparison on in-context generation and editing

    Paper Figure 7, verbatim (caption: "Qualitative comparison of UniVideo with SoTA Task Specific Experts on In Context Generation and In Context Editing tasks").

    定性对比直观展示:VACE 在多 ID 场景下身份混淆严重,Pika2.2 动态过强但身份偏移,UniVideo 在保持参考 ID 一致性的同时生成合理动态。

    多任务 vs 单任务消融(Table 6)

    任务单任务 PF/SC/VQUniVideo PF/SC/VQΔ PF
    SingleID Gen0.85/0.83/0.930.93/0.88/0.95+0.08
    Insert Edit0.81/0.85/0.860.92/0.92/0.91+0.11
    Swap Edit0.53/0.78/0.680.91/0.85/0.85+0.38

    多任务训练全面提升,编辑任务受益最大(swap PF 从 0.53→0.91),得益于 30% image editing 数据的跨模态迁移。

    双流消融(Table 7):移除 MMDiT 视觉输入后 SC 从 0.78→0.18($\Delta=-0.60$),证明 VAE 编码的视觉信号对精细身份保持不可替代。

    零样本泛化 #

    Figure 8: Zero-shot generalization

    Paper Figure 8, verbatim (caption: "We demonstrate two types of generalization: (i) transfer from image editing to free-form video editing, (ii) novel task compositions").

    两类泛化均在训练未见的任务上展现:(i) 训练数据仅含 ID 编辑(swap/delete/add/style),但模型能执行材质更换、环境变换甚至绿幕抠像;(ii) 组合式编辑(同时删除 A 并替换 B)在训练中从未出现。这是统一训练的涌现能力。

    数据集分析 #

    数据组件任务来源规模
    T2I pretrainingT2I 生成内部$\mathcal{O}(40)$M
    T2V pretrainingT2V 生成内部$\mathcal{O}(10)$M
    Image reconstruction图像重建(Stage 1 bootstrap)T2I 数据复用$\mathcal{O}(40)$M
    HQ T2I/T2V高质量生成内部$\mathcal{O}(10)$K 各
    Image editing通用图像编辑FLUX Kontext + OmniEdit + ImgEdit + ShareGPT-4o$\mathcal{O}(1)$M
    In-context video dataID 编辑 + 生成SAM2 + video inpainting + ConceptMaster pipeline$\mathcal{O}(10)$K 各任务
    • 编辑数据程序化构建:SAM2 分割 → 视频修复 → 配对数据
    • 质量过滤:[论文未披露具体过滤策略]
    • 污染检查:[论文未披露]
    • 合成数据:风格迁移数据由 UNIC pipeline + T2V 生成

    §6 论证链 #

    Step论点支撑依赖
    1统一视频模型存在空白:现有方法仅覆盖文本+图像,视频被忽略§1 引用 20+ 篇 image-only 统一模型,无 video 对应物
    2MLLM 与 MMDiT 能力互补:前者擅长多模态推理,后者擅长高保真生成§1 对比 GPT-image-1(语义编码器不足以保持细节)和 learnable query 方案(容量瓶颈)Step 1
    3Self-attention 对齐优于 cross-attention:MMDiT 结构允许仅训练 MLP connector 即实现有效对齐§3.2 Fig 4–5, 三种架构变体的系统消融(15K 步同条件对比)Step 2
    4双流视觉输入(MLLM 语义 + VAE 细节)缺一不可Table 7 消融:移除 VAE 视觉输入后 SC 崩溃 0.78→0.18Step 3
    5多任务联合训练优于单任务:跨任务数据迁移(尤其 image editing→video editing)提升性能Table 6 消融:swap PF 0.53→0.91,多任务全面领先Step 4
    6统一框架产生涌现泛化:未训练的 free-form video editing 和 task composition 自然获得§3.4 Fig 8 定性展示 + §3.4.1 分析,归因于 30% image editing 数据 + 多任务共享表征Step 5

    §7 实现 cross-reference #

    代码开源https://github.com/KlingTeam/UniVideo

    骨干可用性

    • MLLM:Qwen2.5VL-7B — 完全开源(Hugging Face)
    • MMDiT:HunyuanVideo-T2V-13B — 完全开源(Hugging Face)

    核心技术壁垒详解:self-attention 对齐的有效性源于 MMDiT 架构的内在属性——在 joint self-attention 中,MLLM 语义 tokens 与视频噪声 tokens 可以双向注意,这比 cross-attention 的单向键值查询提供了更丰富的特征交互。但这一洞察的验证代价不低:需要同时准备 cross-attn DiT 和 MMDiT 两种骨干、构建可控变体实验、在相同数据/步数上对比——排除了 backbone 差异和数据量差异的混杂因素。

    关键实现细节

    1. 3D 位置编码而非 MRoPE:区分条件 latent 与噪声 latent 时,仅递增时间维度索引、保持空间索引不变。MRoPE 在引入新视觉输入时偏移所有轴,导致空间位置信息被破坏。这一细节在 §2.2 以一句话带过,但对多条件拼接的效果至关重要。
      1. Stage 1 图像重建任务:将 T2I 数据中的图像送入 MLLM、再由 MMDiT 经 MLLM 视觉特征重建原图。这个 bootstrap 任务确保 MLP connector 学到的映射能正确传递视觉信息,是 Stage 2/3 能快速收敛的前提。
      2. 可复现性评估 #

        • 训练代码:已开源
        • 模型权重:已开源
        • 训练数据:内部 T2I/T2V 数据集 未开源($\mathcal{O}(50)$M 级),是复现的主要瓶颈
        • 编辑数据构建 pipeline:描述了方法(SAM2 + inpainting)但 未发布 pipeline 代码
        • 社区复现报告:[暂无公开报告]
        • 生态影响:Kling Team 的后续工作可能内部沿用此架构;开源版本可供社区探索 MLLM+DiT 双流范式