UniVideo 将冻结 MLLM(Qwen2.5VL-7B)与 MMDiT(HunyuanVideo-13B)组成双流架构,通过 MLP 连接器 + self-attention 对齐,以三阶段训练统一视频理解/生成/编辑,并展现图像编辑→视频编辑的零样本迁移能力。ICLR 2026。
统一多模态模型仅覆盖文本+图像;视频领域存在三个断层:(1) T2V / I2V / 视频编辑各需独立模型,(2) 纯文本编码器无法解析含多参考图+参考视频的复杂指令,(3) 编辑流水线依赖 mask 输入和任务特定模块(bias embedding / context adapter),扩展性差。

Paper Figure 1, verbatim (caption: "UniVideo is a unified system that can understand multi-modal instructions and generate multi-modal content").
Figure 1 展示 UniVideo 的全任务谱系——T2V、I2V、多 ID 上下文生成、ID 替换/删除/添加/风格迁移、视觉提示理解——所有任务共享同一模型、同一指令范式,无任务特定分支。
双流架构:冻结 MLLM 提供语义理解流,MMDiT 提供视觉生成流。MLLM 最后一层 hidden states 经可训练 MLP($4\times$ 扩展)投射后,作为 token 参与 MMDiT 的 self-attention;与此并行,VAE 编码的视觉条件(参考图/视频)进入生成分支保留精细细节。三阶段训练:Stage 1 仅训 MLP(15K 步),Stage 2 微调 MLP+MMDiT(5K 步),Stage 3 多任务联合训练(15K 步)。全程 MLLM 冻结。
核心技术壁垒:MMDiT 的 self-attention 架构使 MLLM 特征自然地成为 token 序列的一部分参与联合注意力,仅需训练 MLP 连接器即可高效对齐——而 cross-attention 方案即使解冻整个 DiT 仍表现不佳。这一 self-attention > cross-attention 的经验发现是本文最难复现的洞察:它不是理论推导可得,而是需要系统性地对比三种架构变体(cross-attn DiT / cross-attn + learnable query / MMDiT self-attn),在相同 15K 步训练后观察文本跟随质量差异才能确认。
目标函数:标准 rectified flow matching 损失(继承 HunyuanVideo):
$$\mathcal{L} = \mathbb{E}_{t,\epsilon}\bigl[\lVert \text{MMDiT}(z_t, c_{\text{MLLM}}, c_{\text{VAE}}, t) - \epsilon \rVert^2\bigr]$$
其中 $z_t$ 为时刻 $t$ 的噪声视频 latent,$c_{\text{MLLM}}$ 为 MLLM hidden states 经 MLP 投射后的语义条件,$c_{\text{VAE}}$ 为 VAE 编码的视觉条件(参考图/视频),timestep shift = 5.0。
假设:
一步算法的输入/输出:

Paper Figure 2, verbatim (caption: "UniVideo is a dual-stream model consisting of an MLLM for understanding and an MMDiT module for generation").
架构核心:左侧 MLLM(Qwen2.5VL-7B,冻结)接收文本/图像/视频 tokens,输出最后一层 hidden states;这些 states 经 MLP connector($4\times$ 维度扩展)映射到 MMDiT embedding 空间后进入 understanding stream。右侧 MMDiT(HunyuanVideo-13B)有两条并行分支——understanding branch 接收 MLLM 语义特征,generation branch 接收 VAE 编码的视觉 latents。两者通过 self-attention 层交互,实现语义锚定 + 高保真视觉细节的联合生成。

Paper Figure 4, verbatim (caption: "We keep the MLLM fixed and vary the connector and DiT architecture across three variants").
论文系统对比三种 MLLM–DiT 对齐方案,均在 Stage 1 训练 15K 步、MLLM 冻结条件下评估。方案 (c) UniVideo MMDiT 仅训练 MLP 即实现最佳文本跟随,而 (a)(b) 即使解冻整个 DiT 仍不如。这是因为 self-attention 允许 MLLM tokens 与视频 tokens 双向交互,而 cross-attention 中 MLLM features 只能单向注入。
| 维度 | Before (cross-attention DiT) | After (UniVideo MMDiT) |
|---|---|---|
| MLLM–DiT 交互 | 单向:MLLM features 仅作 cross-attn key/value | 双向:MLLM tokens 参与 self-attn,与视频 tokens 互注意 |
| 可训参数 | MLP + 整个 DiT(数十亿参数) | 仅 MLP connector(~10M 参数) |
| 文本跟随质量 | 组合性 prompt 跟随差(Fig 5) | 高质量文本跟随,含复杂组合指令 |
| 容量瓶颈 | learnable query 变体将视频压缩到 512 tokens,信息损失 | 所有 MLLM hidden states 直接参与,无压缩 |
| 训练效率 | 需解冻 DiT 才能有效对齐 | MLP-only 训练即收敛 |
多个视觉条件(参考图 × N + 参考视频)经 VAE 编码后 padding 到统一形状,沿时间轴拼接,与噪声视频 latent 一起输入 MMDiT。3D 位置编码保持空间索引不变、仅递增时间维度,区分条件 latent 与噪声 latent——优于 Qwen2-VL 的 MRoPE(每引入新视觉输入偏移所有轴)。
| 变体 | 条件来源 | 训练开销 | 推理开销 |
|---|---|---|---|
| UniVideo (hidden) | MLLM 所有 image/video/text hidden states | 无需 MLLM 反向传播,内存友好 | 条件 token 数随输入长度变化 |
| UniVideo (query) | 512 learnable queries + text tokens | 需通过 MLLM 计算图反向传播 | 固定 512 条件 tokens,推理更快 |
默认使用 (hidden) 变体。
无形式化作者证明 — 仅实证
本文无定理、命题或引理。所有核心主张均通过消融实验和基准比较支撑。
以下为理想情况下可期望的形式化保证:
6 项基础检查:
| 检查项 | 结果 |
|---|---|
| 核心数学是否 self-consistent | N/A(无显式方程,仅标准 flow matching 损失) |
| 实验设置是否与方法匹配 | ✓ 消融严格控制变量(冻结/解冻、架构变体) |
| Baseline 是否公平 | ✓ 含开源(VACE)和商业(Kling1.6, Pika2.2);但 UniVideo mask-free vs baseline mask-based 不完全对称 |
| 度量与主张一致性 | ✓ SC 度量直接衡量主体一致性主张 |
| 消融是否充分 | ✓ 架构设计(Fig 4)、多任务 vs 单任务(Table 6)、双流 vs 单流(Table 7)三组消融 |
| 局限性是否坦诚 | ✓ 论文承认 delete 任务 PSNR 落后、free-form 编辑成功率有限、motion 保持不足 |
| Stage | 目的 | 数据 | 步数 | LR | 可训参数 | 分辨率 | 帧数 |
|---|---|---|---|---|---|---|---|
| 1 — Connector Alignment | 对齐 MLLM→MMDiT 特征空间 | T2I $\mathcal{O}(40)$M + T2V $\mathcal{O}(10)$M + Img Recon $\mathcal{O}(40)$M | 15K | $1\times10^{-4}$ | MLP only | 240–480 | 1 |
| 2 — Fine-tuning | 提升生成质量 | HQ T2I $\mathcal{O}(10)$K + HQ T2V $\mathcal{O}(10)$K | 5K | $2\times10^{-5}$ | MLP + MMDiT | 480–854 | 1–129 |
| 3 — Multi-task | 统一多任务 | 混合(见数据采样比) | 15K | $2\times10^{-5}$ | MLP + MMDiT | 480–854 | 1–129 |
Stage 3 数据采样比:T2I(HQ) 5% / T2V(HQ) 5% / I2V 10% / Image Editing 30% / Image Style Transfer 10% / In-Context Video Editing 10% / In-Context Video Gen 20% / In-Context Image Style Transfer 10%。图像编辑占比最高(30%),是视频编辑零样本迁移的数据基础。
理解 + 生成基准(Table 3):
| 模型 | 类型 | MMB ↑ | MMMU ↑ | MM-Vet ↑ | VBench T2V ↑ |
|---|---|---|---|---|---|
| BAGEL | 统一 | 85.0 | 55.3 | 67.2 | × |
| OmniGen2 | 统一 | 79.1 | 53.1 | 61.8 | × |
| Show-o2 | 统一 | 79.3 | 48.9 | 56.6 | 81.34 |
| Wan2.1 | 视频生成 | × | × | × | 84.70 |
| HunyuanVideo | 视频生成 | × | × | × | 83.24 |
| UniVideo | 统一 | 83.5 | 58.6 | 66.6 | 82.58 |
UniVideo 是唯一同时在理解和视频生成上有竞争力分数的统一模型。理解分数 = 冻结 MLLM 原始水平,验证零退化。VBench 落后 Wan2.1 约 2 分,反映 HunyuanVideo 骨干与最新 T2V 模型的差距。
上下文生成对比(Table 4, 人工评估):
| Setting | Model | SC ↑ | PF ↑ | Overall ↑ |
|---|---|---|---|---|
| Single Ref | VACE | 0.31 | 0.65 | 0.42 |
| Kling1.6 | 0.68 | 0.95 | 0.88 | |
| Pika2.2 | 0.45 | 0.43 | 0.15 | |
| UniVideo | 0.88 | 0.93 | 0.95 | |
| Multi Ref | VACE | 0.48 | 0.53 | 0.48 |
| Kling1.6 | 0.73 | 0.45 | 0.95 | |
| Pika2.2 | 0.71 | 0.48 | 0.43 | |
| UniVideo | 0.81 | 0.75 | 0.85 |
UniVideo 在 SC 上大幅领先(single-ref 超 Kling1.6 达 +0.20),证明双流设计在身份保持上的优势。Multi-ref 场景中 baseline 常对多 ID 指令理解失败,而 UniVideo 准确跟随。

Paper Figure 7, verbatim (caption: "Qualitative comparison of UniVideo with SoTA Task Specific Experts on In Context Generation and In Context Editing tasks").
定性对比直观展示:VACE 在多 ID 场景下身份混淆严重,Pika2.2 动态过强但身份偏移,UniVideo 在保持参考 ID 一致性的同时生成合理动态。
多任务 vs 单任务消融(Table 6):
| 任务 | 单任务 PF/SC/VQ | UniVideo PF/SC/VQ | Δ PF |
|---|---|---|---|
| SingleID Gen | 0.85/0.83/0.93 | 0.93/0.88/0.95 | +0.08 |
| Insert Edit | 0.81/0.85/0.86 | 0.92/0.92/0.91 | +0.11 |
| Swap Edit | 0.53/0.78/0.68 | 0.91/0.85/0.85 | +0.38 |
多任务训练全面提升,编辑任务受益最大(swap PF 从 0.53→0.91),得益于 30% image editing 数据的跨模态迁移。
双流消融(Table 7):移除 MMDiT 视觉输入后 SC 从 0.78→0.18($\Delta=-0.60$),证明 VAE 编码的视觉信号对精细身份保持不可替代。

Paper Figure 8, verbatim (caption: "We demonstrate two types of generalization: (i) transfer from image editing to free-form video editing, (ii) novel task compositions").
两类泛化均在训练未见的任务上展现:(i) 训练数据仅含 ID 编辑(swap/delete/add/style),但模型能执行材质更换、环境变换甚至绿幕抠像;(ii) 组合式编辑(同时删除 A 并替换 B)在训练中从未出现。这是统一训练的涌现能力。
| 数据组件 | 任务 | 来源 | 规模 |
|---|---|---|---|
| T2I pretraining | T2I 生成 | 内部 | $\mathcal{O}(40)$M |
| T2V pretraining | T2V 生成 | 内部 | $\mathcal{O}(10)$M |
| Image reconstruction | 图像重建(Stage 1 bootstrap) | T2I 数据复用 | $\mathcal{O}(40)$M |
| HQ T2I/T2V | 高质量生成 | 内部 | $\mathcal{O}(10)$K 各 |
| Image editing | 通用图像编辑 | FLUX Kontext + OmniEdit + ImgEdit + ShareGPT-4o | $\mathcal{O}(1)$M |
| In-context video data | ID 编辑 + 生成 | SAM2 + video inpainting + ConceptMaster pipeline | $\mathcal{O}(10)$K 各任务 |
| Step | 论点 | 支撑 | 依赖 |
|---|---|---|---|
| 1 | 统一视频模型存在空白:现有方法仅覆盖文本+图像,视频被忽略 | §1 引用 20+ 篇 image-only 统一模型,无 video 对应物 | — |
| 2 | MLLM 与 MMDiT 能力互补:前者擅长多模态推理,后者擅长高保真生成 | §1 对比 GPT-image-1(语义编码器不足以保持细节)和 learnable query 方案(容量瓶颈) | Step 1 |
| 3 | Self-attention 对齐优于 cross-attention:MMDiT 结构允许仅训练 MLP connector 即实现有效对齐 | §3.2 Fig 4–5, 三种架构变体的系统消融(15K 步同条件对比) | Step 2 |
| 4 | 双流视觉输入(MLLM 语义 + VAE 细节)缺一不可 | Table 7 消融:移除 VAE 视觉输入后 SC 崩溃 0.78→0.18 | Step 3 |
| 5 | 多任务联合训练优于单任务:跨任务数据迁移(尤其 image editing→video editing)提升性能 | Table 6 消融:swap PF 0.53→0.91,多任务全面领先 | Step 4 |
| 6 | 统一框架产生涌现泛化:未训练的 free-form video editing 和 task composition 自然获得 | §3.4 Fig 8 定性展示 + §3.4.1 分析,归因于 30% image editing 数据 + 多任务共享表征 | Step 5 |
代码开源:https://github.com/KlingTeam/UniVideo
骨干可用性:
核心技术壁垒详解:self-attention 对齐的有效性源于 MMDiT 架构的内在属性——在 joint self-attention 中,MLLM 语义 tokens 与视频噪声 tokens 可以双向注意,这比 cross-attention 的单向键值查询提供了更丰富的特征交互。但这一洞察的验证代价不低:需要同时准备 cross-attn DiT 和 MMDiT 两种骨干、构建可控变体实验、在相同数据/步数上对比——排除了 backbone 差异和数据量差异的混杂因素。
关键实现细节: