Meituan LongCat Team, Xunliang Cai, Qilong Huang, Zhuoliang Kang, Hongyu Li, Shijun Liang, Liya Ma, Siyu Ren, Xiaoming Wei, Rixu Xie, Tong Zhang | 2025-10 | https://arxiv.org/abs/2510.22200
美团提出将 GRPO 适配到 flow matching 视频生成,理论证明其等价于随机噪声搜索($dR/dv_\theta \approx -\frac{3}{2}\hat{A}\epsilon$),由此导出固定 SDE 时间步、loss 重加权、max group std 三项改进;结合多 reward 加权训练防止 reward hacking,加上 coarse-to-fine + 3D Block Sparse Attention 实现 12.3× 推理加速。13.6B 稠密 DiT 模型在 VBench 2.0 开源第一、Commonsense 全场最佳。
三个交叉痛点驱动本工作:
核心方法:将 GRPO 解释为 flow matching 上的随机噪声搜索,建立理论框架后推导出三项关键改进,并结合多 reward 训练和高效推理策略。
核心技术壁垒:GRPO 与 flow matching velocity field 之间的理论联系。论文在 Appendix A.1 证明 GRPO 的 policy gradient 等价于用 advantage-weighted noise 做 reward 对 velocity field 的零阶梯度估计:$\frac{dR}{dv_\theta} \approx -\frac{3}{2}\hat{A}_t^i \cdot \epsilon$。这一洞察是所有后续设计(固定时间步、重加权公式、max group std)的理论支撑——没有它,这些选择都缺乏原则性依据,需要大量经验搜索。
Before vs After(相对于标准 GRPO for diffusion):
| 维度 | Before (标准 GRPO) | After (LongCat GRPO) |
|---|---|---|
| SDE 采样 | 所有时间步都注入 SDE 噪声 | 仅单个随机时间步 $t' \sim \mathcal{U}(0, T'-1)$ 注入 SDE,其余用 ODE |
| 初始噪声 | 每个 sample 独立采样 | 同一 group 共享初始噪声 $\boldsymbol{x}_T$ |
| 优势归一化 | Per-group std $\sigma_k^j$ | Max group std $\sigma_{\max,k} = \max(\{\sigma_k^j\}_{j=1}^B)$ |
| Loss 权重 | 均匀 | 时间步相关重加权 $\lambda_{\text{policy}} = \sqrt{t/(\Delta t(1-t))}$ |
| Reward | 单一 | 多 reward 加权 $\hat{A}_{\text{total}} = \sum_k w_k \hat{A}_k$ |
| 理论基础 | 无(启发式适配) | 随机噪声搜索解释(Appendix A.1) |
目标函数:优化 flow matching 模型的 GRPO objective:
$$\mathcal{L}_{\text{total}} = \frac{1}{B \cdot G}\sum_{j=1}^{B}\sum_{i=1}^{G}\left(\mathcal{L}_{\text{policy}}^{i} - \mathcal{L}_{\text{KL}}^{i}\right)$$
其中 policy loss 和 KL loss 分别为:
$$\mathcal{L}_{\text{policy}}^{i} = \lambda_{\text{policy}} \cdot r_{t'}^{i}(\theta) \cdot \hat{A}_{\text{total}}^{i}$$
$$\mathcal{L}_{\text{KL}}^{i} = \beta \lambda_{\text{KL}} \cdot D_{\text{KL}}(\pi_\theta \| \pi_{\text{ref}})$$
假设:(1) shared initial noise $\boldsymbol{x}_T$ 保证 group 内差异仅源于 SDE 噪声;(2) 单时间步 SDE 足以提供有效探索($T' < T$ 限制在早期时间步);(3) multi-reward 各维度近似独立可分。
输入/输出:一步 GRPO 消耗 $B$ 个 prompt + 每个 prompt 生成 $G$ 个完整 ODE/SDE 轨迹 + $n$ 个 reward model 的评分,产出 $\theta$ 的梯度更新。
所有视频生成任务统一为条件视频续写:条件帧 $X_{\text{cond}} \in \mathbb{R}^{B \times N_{\text{cond}} \times H \times W \times C}$(timestep 固定为 0)与噪声帧 $X_{\text{noisy}}$(timestep $\sim [0,1]$)沿时间轴拼接。T2V 令 $N_{\text{cond}}=0$,I2V 令 $N_{\text{cond}}=1$,VC 令 $N_{\text{cond}} > 1$。
Block Causal Attention 确保条件 token 的更新独立于噪声 token:
$$X_{\text{cond}} = \mathrm{Attention}(Q_{\text{cond}}, K_{\text{cond}}, V_{\text{cond}})$$
$$X_{\text{noisy}} = \mathrm{Attention}(Q_{\text{noisy}}, [K_{\text{cond}}, K_{\text{noisy}}], [V_{\text{cond}}, V_{\text{noisy}}])$$
这一设计使条件帧的 KV 可在所有采样步缓存复用,对长视频生成(条件帧多)的效率至关重要。条件 token 不参与 cross-attention 计算。

Paper's Figure (BSA mechanism): 将视频 latent 分为 3D block,计算 block 级相似度分数,选择 top-r 个 key blocks,仅在选中 blocks 内计算 attention。
BSA 将 latent 按空间-时间局部性重排为 3D block(默认 chunk shape $[4, 4, 8]$),计算 query block 与所有 key blocks 的 average-pooled 相似度,选择 top-$r$ 个 key blocks($r = (1 - \text{sparsity}) \times N_k$),仅在选中范围内执行标准 attention。93.75% sparsity 意味着只保留 1/16 的 key blocks,attention 计算量降至 dense 的 <10%。选择策略支持 Top-K、CDF 阈值及组合模式。Triton 内核实现了变长 block 选择的 online softmax,前向/反向均有优化路径。

Paper's Figure (Training overview): 展示三阶段训练流程——渐进式预训练 → SFT → Base Model,然后分三条 LoRA 分支独立训练 RLHF、Refinement Expert、Distillation。
训练采用模块化 LoRA 设计:在 base model(渐进式预训练 + SFT)上独立训练三个 LoRA 模块——RLHF LoRA(多 reward GRPO,500 iter)、Refinement Expert LoRA(480p→720p 精细化 + BSA)、Distillation LoRA(CFG + CM 蒸馏,减少采样步数)。这种设计使各模块可独立迭代,并支持灵活组合。
核心算法流程:(1) 同一 prompt 的 G 个样本共享初始噪声 $\boldsymbol{x}_T$;(2) 随机选择单个关键时间步 $t' \sim \mathcal{U}(0, T'-1)$,仅在此步注入 SDE 噪声(截断调度 $\sigma_t$),其余步用 ODE;(3) 解码后计算多个 reward,每个 reward 独立归一化后加权聚合为 $\hat{A}_{\text{total}}$;(4) 应用时间步相关重加权 $\lambda_{\text{policy}}, \lambda_{\text{KL}}$ 后更新参数。
三阶段推理流水线:
| Stage | 方法 | 分辨率 | FPS | LoRA | BSA | 步数 |
|---|---|---|---|---|---|---|
| 1 | Base T2V/I2V | 480p | 15 | — | No | 50 (or 16 w/ distill) |
| 2 | Distillation | 480p | 15 | cfg_step_lora | No | 8-16 |
| 3 | Refinement | 720p | 30 | refinement_lora | Yes | 5 |
Stage 1 输出经三线性上采样后加噪至 $t_{\text{thresh}} = 0.5$,由 Refinement Expert LoRA 在仅 5 步内去噪至 720p@30fps。对于 I2V/VC,原始高分辨率条件帧在 Stage 3 与上采样输出拼接,确保条件帧保真度。
| 符号 | 含义 |
|---|---|
| $\theta$ | Policy(DiT)参数 |
| $\pi_\theta, \pi_{\text{ref}}$ | 当前策略 / 冻结参考策略 |
| $v_\theta(\boldsymbol{x}_t, t, c)$ | Flow matching velocity field |
| $\hat{A}_{k,t'}^i$ | 样本 $i$ 在时间步 $t'$ 的 reward $k$ 相对优势 |
| $\hat{A}_{\text{total}}^i$ | 多 reward 加权总优势 |
| $\epsilon$ | SDE 注入噪声 |
| $t'$ | 关键(固定)时间步,$t' \sim \mathcal{U}(0, T'-1)$ |
| $T, T'$ | 总时间步 / SDE 范围上界($T' < T$) |
| $G, B$ | 每组样本数 / batch 中 prompt 数 |
| $R_k, w_k$ | 第 $k$ 个 reward model / 其权重 |
| $\sigma_{\max,k}$ | reward $k$ 在 batch 内的最大组标准差 |
| $\lambda_{\text{policy}}, \lambda_{\text{KL}}$ | 时间步相关重加权系数 |
| $\beta$ | KL 惩罚系数 |
| $r_{t'}^i(\theta)$ | 策略比率(importance sampling ratio) |
Eq.1 — Block Causal Attention (条件): $X_{\text{cond}} = \mathrm{Attention}(Q_{\text{cond}}, K_{\text{cond}}, V_{\text{cond}})$。条件 token 仅自我注意,不受噪声 token 影响,保证条件信息的无损传递和 KV 缓存的可行性。
Eq.2 — Block Causal Attention (噪声): $X_{\text{noisy}} = \mathrm{Attention}(Q_{\text{noisy}}, [K_{\text{cond}}, K_{\text{noisy}}], [V_{\text{cond}}, V_{\text{noisy}}])$。噪声 token 可看到全部上下文(条件+噪声),使得生成帧与条件帧保持一致。
Eq.3 — Reweighted policy gradient: $\nabla_\theta \mathcal{L}_{\text{policy, reweighted}}(\theta) = -\frac{3}{2}\hat{A}_t^i \cdot \epsilon \cdot \nabla_\theta v_\theta$。GRPO 的 policy gradient 分解为 advantage-weighted noise 乘以 velocity field 对参数的 Jacobian——物理上,噪声 $\epsilon$ 提供了探索方向,$\hat{A}$ 提供了 reward 反馈的幅度和符号。
Eq.4 — Chain rule decomposition: $\frac{dR}{d\theta} = \frac{dR}{dv_\theta} \cdot \frac{dv_\theta}{d\theta}$。将 reward 对参数的梯度分解为 reward 对 velocity field 的敏感度(前者由 GRPO 零阶估计)和 velocity field 对参数的标准梯度(后者由反向传播计算)。
Eq.5 — Stochastic noise search: $\frac{dR}{dv_\theta} \approx -\frac{3}{2}\hat{A}_t^i \cdot \epsilon$。核心理论结果——GRPO 用 advantage-weighted noise 做了 reward 关于 velocity field 的零阶梯度估计,类似于进化策略中用噪声-reward 相关性估计梯度。
重加权系数: $\lambda_{\text{policy}} = \sqrt{\frac{t'/T}{\Delta(t'/T)(1-t'/T)}}$, $\lambda_{\text{KL}} = \frac{t'/T}{\Delta(t'/T)(1-t'/T)}$。消除 flow matching 中不同时间步 SNR 差异导致的梯度幅度不均——中间时间步的贡献最大,边界时间步(纯噪声或纯信号)的贡献被压制。
| # | 检查 | 结论 | |
|---|---|---|---|
| 1 | 量纲一致性:$\nabla_\theta \mathcal{L} = -\frac{3}{2}\hat{A} \cdot \epsilon \cdot \nabla_\theta v_\theta$——$\hat{A}$ 无量纲标量,$\epsilon$ 与 latent 同维,$\nabla_\theta v_\theta$ 为 velocity-to-parameter Jacobian | ✓ 量纲匹配 | |
| 2 | 零梯度退化:当 group 内所有 $G$ 个样本 reward 相同,$\hat{A}_t^i = 0$,梯度消失——正确,无信息时不更新 | ✓ | |
| 3 | 符号一致性:高 reward → 正 $\hat{A}$ → policy gradient 推动 $\theta$ 沿增大该方向 velocity 的方向更新 | ✓ | |
| 4 | 边界 $t \to 0$:$\lambda_{\text{policy}} \to 0$,近纯信号时间步几乎不贡献梯度——合理,因为此时 perturbation 对输出影响极小 | ✓ | |
| 5 | 边界 $t \to T$:$\lambda_{\text{policy}} \to \sqrt{1/\Delta}$(常数),纯噪声时间步获得有限权重 | ✓ | |
| 6 | KL 非负性:$D_{\text{KL}}(\pi_\theta \ | \pi_{\text{ref}}) \geq 0$,KL 惩罚始终非负,确保不会奖励偏离参考策略 | ✓ |
论文在 Appendix A.1 给出了完整的理论框架:
命题(非正式):在 flow matching 模型中,GRPO 的 reweighted policy gradient 等价于以 advantage-weighted noise 为梯度估计器的零阶优化,即 $\frac{dR}{dv_\theta} \approx -\frac{3}{2}\hat{A}_t^i \cdot \epsilon$。
假设:(1) velocity field $v_\theta$ 关于 $\theta$ 可微;(2) reward $R$ 关于生成结果 $\boldsymbol{x}_0$ 可微(但不需要关于轨迹可微——这正是零阶方法的优势);(3) SDE 噪声 $\epsilon \sim \mathcal{N}(0, I)$。
假设失效场景:(a) reward 高度非平滑(如 binary 判别器)时,零阶估计方差极大,$G$ 需要很大;(b) 当 group size $G$ 过小时,$\hat{A}$ 的估计本身噪声很大。
$$\mathcal{L}_{\text{total}} = \underbrace{\lambda_{\text{policy}} \cdot r_{t'}(\theta) \cdot \hat{A}_{\text{total}}}_{\text{policy: 推动高 reward 方向}} - \underbrace{\beta \lambda_{\text{KL}} \cdot D_{\text{KL}}(\pi_\theta \| \pi_{\text{ref}})}_{\text{KL: 约束不偏离参考策略过远}}$$
| Stage | 任务 | 分辨率 | LR | Iterations | 特殊技术 |
|---|---|---|---|---|---|
| Pre-train 1 | T2I | 256p | 1e-4 | 285k | 图像预训练 |
| Pre-train 2 | T2I + T2V | 256p × 93f | 1e-4 | 140k | 引入视频 |
| Pre-train 3 | T2I + T2V + I2V + VC | 256p × 93f | 5e-5 | 164k | 多任务统一 |
| Pre-train 4 | 同上 | 480p × 93f | 5e-5 | 36k | 提升分辨率 |
| Pre-train 5 | 同上 | 480p + 720p × 93f | 2e-5 | 53k | 混合分辨率 |
| SFT | curated HQ data | 480p | 1e-5 | 7.5k | 含镜头运动/视觉风格专项数据 |
| GRPO | T2V only | 480p | 1e-4 | 500 | 多 reward, group size 4, 64 prompts/step |
| Distillation | CFG + CM | — | — | 2k + 3k | 50步 → 16步 |
| Refinement | 480p→720p | 720p | — | 500 + 500 | full attn → BSA (93.75% sparsity) |
总预训练约 678k iterations。GRPO 仅需 500 iterations 即可有效收敛——归功于理论框架指导的设计。
GPU hours / MFU: [论文未明确披露总 GPU hours]。训练使用 DeepSpeed-Zero2 + Context Parallelism + Ring Attention + Activation Checkpointing,MFU 33-38%。
关键超参:GRPO group size $G=4$,KL 系数 $\beta$ [论文未披露具体值],SDE 范围 $T' < T$(截断至早期时间步),refinement $t_{\text{thresh}} = 0.5$。
T2V MOS 评测(内部基准,5 分制):
| 模型 | 可用性 | 架构 | 激活参数 | Text-Align↑ | Visual Q↑ | Motion Q↑ | Overall↑ |
|---|---|---|---|---|---|---|---|
| Veo3 | 闭源 | — | — | 3.99 | 3.23 | 3.86 | 3.48 |
| PixVerse-V5 | 闭源 | — | — | 3.81 | 3.13 | 3.81 | 3.36 |
| Wan 2.2-A14B | 开源 | MoE | 14B | 3.70 | 3.26 | 3.78 | 3.35 |
| LongCat-Video | 开源 | Dense | 13.6B | 3.76 | 3.25 | 3.74 | 3.38 |
LongCat-Video 在 13.6B 稠密参数下 overall quality 3.38 优于 Wan 2.2(28B 参数、14B 激活的 MoE)。Visual Quality 3.25 几乎追平 Wan 2.2 的 3.26,并超过 Veo3 的 3.23——商业闭源模型在视觉质量维度反而低于开源模型。
I2V MOS 评测:
| 模型 | Image-Align↑ | Text-Align↑ | Visual Q↑ | Motion Q↑ | Overall↑ |
|---|---|---|---|---|---|
| Seedance 1.0 | 4.12 | 3.70 | 3.22 | 3.77 | 3.35 |
| Hailuo-02 | 4.18 | 3.85 | 3.18 | 3.80 | 3.27 |
| Wan 2.2-A14B | 4.18 | 3.33 | 3.23 | 3.79 | 3.26 |
| LongCat-Video | 4.04 | 3.49 | 3.27 | 3.59 | 3.17 |
I2V 是明显弱项:Image-Alignment 4.04 落后 4.18(差距 3.3%),Motion Quality 3.59 落后 3.77-3.80(差距 5-6%)。值得注意的是 GRPO 仅在 T2V 任务上训练,无 I2V/VC 专项 reward——这可能是 I2V 弱于的结构性原因。
推理加速消融:
| 配置 | LCM | C2F | BSA | 步数 | 延迟 | 加速比 |
|---|---|---|---|---|---|---|
| Baseline | ✗ | ✗ | ✗ | 50 | 1429.5s | 1.0× |
| +LCM | ✓ | ✗ | ✗ | 16 | 244.6s | 5.8× |
| +C2F | ✓ | ✓ | ✗ | 16/5 | 135.3s | 10.6× |
| +BSA | ✓ | ✓ | ✓ | 16/5 | 116.5s | 12.3× |
| 189f +BSA | ✓ | ✓ | ✓ | 16/5 | 142.0s | 10.1× |
LCM 蒸馏贡献最大加速(5.8×),C2F 额外带来 1.8×,BSA 再加 1.2×。帧数翻倍(93f → 189f)时 BSA 的相对贡献更显著(因为 dense attention 的二次增长被截断)。
VBench 2.0 结果:
| 模型 | Creativity | Commonsense | Controllability | Human Fidelity | Physics | Total |
|---|---|---|---|---|---|---|
| HunyuanVideo | 41.84% | 63.44% | 28.60% | 82.41% | 60.20% | 55.30% |
| Wan2.1 | 55.25% | 63.98% | 37.32% | 81.60% | 62.84% | 60.20% |
| Vidu Q1 | 56.54% | 65.98% | 38.13% | 81.24% | 71.63% | 62.70% |
| Veo3 | 60.85% | 69.48% | 47.04% | 87.72% | 69.35% | 66.72% |
| LongCat-Video | 54.73% | 70.94% | 44.79% | 80.20% | 59.92% | 62.11% |
Commonsense 70.94% 是全场最高——超越 Veo3 的 69.48%。这表明通过原生视频续写预训练和多 reward GRPO,模型获得了较强的物理常识理解能力。

Paper's Figure: 展示 LongCat-Video 在不同场景的长视频生成(分钟级,带时间戳)和交互式视频续写(带分段标注)结果。
长视频示例(驾驶、滑板、芭蕾)跨越 1-4 分钟时间尺度,帧间保持一致的颜色和风格——验证了原生 VC 预训练对时间一致性的有效性。交互式视频示例展示了多步条件续写能力,每 5-6 秒一个语义段落,动作衔接流畅。

Paper's Figure: 更多长视频生成结果,包括高速公路驾驶(第一人称)、山路滑板、芭蕾独舞等场景,以及厨房、办公室、浴室等日常交互场景。
驾驶场景在 3 分钟内保持了一致的天气、光照和道路特征。芭蕾场景中舞者服装和舞台布局跨越 4 分钟保持稳定。这些结果直接支撑了 §2 Q3 中"无颜色漂移的分钟级生成"的核心主张。

Paper's Figure: Motion Quality reward 模型的验证损失曲线。Grayscale(灰色线)训练后 ~800 步开始剧烈上升(过拟合),RGB(红色线)上升延迟但同样出现过拟合趋势。
这张图支撑了 MQ reward 用灰度训练的设计选择:灰度训练虽然也会最终过拟合,但相比 RGB 训练延迟了过拟合的发生(~800 步 vs ~600 步),说明去除颜色信息减少了 reward model 可利用的 shortcut 特征。选择灰度训练的时间点(~800 步以前)可获得更好的泛化 MQ reward。
GRPO 收敛特性:500 iterations 即可有效收敛,远少于图像 GRPO 的典型训练量。论文将此归因于理论框架指导的设计——固定时间步消除了 credit assignment 噪声,重加权消除了梯度消失,使得每步更新信息量更大。
Reward hacking 信号:单一 HPSv3 reward 训练会导致 motion quality 急剧下降(生成静态视频最大化静帧视觉质量)。多 reward 训练通过维度间的互相约束有效避免了这一问题——VQ、MQ、TA 三个 reward 同时改善。
数据构成:大规模视频数据集,经过完整的清洗流水线处理。具体规模 [论文未披露总量]。
质量过滤:
标注系统(全模型自动标注,非人工):
分布均衡:对 caption 做 text embedding 聚类分析,LLM 总结每个 cluster 并分配标签,用于评估类别均衡性并进行针对性补充。
污染检查:[论文未提及评测集重叠检查]。
| Step | 主张 | 证据 | 支撑位置 | 反面验证 |
|---|---|---|---|---|
| 1 | 所有视频生成任务可统一为条件视频续写 | Block Causal Attention 设计:条件 token 独立计算,噪声 token attend to 全部——保证任务间共享同一前向逻辑 | §3.2, Eq.1-2 | 缺 ablation:未对比统一框架 vs 独立模型的质量差异 |
| 2 | 原生 VC 预训练消除长视频颜色漂移 | 分钟级长视频生成示例保持颜色/风格一致 | Fig.11-12 | 定性证据为主,缺定量颜色漂移指标 |
| 3 | GRPO for flow matching 等价于随机噪声搜索 | Appendix A.1 提供从 ODE/SDE 出发的完整推导,得 $dR/dv_\theta \approx -3/2 \cdot \hat{A} \cdot \epsilon$ | §3.3.1, Eq.3-5 | 理论成立,但零阶估计的方差随 latent 维度增长,大规模场景下效率未分析 |
| 4 | 固定单时间步 SDE + 重加权消除 credit assignment 模糊和梯度消失 | Ablation(论文 Fig.7)显示每项技术贡献 positive | §3.3.1 | Fig.7 ablation 可能包含交叉效应——未测试所有组合 |
| 5 | 多 reward 训练防止 reward hacking | 单 HPSv3 reward → 静态视频(motion collapse);多 reward 下 VQ/MQ/TA 同时改善 | §3.3.2, Fig.8-9 | 三个 reward 足够吗?更多维度(如物理真实性)是否需要额外 reward |
| 6 | BSA 在 93.75% sparsity 下近无损 | BSA vs dense attention 的质量对比 + 12.3× 加速消融 | §3.5, Table 2 | sparsity 对不同类型内容(快速运动 vs 静态)的影响未区分分析 |
| 7 | 组合优化(LCM+C2F+BSA)提供 12.3× 加速 | 逐项消融表:1429.5s → 244.6s → 135.3s → 116.5s | Table 2 | 加速比在更长视频(>189f)和更高分辨率(1080p)下的表现未验证 |
代码和模型权重公开发布:GitHub meituan-longcat/LongCat-Video。
BSA Triton 内核(开源,关键文件):
_attn_fwd_gating: Gating score computation kernel(前向 block 选择评分)_attn_fwd_bsa_varlen: 通用前向稀疏 attention kernel(chunk_size_k > 128)_attn_fwd_bsa_varlen_align: 优化前向 kernel(chunk_size_k <= 128,对齐优化)_attn_bwd_dkdv_bsa_varlen_wrapper: 反向 dK/dV 计算_attn_bwd_dq_bsa_varlen_wrapper / _attn_bwd_dq_bsa_varlen_align_wrapper: 反向 dQ 计算create_indices_k_from_indices_q_varlen: 前向→反向索引转置rearrange_THW_to_3d_block / rearrange_3d_block_to_THW: 3D block 重排flash_attn_fwd_softmax_lse_correction / flash_attn_fwd_out_correction: Context Parallelism LSE 校正推理流水线入口:generate_t2v, generate_i2v, generate_vc, generate_refine
LoRA 模块:refinement_lora(480p→720p), cfg_step_lora(蒸馏加速)
GRPO for flow matching 的核心实现要点: