LongCat-Video Technical Report

algorithm 2510.22200
GRPOflow-matchingmulti-reward-RLHFvideo-generationsparse-attentioncoarse-to-fine

LongCat-Video Technical Report #

Meituan LongCat Team, Xunliang Cai, Qilong Huang, Zhuoliang Kang, Hongyu Li, Shijun Liang, Liya Ma, Siyu Ren, Xiaoming Wei, Rixu Xie, Tong Zhang | 2025-10 | https://arxiv.org/abs/2510.22200

§1 TL;DR #

美团提出将 GRPO 适配到 flow matching 视频生成,理论证明其等价于随机噪声搜索($dR/dv_\theta \approx -\frac{3}{2}\hat{A}\epsilon$),由此导出固定 SDE 时间步、loss 重加权、max group std 三项改进;结合多 reward 加权训练防止 reward hacking,加上 coarse-to-fine + 3D Block Sparse Attention 实现 12.3× 推理加速。13.6B 稠密 DiT 模型在 VBench 2.0 开源第一、Commonsense 全场最佳。

§2 核心三问 #

Q1 痛点 #

三个交叉痛点驱动本工作:

  1. GRPO 适配 flow matching 的理论缺失:GRPO 在 LLM 中成功(Guo et al., 2025),在图像生成中初步验证(Liu et al., 2025a),但应用于视频生成时收敛慢、梯度消失严重。根本原因是标准 SDE 采样在所有时间步注入噪声,导致 reward 信号的 credit assignment 模糊——无法区分哪个时间步的噪声探索真正影响了最终质量。
  2. 单一 reward 的 hacking 问题:仅用视觉质量 reward(如 HPSv3)训练会导致模型生成静态视频——通过消除运动来最大化静帧质量,而非提升真正的视频质量。
  3. 高分辨率视频的二次复杂度瓶颈:720p@30fps 视频在 latent 空间产生 ~224,640 个 token,标准 dense attention 在单 H800 上需 1429.5 秒,实际部署不可行。
  4. Q2 方法(含核心技术壁垒) #

    核心方法:将 GRPO 解释为 flow matching 上的随机噪声搜索,建立理论框架后推导出三项关键改进,并结合多 reward 训练和高效推理策略。

    核心技术壁垒:GRPO 与 flow matching velocity field 之间的理论联系。论文在 Appendix A.1 证明 GRPO 的 policy gradient 等价于用 advantage-weighted noise 做 reward 对 velocity field 的零阶梯度估计:$\frac{dR}{dv_\theta} \approx -\frac{3}{2}\hat{A}_t^i \cdot \epsilon$。这一洞察是所有后续设计(固定时间步、重加权公式、max group std)的理论支撑——没有它,这些选择都缺乏原则性依据,需要大量经验搜索。

    Before vs After(相对于标准 GRPO for diffusion):

    维度Before (标准 GRPO)After (LongCat GRPO)
    SDE 采样所有时间步都注入 SDE 噪声仅单个随机时间步 $t' \sim \mathcal{U}(0, T'-1)$ 注入 SDE,其余用 ODE
    初始噪声每个 sample 独立采样同一 group 共享初始噪声 $\boldsymbol{x}_T$
    优势归一化Per-group std $\sigma_k^j$Max group std $\sigma_{\max,k} = \max(\{\sigma_k^j\}_{j=1}^B)$
    Loss 权重均匀时间步相关重加权 $\lambda_{\text{policy}} = \sqrt{t/(\Delta t(1-t))}$
    Reward单一多 reward 加权 $\hat{A}_{\text{total}} = \sum_k w_k \hat{A}_k$
    理论基础无(启发式适配)随机噪声搜索解释(Appendix A.1)

    Q3 结果 #

    • VBench 2.0: 总分 62.11%(开源第一,仅次于 Veo3 66.72% 和 Vidu Q1 62.70%);Commonsense 70.94% 全场最佳(含 Veo3 的 69.48%)
    • 内部 T2V MOS: Overall Quality 3.38(Wan 2.2 3.35, PixVerse-V5 3.36, Veo3 3.48)
    • 推理加速: 720p×93f 从 1429.5s → 116.5s(12.3×),720p×189f 降至 142.0s(10.1×)
    • BSA 效率: attention 计算量降至 dense 的 <10%(93.75% sparsity),质量近无损
    • 弱项: I2V Overall Quality 3.17(落后 Seedance 3.35、Hailuo 3.27);Image-Alignment 4.04(落后 4.12-4.18);Human Fidelity 80.20%(测试模型中最低)

    Problem Formulation #

    目标函数:优化 flow matching 模型的 GRPO objective:

    $$\mathcal{L}_{\text{total}} = \frac{1}{B \cdot G}\sum_{j=1}^{B}\sum_{i=1}^{G}\left(\mathcal{L}_{\text{policy}}^{i} - \mathcal{L}_{\text{KL}}^{i}\right)$$

    其中 policy loss 和 KL loss 分别为:

    $$\mathcal{L}_{\text{policy}}^{i} = \lambda_{\text{policy}} \cdot r_{t'}^{i}(\theta) \cdot \hat{A}_{\text{total}}^{i}$$

    $$\mathcal{L}_{\text{KL}}^{i} = \beta \lambda_{\text{KL}} \cdot D_{\text{KL}}(\pi_\theta \| \pi_{\text{ref}})$$

    假设:(1) shared initial noise $\boldsymbol{x}_T$ 保证 group 内差异仅源于 SDE 噪声;(2) 单时间步 SDE 足以提供有效探索($T' < T$ 限制在早期时间步);(3) multi-reward 各维度近似独立可分。

    输入/输出:一步 GRPO 消耗 $B$ 个 prompt + 每个 prompt 生成 $G$ 个完整 ODE/SDE 轨迹 + $n$ 个 reward model 的评分,产出 $\theta$ 的梯度更新。

    §3 架构 / 方法图 #

    统一视频续写框架 #

    所有视频生成任务统一为条件视频续写:条件帧 $X_{\text{cond}} \in \mathbb{R}^{B \times N_{\text{cond}} \times H \times W \times C}$(timestep 固定为 0)与噪声帧 $X_{\text{noisy}}$(timestep $\sim [0,1]$)沿时间轴拼接。T2V 令 $N_{\text{cond}}=0$,I2V 令 $N_{\text{cond}}=1$,VC 令 $N_{\text{cond}} > 1$。

    Block Causal Attention 确保条件 token 的更新独立于噪声 token:

    $$X_{\text{cond}} = \mathrm{Attention}(Q_{\text{cond}}, K_{\text{cond}}, V_{\text{cond}})$$

    $$X_{\text{noisy}} = \mathrm{Attention}(Q_{\text{noisy}}, [K_{\text{cond}}, K_{\text{noisy}}], [V_{\text{cond}}, V_{\text{noisy}}])$$

    这一设计使条件帧的 KV 可在所有采样步缓存复用,对长视频生成(条件帧多)的效率至关重要。条件 token 不参与 cross-attention 计算。

    3D Block Sparse Attention #

    Figure 5: Block Sparse Attention — 3D block 选择与稀疏 attention 计算流程

    Paper's Figure (BSA mechanism): 将视频 latent 分为 3D block,计算 block 级相似度分数,选择 top-r 个 key blocks,仅在选中 blocks 内计算 attention。

    BSA 将 latent 按空间-时间局部性重排为 3D block(默认 chunk shape $[4, 4, 8]$),计算 query block 与所有 key blocks 的 average-pooled 相似度,选择 top-$r$ 个 key blocks($r = (1 - \text{sparsity}) \times N_k$),仅在选中范围内执行标准 attention。93.75% sparsity 意味着只保留 1/16 的 key blocks,attention 计算量降至 dense 的 <10%。选择策略支持 Top-K、CDF 阈值及组合模式。Triton 内核实现了变长 block 选择的 online softmax,前向/反向均有优化路径。

    Training Pipeline #

    Figure 6: 训练流水线 — 基础训练与 LoRA 后训练分支

    Paper's Figure (Training overview): 展示三阶段训练流程——渐进式预训练 → SFT → Base Model,然后分三条 LoRA 分支独立训练 RLHF、Refinement Expert、Distillation。

    训练采用模块化 LoRA 设计:在 base model(渐进式预训练 + SFT)上独立训练三个 LoRA 模块——RLHF LoRA(多 reward GRPO,500 iter)、Refinement Expert LoRA(480p→720p 精细化 + BSA)、Distillation LoRA(CFG + CM 蒸馏,减少采样步数)。这种设计使各模块可独立迭代,并支持灵活组合。

    GRPO for Flow Matching — 算法核心 #

    sequenceDiagram participant P as Prompt c_j participant N as Shared Noise x_T participant S as G Trajectories (ODE+1-step SDE) participant R as Multi-Reward {R_k} participant A as Weighted Advantage participant U as θ Update P->>N: Sample shared x_T ~ N(0,I) N->>S: For i=1..G: generate via ODE except at t' (SDE) S->>R: Decode x_0^i, compute R_k(x_0^i, c_j) R->>A: Per-reward normalize, weight, aggregate A->>U: Compute reweighted policy + KL loss, update θ

    核心算法流程:(1) 同一 prompt 的 G 个样本共享初始噪声 $\boldsymbol{x}_T$;(2) 随机选择单个关键时间步 $t' \sim \mathcal{U}(0, T'-1)$,仅在此步注入 SDE 噪声(截断调度 $\sigma_t$),其余步用 ODE;(3) 解码后计算多个 reward,每个 reward 独立归一化后加权聚合为 $\hat{A}_{\text{total}}$;(4) 应用时间步相关重加权 $\lambda_{\text{policy}}, \lambda_{\text{KL}}$ 后更新参数。

    Coarse-to-Fine Generation #

    三阶段推理流水线:

    Stage方法分辨率FPSLoRABSA步数
    1Base T2V/I2V480p15No50 (or 16 w/ distill)
    2Distillation480p15cfg_step_loraNo8-16
    3Refinement720p30refinement_loraYes5

    Stage 1 输出经三线性上采样后加噪至 $t_{\text{thresh}} = 0.5$,由 Refinement Expert LoRA 在仅 5 步内去噪至 720p@30fps。对于 I2V/VC,原始高分辨率条件帧在 Stage 3 与上采样输出拼接,确保条件帧保真度。

    §4 作者证明 #

    符号表 #

    符号含义
    $\theta$Policy(DiT)参数
    $\pi_\theta, \pi_{\text{ref}}$当前策略 / 冻结参考策略
    $v_\theta(\boldsymbol{x}_t, t, c)$Flow matching velocity field
    $\hat{A}_{k,t'}^i$样本 $i$ 在时间步 $t'$ 的 reward $k$ 相对优势
    $\hat{A}_{\text{total}}^i$多 reward 加权总优势
    $\epsilon$SDE 注入噪声
    $t'$关键(固定)时间步,$t' \sim \mathcal{U}(0, T'-1)$
    $T, T'$总时间步 / SDE 范围上界($T' < T$)
    $G, B$每组样本数 / batch 中 prompt 数
    $R_k, w_k$第 $k$ 个 reward model / 其权重
    $\sigma_{\max,k}$reward $k$ 在 batch 内的最大组标准差
    $\lambda_{\text{policy}}, \lambda_{\text{KL}}$时间步相关重加权系数
    $\beta$KL 惩罚系数
    $r_{t'}^i(\theta)$策略比率(importance sampling ratio)

    方程物理意义 #

    Eq.1 — Block Causal Attention (条件): $X_{\text{cond}} = \mathrm{Attention}(Q_{\text{cond}}, K_{\text{cond}}, V_{\text{cond}})$。条件 token 仅自我注意,不受噪声 token 影响,保证条件信息的无损传递和 KV 缓存的可行性。

    Eq.2 — Block Causal Attention (噪声): $X_{\text{noisy}} = \mathrm{Attention}(Q_{\text{noisy}}, [K_{\text{cond}}, K_{\text{noisy}}], [V_{\text{cond}}, V_{\text{noisy}}])$。噪声 token 可看到全部上下文(条件+噪声),使得生成帧与条件帧保持一致。

    Eq.3 — Reweighted policy gradient: $\nabla_\theta \mathcal{L}_{\text{policy, reweighted}}(\theta) = -\frac{3}{2}\hat{A}_t^i \cdot \epsilon \cdot \nabla_\theta v_\theta$。GRPO 的 policy gradient 分解为 advantage-weighted noise 乘以 velocity field 对参数的 Jacobian——物理上,噪声 $\epsilon$ 提供了探索方向,$\hat{A}$ 提供了 reward 反馈的幅度和符号。

    Eq.4 — Chain rule decomposition: $\frac{dR}{d\theta} = \frac{dR}{dv_\theta} \cdot \frac{dv_\theta}{d\theta}$。将 reward 对参数的梯度分解为 reward 对 velocity field 的敏感度(前者由 GRPO 零阶估计)和 velocity field 对参数的标准梯度(后者由反向传播计算)。

    Eq.5 — Stochastic noise search: $\frac{dR}{dv_\theta} \approx -\frac{3}{2}\hat{A}_t^i \cdot \epsilon$。核心理论结果——GRPO 用 advantage-weighted noise 做了 reward 关于 velocity field 的零阶梯度估计,类似于进化策略中用噪声-reward 相关性估计梯度。

    重加权系数: $\lambda_{\text{policy}} = \sqrt{\frac{t'/T}{\Delta(t'/T)(1-t'/T)}}$, $\lambda_{\text{KL}} = \frac{t'/T}{\Delta(t'/T)(1-t'/T)}$。消除 flow matching 中不同时间步 SNR 差异导致的梯度幅度不均——中间时间步的贡献最大,边界时间步(纯噪声或纯信号)的贡献被压制。

    6 项一致性检查 #

    #检查结论
    1量纲一致性:$\nabla_\theta \mathcal{L} = -\frac{3}{2}\hat{A} \cdot \epsilon \cdot \nabla_\theta v_\theta$——$\hat{A}$ 无量纲标量,$\epsilon$ 与 latent 同维,$\nabla_\theta v_\theta$ 为 velocity-to-parameter Jacobian✓ 量纲匹配
    2零梯度退化:当 group 内所有 $G$ 个样本 reward 相同,$\hat{A}_t^i = 0$,梯度消失——正确,无信息时不更新
    3符号一致性:高 reward → 正 $\hat{A}$ → policy gradient 推动 $\theta$ 沿增大该方向 velocity 的方向更新
    4边界 $t \to 0$:$\lambda_{\text{policy}} \to 0$,近纯信号时间步几乎不贡献梯度——合理,因为此时 perturbation 对输出影响极小
    5边界 $t \to T$:$\lambda_{\text{policy}} \to \sqrt{1/\Delta}$(常数),纯噪声时间步获得有限权重
    6KL 非负性:$D_{\text{KL}}(\pi_\theta \\pi_{\text{ref}}) \geq 0$,KL 惩罚始终非负,确保不会奖励偏离参考策略

    收敛定理 / 命题 #

    论文在 Appendix A.1 给出了完整的理论框架:

    命题(非正式):在 flow matching 模型中,GRPO 的 reweighted policy gradient 等价于以 advantage-weighted noise 为梯度估计器的零阶优化,即 $\frac{dR}{dv_\theta} \approx -\frac{3}{2}\hat{A}_t^i \cdot \epsilon$。

    假设:(1) velocity field $v_\theta$ 关于 $\theta$ 可微;(2) reward $R$ 关于生成结果 $\boldsymbol{x}_0$ 可微(但不需要关于轨迹可微——这正是零阶方法的优势);(3) SDE 噪声 $\epsilon \sim \mathcal{N}(0, I)$。

    假设失效场景:(a) reward 高度非平滑(如 binary 判别器)时,零阶估计方差极大,$G$ 需要很大;(b) 当 group size $G$ 过小时,$\hat{A}$ 的估计本身噪声很大。

    Proof Sketch #

    1. 从 flow matching ODE $\boldsymbol{x}_{t-1} = \boldsymbol{x}_t + v_\theta(\boldsymbol{x}_t, t, c)\Delta t$ 出发,在单时间步 $t'$ 引入 SDE 扰动 $\sigma_{t'}\sqrt{\Delta t}\epsilon_i$
    2. 共享初始噪声 $\boldsymbol{x}_T$ 保证 group 内样本差异仅源于 $\epsilon_i$
    3. 最终生成结果 $\boldsymbol{x}_0^i$ 关于 $\epsilon_i$ 的一阶展开给出 $\boldsymbol{x}_0^i \approx \bar{\boldsymbol{x}}_0 + J_{t'}\sigma_{t'}\sqrt{\Delta t}\epsilon_i$
    4. Reward $R(\boldsymbol{x}_0^i)$ 关于 $\epsilon_i$ 的线性展开结合 group-relative advantage 计算,得 $\hat{A}_t^i \cdot \epsilon_i$ 近似 $\nabla_{v_\theta} R$ 的方向
    5. 链式法则 $\frac{dR}{d\theta} = \frac{dR}{dv_\theta} \cdot \frac{dv_\theta}{d\theta}$ 中,第一项由零阶估计替代,第二项由标准反向传播计算
    6. Loss 分解 #

      $$\mathcal{L}_{\text{total}} = \underbrace{\lambda_{\text{policy}} \cdot r_{t'}(\theta) \cdot \hat{A}_{\text{total}}}_{\text{policy: 推动高 reward 方向}} - \underbrace{\beta \lambda_{\text{KL}} \cdot D_{\text{KL}}(\pi_\theta \| \pi_{\text{ref}})}_{\text{KL: 约束不偏离参考策略过远}}$$

      • Policy 项:推动参数沿 reward 增大方向移动;$r_{t'}(\theta)$ 是 importance sampling ratio 防止过大更新
      • KL 项:正则化,防止策略崩溃;$\beta$ 控制约束强度
      • 两项的重加权系数不同($\lambda_{\text{policy}}$ 比 $\lambda_{\text{KL}}$ 多取一次平方根),因为 KL 对策略漂移更敏感,需要更强的时间步归一化

      §5 实验与数据 #

      Training Recipe #

      Stage任务分辨率LRIterations特殊技术
      Pre-train 1T2I256p1e-4285k图像预训练
      Pre-train 2T2I + T2V256p × 93f1e-4140k引入视频
      Pre-train 3T2I + T2V + I2V + VC256p × 93f5e-5164k多任务统一
      Pre-train 4同上480p × 93f5e-536k提升分辨率
      Pre-train 5同上480p + 720p × 93f2e-553k混合分辨率
      SFTcurated HQ data480p1e-57.5k含镜头运动/视觉风格专项数据
      GRPOT2V only480p1e-4500多 reward, group size 4, 64 prompts/step
      DistillationCFG + CM2k + 3k50步 → 16步
      Refinement480p→720p720p500 + 500full attn → BSA (93.75% sparsity)

      总预训练约 678k iterations。GRPO 仅需 500 iterations 即可有效收敛——归功于理论框架指导的设计。

      GPU hours / MFU: [论文未明确披露总 GPU hours]。训练使用 DeepSpeed-Zero2 + Context Parallelism + Ring Attention + Activation Checkpointing,MFU 33-38%。

      关键超参:GRPO group size $G=4$,KL 系数 $\beta$ [论文未披露具体值],SDE 范围 $T' < T$(截断至早期时间步),refinement $t_{\text{thresh}} = 0.5$。

      关键实验结果 #

      T2V MOS 评测(内部基准,5 分制):

      模型可用性架构激活参数Text-Align↑Visual Q↑Motion Q↑Overall↑
      Veo3闭源3.993.233.863.48
      PixVerse-V5闭源3.813.133.813.36
      Wan 2.2-A14B开源MoE14B3.703.263.783.35
      LongCat-Video开源Dense13.6B3.763.253.743.38

      LongCat-Video 在 13.6B 稠密参数下 overall quality 3.38 优于 Wan 2.2(28B 参数、14B 激活的 MoE)。Visual Quality 3.25 几乎追平 Wan 2.2 的 3.26,并超过 Veo3 的 3.23——商业闭源模型在视觉质量维度反而低于开源模型。

      I2V MOS 评测

      模型Image-Align↑Text-Align↑Visual Q↑Motion Q↑Overall↑
      Seedance 1.04.123.703.223.773.35
      Hailuo-024.183.853.183.803.27
      Wan 2.2-A14B4.183.333.233.793.26
      LongCat-Video4.043.493.273.593.17

      I2V 是明显弱项:Image-Alignment 4.04 落后 4.18(差距 3.3%),Motion Quality 3.59 落后 3.77-3.80(差距 5-6%)。值得注意的是 GRPO 仅在 T2V 任务上训练,无 I2V/VC 专项 reward——这可能是 I2V 弱于的结构性原因。

      推理加速消融

      配置LCMC2FBSA步数延迟加速比
      Baseline501429.5s1.0×
      +LCM16244.6s5.8×
      +C2F16/5135.3s10.6×
      +BSA16/5116.5s12.3×
      189f +BSA16/5142.0s10.1×

      LCM 蒸馏贡献最大加速(5.8×),C2F 额外带来 1.8×,BSA 再加 1.2×。帧数翻倍(93f → 189f)时 BSA 的相对贡献更显著(因为 dense attention 的二次增长被截断)。

      VBench 2.0 结果

      模型CreativityCommonsenseControllabilityHuman FidelityPhysicsTotal
      HunyuanVideo41.84%63.44%28.60%82.41%60.20%55.30%
      Wan2.155.25%63.98%37.32%81.60%62.84%60.20%
      Vidu Q156.54%65.98%38.13%81.24%71.63%62.70%
      Veo360.85%69.48%47.04%87.72%69.35%66.72%
      LongCat-Video54.73%70.94%44.79%80.20%59.92%62.11%

      Commonsense 70.94% 是全场最高——超越 Veo3 的 69.48%。这表明通过原生视频续写预训练和多 reward GRPO,模型获得了较强的物理常识理解能力。

      生成质量示例 #

      Figure 11: 视频生成结果 — 长视频与交互式视频示例

      Paper's Figure: 展示 LongCat-Video 在不同场景的长视频生成(分钟级,带时间戳)和交互式视频续写(带分段标注)结果。

      长视频示例(驾驶、滑板、芭蕾)跨越 1-4 分钟时间尺度,帧间保持一致的颜色和风格——验证了原生 VC 预训练对时间一致性的有效性。交互式视频示例展示了多步条件续写能力,每 5-6 秒一个语义段落,动作衔接流畅。

      Figure 12: 长视频生成能力 — 多场景时序一致性

      Paper's Figure: 更多长视频生成结果,包括高速公路驾驶(第一人称)、山路滑板、芭蕾独舞等场景,以及厨房、办公室、浴室等日常交互场景。

      驾驶场景在 3 分钟内保持了一致的天气、光照和道路特征。芭蕾场景中舞者服装和舞台布局跨越 4 分钟保持稳定。这些结果直接支撑了 §2 Q3 中"无颜色漂移的分钟级生成"的核心主张。

      Convergence & Stability #

      Figure 13: MQ reward 模型验证损失 — RGB vs Grayscale 训练对比

      Paper's Figure: Motion Quality reward 模型的验证损失曲线。Grayscale(灰色线)训练后 ~800 步开始剧烈上升(过拟合),RGB(红色线)上升延迟但同样出现过拟合趋势。

      这张图支撑了 MQ reward 用灰度训练的设计选择:灰度训练虽然也会最终过拟合,但相比 RGB 训练延迟了过拟合的发生(~800 步 vs ~600 步),说明去除颜色信息减少了 reward model 可利用的 shortcut 特征。选择灰度训练的时间点(~800 步以前)可获得更好的泛化 MQ reward。

      GRPO 收敛特性:500 iterations 即可有效收敛,远少于图像 GRPO 的典型训练量。论文将此归因于理论框架指导的设计——固定时间步消除了 credit assignment 噪声,重加权消除了梯度消失,使得每步更新信息量更大。

      Reward hacking 信号:单一 HPSv3 reward 训练会导致 motion quality 急剧下降(生成静态视频最大化静帧视觉质量)。多 reward 训练通过维度间的互相约束有效避免了这一问题——VQ、MQ、TA 三个 reward 同时改善。

      Dataset Analysis #

      数据构成:大规模视频数据集,经过完整的清洗流水线处理。具体规模 [论文未披露总量]。

      质量过滤

      • 去重:source video ID + MD5 hash
      • 场景分割:PySceneDetect + TransNetV2(in-house 训练),切分为内容一致的 clips
      • 黑边裁剪:FFMPEG
      • 标注过滤:aesthetic score, blur score, text coverage, watermark detection, optical flow (运动量过低的 clips 被过滤)

      标注系统(全模型自动标注,非人工):

      • 基础描述:fine-tuned LLaVA-Video + Tarsier2 数据增强时间动作理解
      • 镜头/风格:Qwen2.5VL 标注镜头运动(平移、倾斜、变焦、摇晃)、画面尺寸、镜头类型、视觉风格
      • 描述增广:中英互译、摘要、随机整合镜头/风格属性

      分布均衡:对 caption 做 text embedding 聚类分析,LLM 总结每个 cluster 并分配标签,用于评估类别均衡性并进行针对性补充。

      污染检查:[论文未提及评测集重叠检查]。

      §6 论证链 #

      Step主张证据支撑位置反面验证
      1所有视频生成任务可统一为条件视频续写Block Causal Attention 设计:条件 token 独立计算,噪声 token attend to 全部——保证任务间共享同一前向逻辑§3.2, Eq.1-2缺 ablation:未对比统一框架 vs 独立模型的质量差异
      2原生 VC 预训练消除长视频颜色漂移分钟级长视频生成示例保持颜色/风格一致Fig.11-12定性证据为主,缺定量颜色漂移指标
      3GRPO for flow matching 等价于随机噪声搜索Appendix A.1 提供从 ODE/SDE 出发的完整推导,得 $dR/dv_\theta \approx -3/2 \cdot \hat{A} \cdot \epsilon$§3.3.1, Eq.3-5理论成立,但零阶估计的方差随 latent 维度增长,大规模场景下效率未分析
      4固定单时间步 SDE + 重加权消除 credit assignment 模糊和梯度消失Ablation(论文 Fig.7)显示每项技术贡献 positive§3.3.1Fig.7 ablation 可能包含交叉效应——未测试所有组合
      5多 reward 训练防止 reward hacking单 HPSv3 reward → 静态视频(motion collapse);多 reward 下 VQ/MQ/TA 同时改善§3.3.2, Fig.8-9三个 reward 足够吗?更多维度(如物理真实性)是否需要额外 reward
      6BSA 在 93.75% sparsity 下近无损BSA vs dense attention 的质量对比 + 12.3× 加速消融§3.5, Table 2sparsity 对不同类型内容(快速运动 vs 静态)的影响未区分分析
      7组合优化(LCM+C2F+BSA)提供 12.3× 加速逐项消融表:1429.5s → 244.6s → 135.3s → 116.5sTable 2加速比在更长视频(>189f)和更高分辨率(1080p)下的表现未验证

      §7 实现 cross-reference #

      开源实现 #

      代码和模型权重公开发布:GitHub meituan-longcat/LongCat-Video

      BSA Triton 内核(开源,关键文件):

      • _attn_fwd_gating: Gating score computation kernel(前向 block 选择评分)
      • _attn_fwd_bsa_varlen: 通用前向稀疏 attention kernel(chunk_size_k > 128
      • _attn_fwd_bsa_varlen_align: 优化前向 kernel(chunk_size_k <= 128,对齐优化)
      • _attn_bwd_dkdv_bsa_varlen_wrapper: 反向 dK/dV 计算
      • _attn_bwd_dq_bsa_varlen_wrapper / _attn_bwd_dq_bsa_varlen_align_wrapper: 反向 dQ 计算
      • create_indices_k_from_indices_q_varlen: 前向→反向索引转置
      • rearrange_THW_to_3d_block / rearrange_3d_block_to_THW: 3D block 重排
      • flash_attn_fwd_softmax_lse_correction / flash_attn_fwd_out_correction: Context Parallelism LSE 校正

      推理流水线入口generate_t2v, generate_i2v, generate_vc, generate_refine

      LoRA 模块refinement_lora(480p→720p), cfg_step_lora(蒸馏加速)

      核心技术壁垒实现 #

      GRPO for flow matching 的核心实现要点:

      • 同一 group 共享初始噪声 $\boldsymbol{x}_T$(而非独立采样)
      • 单时间步 SDE 选择:$t' \sim \mathcal{U}(0, T'-1)$,$T' < T$
      • Max group std 归一化:$\sigma_{\max,k} = \max(\{\sigma_k^j\}_{j=1}^B)$(需跨进程收集所有组的 std)
      • 重加权公式直接来自理论推导,非超参搜索结果

      关键实现细节 #

      1. Max group std 归一化:标准 GRPO 用 per-group std 归一化 advantage。LongCat 改用 batch 内所有 group 的最大 std——防止低方差 group(所有样本 reward 接近)的 advantage 被过度放大。这是一个微妙但重要的稳定性 trick:低方差 group 的 advantage 被压缩而非爆炸。
      2. MQ reward 灰度训练:Motion Quality reward model 使用灰度视频训练和推理,强制模型关注运动本身而非颜色特征。验证损失对比(Fig.13)显示这延迟了过拟合,提升了泛化能力。
      3. Reproducibility & Ecosystem #

        • 训练代码: 开源(GitHub: meituan-longcat/LongCat-Video)
        • 模型权重: 公开发布
        • BSA 算子: Triton 实现开源,含 ring attention 变体支持 context parallelism
        • 最近参考实现: BSA 机制可与 FlashAttention 系列方法互补使用;GRPO for flow matching 的训练方法可在 TRL / OpenRLHF / verl 等框架中复现
        • 社区复现情况: [发表时间较新,社区复现报告尚待观察]
        • 生态影响: (1) BSA 作为独立模块可直接用于其他视频/图像生成模型的 attention 加速;(2) GRPO for flow matching 的理论框架和实现技术可迁移至 Stable Diffusion、Flux 等其他 flow matching 模型的后训练