iWorld-Bench: A Benchmark for Interactive World Models with a Unified Action Generation Framework

algorithm 2605.03941
benchmarkworld-modelcamera-controlevaluation-metricsdataset-pipeline

iWorld-Bench — L2 Distill #

1. TL;DR #

首个专为交互式世界模型设计的基准:用一个"动作生成框架"把文本/one-hot/相机内外参三类异构控制统一编码为 $(D,T,R,V)$ 四元组(81 个基础动作),配 330k 视频语料 + 4,900 任务 + 9 个可微指标,评测 14 个模型,揭示"生成质量 vs 可控性"权衡(Spearman $r_s=0.8053$ 与人类偏好对齐)。

2. Q1 / Q2 / Q3 #

Q1 — 痛点 #

交互式世界模型(interactive world model)指能根据外部动作序列(相机移动、键盘输入)生成因果一致的环境响应的模型。但现有评测基准有三个结构性缺陷:

  1. 场景/视角单一 —— 多数基准源自单一数据集,视角局限于行人视角;已有含高质量内外参的数据集因坐标系与参数格式不一致,难以直接用于世界模型训练。
  2. 动作输入无统一定义 —— 不同模型用文本命令、键盘输入、连续轨迹等异构表示,彼此不对齐。例如文本 "move forward" 可对应多个低层键盘命令,跨模态单步比较不公平。
  3. 任务设计不足 —— 现有基准面向通用/具身世界模型,缺乏对"响应外部动作序列"的交互性评测,也缺少变难度任务和记忆任务。
  4. 问题的本质是:没有一个模态无关(modality-agnostic)的动作空间,把"给同一个动作指令"这件事在文本、one-hot、相机参数三条技术路线上定义为同一个可比对象

    Q2 — 方法 #

    把每个世界模型抽象为条件式下一帧生成器 $V_{t+1} = W(I_t, C_t)$,其中控制量 $C_t = [D, T, R, V]$ 是一个模态无关的动作四元组。围绕它构造三件套:

    • 动作生成框架(Action Generation Framework):平移 27 动作 + 旋转 27 动作 → 729 组合动作;取键鼠可支持的 9×9=81 个动作建立"统一映射字典",把每个动作唯一映射到相机内外参 / one-hot / 文本三种控制信号。
    • 数据管线:Inherit Past(12 个开源数据集标准化)+ Create Future(4 个模拟器 18 场景自动采集 100k 视频 + 过滤)+ VLM 标注(GPT-4o)→ 330k 语料,选出 2,100 视频。
    • 9 指标 × 3 维度:生成质量(图像质量/亮度/色温/锐度)、轨迹跟随(平滑度/轨迹精度/轨迹容差)、记忆能力(记忆对称/轨迹对齐),全部为可计算的加权相似度函数。

    核心技术壁垒(见 §7):不是任何单一指标,而是"统一动作字典 + 三种控制信号的一致映射"这套本体设计 —— 它让"公平跨模态比较"从不可能变为定义清晰的问题,且需要同时打通 12 个坐标系异构数据集、4 个模拟器采集、以及三类模型的动作编码,工程与本体复杂度都极高。

    Q3 — 结果 #

    • 评测 14 模型(5 文本控制 + 2 one-hot + 7 相机内外参)。HY-World 1.5 综合第一(Avg 0.7873),记忆与轨迹跟随双强;videox-fun-Wan 第二(0.7474)。
    • 生成质量 vs 可控性权衡:CogVideoX-I2V 拿到最高亮度一致性(0.8988)与色温(0.8129)但轨迹精度只 0.5950;one-hot 的离散动作信号比连续文本更利于跟随(HY-World 轨迹精度 0.7472 vs CogVideoX 0.5950)。
    • 微调代价:AC3D(微调自 CogVideoX-I2V)、HY-World 1.5(微调自 HunyuanVideo-1.5)轨迹可控性大涨,但生成质量相对基模略降。
    • 指标与人类对齐:Spearman $r_s = 0.8053$($p<0.001$),平均排名差仅 1.93 位;Kruskal-Wallis $H=1496.9$,$\eta^2=0.5549$。

    3. 架构 / 方法图 #

    Figure 1: iWorld-Bench overview — four perspectives, weather/lighting, six tasks driven by the Action Generation Framework

    Paper's Figure 1, verbatim(caption: "Overview of iWorld-Bench ... leverages an Action Generation Framework to systematically and uniformly assess the interaction capabilities of interactive world models across various input modalities. It is composed of six tasks ...").

    图 1 是全局蓝图:四类视角(UGV/UAV/human/robotics)× 九种室外天气 × 五种室内光照的数据覆盖,右侧展示动作生成框架如何把线性移动命令(绿实线 →)、模型实际生成轨迹(红虚线 ⇢)、视角旋转(绿曲线 ↻)统一到六类任务中。读者应注意:所有异构控制最终都收敛到同一动作字典,这是"统一评测"成立的前提。

    Figure 2: Data processing pipeline — Collection → Unification → VLM annotation → Human verification, plus scene/weather/entity distributions

    Paper's Figure 2, verbatim(caption: "Data Processing Pipeline and Overview ... 1) Data Collection ... 2) Data Unification ... 3) VLM-Assisted Annotation ... 4) Human Verification ...").

    图 2(a) 是四步数据管线:从 12 个开源数据集 + 18 个模拟器采集 27.8M 多图数据 → 坐标系/格式统一并过滤到 330k → GPT-4o 自动标注 → 人工核验选出 2,100 视频、生成 4,900 任务。(b)(c)(d)(e) 分别是 top-100 场景分布、9 天气+5 光照、实体词云、四视角样例,共同支撑"多场景多视角"的多样性主张。

    方法核心机制($(D,T,R,V)$ 四元组如何驱动整条评测链)用 Mermaid 补充其结构层级,原文没有对应的单一结构图:

    flowchart LR A["动作指令 (D,T,R,V)"] --> B{统一映射字典} B -->|文本| C1[文本控制模型] B -->|one-hot| C2[one-hot 模型] B -->|内外参| C3[相机参数模型] C1 --> D[生成视频 V_t+1] C2 --> D C3 --> D D --> E[9 指标 · 3 维度] E --> F[排名 + 人类偏好校验]

    4. 作者证明 #

    无形式化作者证明 — 仅实证。 本文是基准论文,无收敛/复杂度定理。其"形式化"部分是指标定义方程组(Appendix D 的 D-1…D-15)与动作空间的组合计数,以及统计显著性检验(Appendix E)。下面给出关键记号表与 6 项一致性检查。

    记号表 #

    符号含义
    $V_{t+1} = W(I_t, C_t)$世界模型下一帧生成;$W$ 为具体模型,$I_t$ 当前帧
    $C_t = [D,T,R,V]$控制四元组:难度 / 平移ID / 旋转ID / 有效性
    $\mathcal{S}(\mathbf{a},\mathbf{b})$余弦相似度基元(D-1),被多指标复用
    $\mathcal{T}(x)=\frac{e^{\lambda x}-1}{e^{\lambda}-1}$修正 Softmax 变换(D-2),放大对漂移的敏感度
    $\mathcal{L}(x)=\frac{\ln(1+kx)}{\ln(1+k)}$上凸对数变换(D-8),增强中低分段区分度
    $\hat{w}(d)=e^{-\alpha d}/\sum e^{-\alpha k}$归一化指数衰减时间权重(D-3)

    方程物理意义(关键三条) #

    • 世界模型分解 $V_{t+1}=W(I_t,C_t)$:把任何交互式世界模型都看作"当前帧 + 模态无关动作四元组 → 下一帧"的条件生成器,是统一评测的公理。
    • 轨迹精度 $S_{\text{Accuracy}} = \frac{1}{T-1}\sum_{t=1}^{T-1}\mathcal{L}(|\mathcal{S}(\dot{\mathbf{e}}_{\text{sync},t}, \dot{\mathbf{e}}_{\text{cmd},t})|)$:在运动切空间上比对 ViPE 提取的生成轨迹切向与命令切向的绝对余弦相似度,度量"指令级可控性"。
    • 记忆对称 $S_{\text{Memory}} = \sum_{t=1}^{\lfloor T/2 \rfloor}\hat{w}_t \cdot e^{-k_{\text{val}}[\max(0,\text{MSE}_t-a)]^{k_{\text{exp}}}}$:对往返任务中对称帧对 $(f_t, f_{T-t+1})$ 的 MSE 做复合指数映射,低 MSE ⇒ 高闭环记忆分。

    6 项最小一致性检查 #

    1. 动作计数自洽:平移 27 × 旋转 27 = 729(Appendix B.2),键鼠子集 9×9=81(B.3),与 §3.2.1 数字一致。✅
    2. 任务总数自洽:4×1000(D1–D4)+ 200(记忆)= 4,200 标注任务 + 700 相机文件 = 4,900。✅(但见 §7 会计口径提示)
    3. 量纲/范围:所有 9 指标经归一化落在 $[0,1]$,Avg 可直接算术平均。✅
    4. 权重归一:$\hat{w}(d)$、$\hat{w}'(d)$、$\hat{w}_t$ 均显式除以求和项,与序列长度无关。✅
    5. 变换单调:$\mathcal{T}(0)=0,\mathcal{T}(1)=1$;$\mathcal{L}(0)=0,\mathcal{L}(1)=1$,边界正确。✅
    6. 统计显著:$\eta^2=0.5549 \gg 0.14$(大效应阈值),$H$ 检验 $p<0.001$,效应量与显著性一致。✅
    7. 若要更强保证:本文缺少对"9 指标线性等权平均是否为最优聚合"的理论论证 —— 作者自己在 Appendix E 也承认 AC3D 的排名翻转(O-Rank 4 vs H-Rank 9)说明等权平均与人类感知不匹配,理想情况下应给出"感知加权聚合"的最优性或校准界。

      5. 实验与数据 #

      Figure 3: Radar charts of model performance across evaluation metrics

      Paper's Figure 3, verbatim(caption: "Radar charts of model performance across evaluation metrics. (a) all 14 models on Action Control and Memory Ability tasks across 8 metrics. (b) 7 camera-parameter-controlled models on Camera Following tasks.").

      图 3(a) 显示 HY-World 1.5 与 videox-fun-Wan 的雷达轮廓最均衡,文本控制模型在生成质量强、轨迹跟随弱;(b) 中 AC3D 的覆盖面最大,早期方法(CameraCtrl/MotionCtrl)聚在中心。读者应注意雷达图直观呈现了"没有单一模型全维度领先"这一核心发现。

      Table 3: Action Control and Memory Ability results across three control paradigms

      Paper's Table 3, verbatim.

      表 3 是主结果:分文本/one-hot/内外参三组。HY-World 1.5 综合 0.7873 居首;CogVideoX-I2V 亮度一致性 0.8988、色温 0.8129、锐度 0.7951 全场最高却轨迹精度仅 0.5950,是"生成 vs 可控"权衡的最直接证据。注意 Motion Smoothness 全体接近饱和(0.955–0.994),几乎不区分模型。

      Table 4: Camera Following fine-grained trajectory results (700 camera files)

      Paper's Table 4, verbatim.

      表 4 用 700 个标注相机文件做细粒度轨迹评测:AC3D 的轨迹容差 0.9091、亮度 0.8927、平滑度 0.9919 全场最高;轨迹容差跨度极大(ASTRA 0.4286 → AC3D 0.9091),说明不同架构把相机参数转化为连贯视觉序列的能力差异巨大。RealCam-I2V 图像质量最高(0.5889)但容差落后(0.7480),再次印证"视觉保真与动作可控是正交维度"。

      Table 9: Human preference vs objective scores, CI, rank comparison across 14 models

      Paper's Table 11 (per-sub-metric breakdown, sorted by human preference rank); Table 9 gives the matching human/objective rank comparison.

      该分指标表揭示 AC3D 的排名翻转来源:其客观均分靠 Memory Symmetry (0.9068) 与 Motion Smoothness (0.9919) 撑起,但 Image Quality (0.4573) 全场倒数第二,而人类给分更看重感知质量,故 H-Rank 9 vs O-Rank 4,$|\Delta\text{Rank}|=5$。这是"等权聚合与人类偏好偏离"的关键案例。

      人类偏好校验(Appendix E)三问:Q1 排序一致性 $r_s=0.8053$、平均排名差 1.93;Q2 显著性 $H=1496.9$、$\eta^2=0.5549$(模型身份解释 55.5% 方差);Q3 六个接近模型中 15 对里 11 对达 $p<0.001$,4 个不显著对恰好人类均分差 ≤0.11,说明指标在细粒度端也能分辨真实差异。

      6. 论证链 #

      步骤论点依据(论文内部)
      1交互性是世界模型核心,但现有基准在场景/动作定义/任务设计三方面均不足§1 三条局限 + Table 1 对比(iWorld-Bench 是唯一全 ✓ 行)
      2只要把每个模型写成 $V_{t+1}=W(I_t,C_t)$ 并用模态无关四元组 $C_t=[D,T,R,V]$ 表示动作,跨模态比较即可定义§3.2 分解式 + §3.2.1 统一映射字典
      3用 27/27/729 动作空间取 81 键鼠子集建字典,可同时映射到文本/one-hot/内外参§3.2.1 + Appendix B.1–B.3 计数自洽
      4用 3-component 管线构造 330k 语料并选 2,100 视频、设计 4,900 任务,覆盖多场景多视角§3.1 + Appendix A(含 Algorithm 1 过滤管线)
      5定义 9 个可计算指标(3 维度),全部为归一化加权相似度§3.3 + Appendix D(D-1…D-15)
      6评测 14 模型得到"生成质量 vs 可控性"权衡与 one-hot > 文本的可控性优势§4.2 + Table 3/4
      7指标与人类偏好强相关($r_s=0.8053$),并能分辨接近模型,故基准有效Appendix E.1 Q1–Q3 统计检验

      7. 实现 cross-reference #

      核心技术壁垒 —— 统一动作字典与三路一致映射的本体设计。 最难复制的不是任何单一指标公式,而是把"729 个几何动作 → 81 键鼠可支持子集 → 唯一编码 → 同时映射到相机内外参 / one-hot / 文本"这套映射做到自洽且可扩展(Appendix B)。它要求:(a) 12 个异构坐标系数据集重定位到统一右手系(Appendix A.4 spatial rectification,对角修正矩阵);(b) 4 个模拟器 450 采样点的自动采集程序(§3.1.2);(c) 三类模型控制信号的编码对齐。任一环节口径不一致,跨模态排名即失去公平性 —— 这是"能否成为公认基准"的真正门槛。

      关键实现细节(易被忽略的 1–2 处)

      1. 过滤管线的两阶段"detect-then-prune":先逐帧异常检测(亮度 95 分位 $M_t^{light}$ + 帧间 MSE 的 z-score >4),再把离散异常转成局部密度 $\rho_t$(boxcar 卷积),仅保留 $\rho_t<\tau=0.06$ 的高保真段并桥接短段(Appendix A.4,Algorithm 1)。这一步决定了 330k 语料的实际质量。
      2. 多模型交叉核验的"严于多数投票"策略:GPT-4o 标注后用 Gemini 3.0 Flash / Qwen-VL-Max / Kimi-K2.5 三方独立核验,任何非一致(含 2/3 Yes)都路由人工,最终仅 1.2% 语料被实际修改(Appendix A.6,Table 5)。这是 330k 标注可信度的隐性保证。
      3. Motion Smoothness 借自 VBench 且近饱和:均值 0.983、std 0.010,几乎不区分模型(Appendix E Table 11 脚注),聚合时实质权重被稀释 —— 复现排名时需注意此指标几乎不影响相对次序。
      4. 代码/数据可复现性:论文声明 leaderboard 公开于 iWorld-Bench.com,Appendix E.1 称统计脚本与原始数据随补充材料发布;GPT-4o 标注用 GPT-4o 2025-01-01-preview(119M input / 21.86M output tokens,约 \$518),多模型核验约 \$2.8K API + 10 名志愿者约 1,200 人时。轨迹指标依赖开源 ViPE(video pose engine),图像质量依赖 MUSIQ,锐度熔断依赖 BRISQUE。除这些外部工具外,[实现未公开] —— L1 未提供本文自身评测代码的 file:line 级引用。