首个专为交互式世界模型设计的基准:用一个"动作生成框架"把文本/one-hot/相机内外参三类异构控制统一编码为 $(D,T,R,V)$ 四元组(81 个基础动作),配 330k 视频语料 + 4,900 任务 + 9 个可微指标,评测 14 个模型,揭示"生成质量 vs 可控性"权衡(Spearman $r_s=0.8053$ 与人类偏好对齐)。
交互式世界模型(interactive world model)指能根据外部动作序列(相机移动、键盘输入)生成因果一致的环境响应的模型。但现有评测基准有三个结构性缺陷:
问题的本质是:没有一个模态无关(modality-agnostic)的动作空间,把"给同一个动作指令"这件事在文本、one-hot、相机参数三条技术路线上定义为同一个可比对象。
把每个世界模型抽象为条件式下一帧生成器 $V_{t+1} = W(I_t, C_t)$,其中控制量 $C_t = [D, T, R, V]$ 是一个模态无关的动作四元组。围绕它构造三件套:
核心技术壁垒(见 §7):不是任何单一指标,而是"统一动作字典 + 三种控制信号的一致映射"这套本体设计 —— 它让"公平跨模态比较"从不可能变为定义清晰的问题,且需要同时打通 12 个坐标系异构数据集、4 个模拟器采集、以及三类模型的动作编码,工程与本体复杂度都极高。

Paper's Figure 1, verbatim(caption: "Overview of iWorld-Bench ... leverages an Action Generation Framework to systematically and uniformly assess the interaction capabilities of interactive world models across various input modalities. It is composed of six tasks ...").
图 1 是全局蓝图:四类视角(UGV/UAV/human/robotics)× 九种室外天气 × 五种室内光照的数据覆盖,右侧展示动作生成框架如何把线性移动命令(绿实线 →)、模型实际生成轨迹(红虚线 ⇢)、视角旋转(绿曲线 ↻)统一到六类任务中。读者应注意:所有异构控制最终都收敛到同一动作字典,这是"统一评测"成立的前提。

Paper's Figure 2, verbatim(caption: "Data Processing Pipeline and Overview ... 1) Data Collection ... 2) Data Unification ... 3) VLM-Assisted Annotation ... 4) Human Verification ...").
图 2(a) 是四步数据管线:从 12 个开源数据集 + 18 个模拟器采集 27.8M 多图数据 → 坐标系/格式统一并过滤到 330k → GPT-4o 自动标注 → 人工核验选出 2,100 视频、生成 4,900 任务。(b)(c)(d)(e) 分别是 top-100 场景分布、9 天气+5 光照、实体词云、四视角样例,共同支撑"多场景多视角"的多样性主张。
方法核心机制($(D,T,R,V)$ 四元组如何驱动整条评测链)用 Mermaid 补充其结构层级,原文没有对应的单一结构图:
无形式化作者证明 — 仅实证。 本文是基准论文,无收敛/复杂度定理。其"形式化"部分是指标定义方程组(Appendix D 的 D-1…D-15)与动作空间的组合计数,以及统计显著性检验(Appendix E)。下面给出关键记号表与 6 项一致性检查。
| 符号 | 含义 |
|---|---|
| $V_{t+1} = W(I_t, C_t)$ | 世界模型下一帧生成;$W$ 为具体模型,$I_t$ 当前帧 |
| $C_t = [D,T,R,V]$ | 控制四元组:难度 / 平移ID / 旋转ID / 有效性 |
| $\mathcal{S}(\mathbf{a},\mathbf{b})$ | 余弦相似度基元(D-1),被多指标复用 |
| $\mathcal{T}(x)=\frac{e^{\lambda x}-1}{e^{\lambda}-1}$ | 修正 Softmax 变换(D-2),放大对漂移的敏感度 |
| $\mathcal{L}(x)=\frac{\ln(1+kx)}{\ln(1+k)}$ | 上凸对数变换(D-8),增强中低分段区分度 |
| $\hat{w}(d)=e^{-\alpha d}/\sum e^{-\alpha k}$ | 归一化指数衰减时间权重(D-3) |
若要更强保证:本文缺少对"9 指标线性等权平均是否为最优聚合"的理论论证 —— 作者自己在 Appendix E 也承认 AC3D 的排名翻转(O-Rank 4 vs H-Rank 9)说明等权平均与人类感知不匹配,理想情况下应给出"感知加权聚合"的最优性或校准界。

Paper's Figure 3, verbatim(caption: "Radar charts of model performance across evaluation metrics. (a) all 14 models on Action Control and Memory Ability tasks across 8 metrics. (b) 7 camera-parameter-controlled models on Camera Following tasks.").
图 3(a) 显示 HY-World 1.5 与 videox-fun-Wan 的雷达轮廓最均衡,文本控制模型在生成质量强、轨迹跟随弱;(b) 中 AC3D 的覆盖面最大,早期方法(CameraCtrl/MotionCtrl)聚在中心。读者应注意雷达图直观呈现了"没有单一模型全维度领先"这一核心发现。

Paper's Table 3, verbatim.
表 3 是主结果:分文本/one-hot/内外参三组。HY-World 1.5 综合 0.7873 居首;CogVideoX-I2V 亮度一致性 0.8988、色温 0.8129、锐度 0.7951 全场最高却轨迹精度仅 0.5950,是"生成 vs 可控"权衡的最直接证据。注意 Motion Smoothness 全体接近饱和(0.955–0.994),几乎不区分模型。

Paper's Table 4, verbatim.
表 4 用 700 个标注相机文件做细粒度轨迹评测:AC3D 的轨迹容差 0.9091、亮度 0.8927、平滑度 0.9919 全场最高;轨迹容差跨度极大(ASTRA 0.4286 → AC3D 0.9091),说明不同架构把相机参数转化为连贯视觉序列的能力差异巨大。RealCam-I2V 图像质量最高(0.5889)但容差落后(0.7480),再次印证"视觉保真与动作可控是正交维度"。

Paper's Table 11 (per-sub-metric breakdown, sorted by human preference rank); Table 9 gives the matching human/objective rank comparison.
该分指标表揭示 AC3D 的排名翻转来源:其客观均分靠 Memory Symmetry (0.9068) 与 Motion Smoothness (0.9919) 撑起,但 Image Quality (0.4573) 全场倒数第二,而人类给分更看重感知质量,故 H-Rank 9 vs O-Rank 4,$|\Delta\text{Rank}|=5$。这是"等权聚合与人类偏好偏离"的关键案例。
人类偏好校验(Appendix E)三问:Q1 排序一致性 $r_s=0.8053$、平均排名差 1.93;Q2 显著性 $H=1496.9$、$\eta^2=0.5549$(模型身份解释 55.5% 方差);Q3 六个接近模型中 15 对里 11 对达 $p<0.001$,4 个不显著对恰好人类均分差 ≤0.11,说明指标在细粒度端也能分辨真实差异。
| 步骤 | 论点 | 依据(论文内部) |
|---|---|---|
| 1 | 交互性是世界模型核心,但现有基准在场景/动作定义/任务设计三方面均不足 | §1 三条局限 + Table 1 对比(iWorld-Bench 是唯一全 ✓ 行) |
| 2 | 只要把每个模型写成 $V_{t+1}=W(I_t,C_t)$ 并用模态无关四元组 $C_t=[D,T,R,V]$ 表示动作,跨模态比较即可定义 | §3.2 分解式 + §3.2.1 统一映射字典 |
| 3 | 用 27/27/729 动作空间取 81 键鼠子集建字典,可同时映射到文本/one-hot/内外参 | §3.2.1 + Appendix B.1–B.3 计数自洽 |
| 4 | 用 3-component 管线构造 330k 语料并选 2,100 视频、设计 4,900 任务,覆盖多场景多视角 | §3.1 + Appendix A(含 Algorithm 1 过滤管线) |
| 5 | 定义 9 个可计算指标(3 维度),全部为归一化加权相似度 | §3.3 + Appendix D(D-1…D-15) |
| 6 | 评测 14 模型得到"生成质量 vs 可控性"权衡与 one-hot > 文本的可控性优势 | §4.2 + Table 3/4 |
| 7 | 指标与人类偏好强相关($r_s=0.8053$),并能分辨接近模型,故基准有效 | Appendix E.1 Q1–Q3 统计检验 |
核心技术壁垒 —— 统一动作字典与三路一致映射的本体设计。 最难复制的不是任何单一指标公式,而是把"729 个几何动作 → 81 键鼠可支持子集 → 唯一编码 → 同时映射到相机内外参 / one-hot / 文本"这套映射做到自洽且可扩展(Appendix B)。它要求:(a) 12 个异构坐标系数据集重定位到统一右手系(Appendix A.4 spatial rectification,对角修正矩阵);(b) 4 个模拟器 450 采样点的自动采集程序(§3.1.2);(c) 三类模型控制信号的编码对齐。任一环节口径不一致,跨模态排名即失去公平性 —— 这是"能否成为公认基准"的真正门槛。
关键实现细节(易被忽略的 1–2 处):
代码/数据可复现性:论文声明 leaderboard 公开于 iWorld-Bench.com,Appendix E.1 称统计脚本与原始数据随补充材料发布;GPT-4o 标注用 GPT-4o 2025-01-01-preview(119M input / 21.86M output tokens,约 \$518),多模型核验约 \$2.8K API + 10 名志愿者约 1,200 人时。轨迹指标依赖开源 ViPE(video pose engine),图像质量依赖 MUSIQ,锐度熔断依赖 BRISQUE。除这些外部工具外,[实现未公开] —— L1 未提供本文自身评测代码的 file:line 级引用。