Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends

algorithm 2606.01164 — Cross-paper Synthesis

Towards Interactive Video World Modeling — L3 Per-Paper Synthesis #

本篇 (2606.01164) 是一篇综述,其"贡献"是把交互式视频世界模型拆成三大瓶颈——动作可控性、长程一致性与记忆、实时响应性 [2606.01164]。相关聚类中的 8 篇是具体机制/方法论文,天然构成"综述 vs 组件"的对照关系:它们要么是综述框架里某个瓶颈的一个具体解法,要么是综述所依赖的底层原语(attention 量化、RoPE、优化器稳定性),要么是同为 "world model" 却处在不同范式(RL vs 视频生成)的对照锚点。这种异质性本身是 L3 分析的价值来源。

1. 相关论文 — 谁相关、为什么相关 #

按与本综述"三瓶颈 + world-model 血统"的映射关系分四组:

2. 本篇 vs 相关论文的 delta — 新增 / 增量 / 矛盾 #

新增(本综述独有)

增量(相对组件论文是抽象层上移)

矛盾/张力

3. 可攻击面 — 针对具体主张的反驳 #

4. 生态位 — 范式定位与采纳证据 #

5. 未探索方向 — 从聚类导出的 hybrid / adaptive 方向 #