FuguReport

ReWorld: An Interactive World Model with Long-Horizon Memory

著者 Zhifei Chen, Luozhou Wang, Guibao Shen, Dongyu Yan, Shuai Yang, Tianshuo Xu, Yihua Du, Wei Wang, Tianyi Gui, Lianghua Huang, Yingcong Chen
所属 The Hong Kong University of Science and Technology (Guangzhou) / Alibaba
カテゴリ Method / World Modeling / Interactive and high-fidelity multi-step modeling, Application / Simulated Environment / Multi-source data integration, Evaluation / Model Efficiency / Real-time inference and interactive mode
ライセンス CC BY 4.0

Abstractの概要

ReWorldは、ユーザーのカメラ操作への追従、過去に訪れた場所の記憶保持、およびリアルタイム動作を同時に実現するように設計されたインタラクティブなストリーミング世界モデルです。その中核となる設計では、学習時に制御と記憶を分離しており、大半のアテンションヘッドが短いウィンドウの反応的制御を学習する一方で、一部のヘッドが長距離の検索を学習し、ヘッドのランダムルーティングによって各機能が特定のヘッドに固定されるのを防ぎます。推論時には、履歴全体が固定のメモリ予算下で空間的に関連する過去のチャンクを保存・検索するポーズ索引付きランドマークバンクによって補助され、有界なKVキャッシュへと圧縮されます。本システムは、Unrealエンジンで描画されたシーン、ゲーム映像、実写動画にまたがるメートル単位のスケールを揃えた8つのデータソースで学習され、LoRAに基づく4ステップ蒸留パスを用いることで、単一のバックボーンで高忠実度モードとリアルタイムモードの両方に対応します。

新規性

本研究の主な新規性は、同一モデル内で異なるアテンションウィンドウを学習させ、どのヘッドをグローバルまたはローカルにするかをランダム化することで、制御と長期記憶を明示的に切り離した点にあります。さらにこれを、ランドマーク統合とポーズに基づく検索を利用した有界メモリ推論スキーム、および実運用時のスパースなキャッシュに適合させるチャンクドロップ学習と組み合わせています。

成果

最近のベースライン6手法を対象とした共通の制御性ベンチマークにおいて、ReWorldは総合で最良の回転誤差(11.95°)と最も優れたカメラ動作の一貫性を達成し、同時に最良の平均VBench品質スコア(0.850)を獲得しました。長期の回文的記憶テストでは、多くのベースラインよりも長い経路を移動しながらもk=96潜在変数において高い再訪類似度(SSIM 0.384、LPIPS 0.332、DINO 0.932、ORB 0.379)を維持し、アブレーションによりランドマークバンクキャッシュが固定された12チャンクの予算下で遠方の想起を改善することが示されています。

論文の注目点

  1. ヘッドごとの混合アテンションウィンドウとランダムなヘッドルーティングを用いて、学習時にアクション制御と空間記憶を分離。
  2. 有界メモリ推論では、チャンクの統合と検索を行うポーズ索引付きランドマークバンクを採用し、学習と推論の乖離を減らすチャンクドロップ学習で支援。
  3. 4ステップのリアルタイム推論に対応しながら、制御性、長期再訪記憶、総合的な映像品質において強力な実証的性能を発揮。

参考リンク

このページはGPT-5、Claude Opus 4、Gemini 3、Gemini 3.1 Flash Image 及びその上位バージョンなどの生成AIを用いて作成されています。内容の保証は一切できません。