ReWorld: An Interactive World Model with Long-Horizon Memory
Abstractの概要
ReWorldは、ユーザーのカメラ操作への追従、過去に訪れた場所の記憶保持、およびリアルタイム動作を同時に実現するように設計されたインタラクティブなストリーミング世界モデルです。その中核となる設計では、学習時に制御と記憶を分離しており、大半のアテンションヘッドが短いウィンドウの反応的制御を学習する一方で、一部のヘッドが長距離の検索を学習し、ヘッドのランダムルーティングによって各機能が特定のヘッドに固定されるのを防ぎます。推論時には、履歴全体が固定のメモリ予算下で空間的に関連する過去のチャンクを保存・検索するポーズ索引付きランドマークバンクによって補助され、有界なKVキャッシュへと圧縮されます。本システムは、Unrealエンジンで描画されたシーン、ゲーム映像、実写動画にまたがるメートル単位のスケールを揃えた8つのデータソースで学習され、LoRAに基づく4ステップ蒸留パスを用いることで、単一のバックボーンで高忠実度モードとリアルタイムモードの両方に対応します。
新規性
本研究の主な新規性は、同一モデル内で異なるアテンションウィンドウを学習させ、どのヘッドをグローバルまたはローカルにするかをランダム化することで、制御と長期記憶を明示的に切り離した点にあります。さらにこれを、ランドマーク統合とポーズに基づく検索を利用した有界メモリ推論スキーム、および実運用時のスパースなキャッシュに適合させるチャンクドロップ学習と組み合わせています。
成果
最近のベースライン6手法を対象とした共通の制御性ベンチマークにおいて、ReWorldは総合で最良の回転誤差(11.95°)と最も優れたカメラ動作の一貫性を達成し、同時に最良の平均VBench品質スコア(0.850)を獲得しました。長期の回文的記憶テストでは、多くのベースラインよりも長い経路を移動しながらもk=96潜在変数において高い再訪類似度(SSIM 0.384、LPIPS 0.332、DINO 0.932、ORB 0.379)を維持し、アブレーションによりランドマークバンクキャッシュが固定された12チャンクの予算下で遠方の想起を改善することが示されています。
論文の注目点
- ヘッドごとの混合アテンションウィンドウとランダムなヘッドルーティングを用いて、学習時にアクション制御と空間記憶を分離。
- 有界メモリ推論では、チャンクの統合と検索を行うポーズ索引付きランドマークバンクを採用し、学習と推論の乖離を減らすチャンクドロップ学習で支援。
- 4ステップのリアルタイム推論に対応しながら、制御性、長期再訪記憶、総合的な映像品質において強力な実証的性能を発揮。
参考リンク
- arXiv: https://arxiv.org/abs/2608.23565v1
- Fugu-MT: https://fugumt.com/fugumt/paper_check/2608.23565v1
- Hugging Face Papers: https://huggingface.co/papers/2608.23565
- Project: https://zhifeichen097.github.io/ReWorld/