MemLearner: Learning to Query Context memory for Video World Models
Abstractの概要
本論文は、ルールベースのコンテキスト検索を学習済みコンテキストクエリプロセスに置き換える、ビデオ世界モデルのためのメモリメカニズム「MemLearner」を提案しています。この手法では、過去のコンテキストトークンと将来の予測トークンを繋ぐクエリトークンを導入し、別途学習したモジュールではなく、事前学習済みのビデオ生成モデル内部でこのクエリを実行します。また、再訪、オクルージョン、動的オブジェクト、正確なカメラ姿勢のために設計されたレンダリング長尺ビデオデータセット、および個別のカメラエンコーダを通じてレンダリングビデオと実ビデオを統合するマルチデータセット学習戦略も提供しています。実験では、合成環境と実世界環境の両方において、シーンの整合性、メモリ、視覚的品質、効率性、堅牢性を評価しています。
新規性
主な新規性は、手動で設計した検索ルールや別途学習したメモリモジュールではなく、事前学習済みの拡散Transformer自体の中でクエリトークンを使用する、学習ベースの適応型コンテキストクエリメカニズムです。また、このメカニズムを、オクルージョンや動的要素に焦点を当てた新しい長尺ビデオデータセットや、カメラアノテーションの品質のばらつきに対応するマルチデータセット学習戦略と組み合わせている点も特徴的です。
成果
MemLearnerは、論文の主要な比較表において最良の結果を達成し、著者らの難易度の高いデータセットにおいて、従来手法よりもメモリ関連および視覚的品質の両方の指標を向上させました。特にオクルージョンや動的オブジェクトのシナリオにおいてルールベースの検索ベースラインよりも優れており、それらの課題がないシンプルなCaMデータセットでは改善幅は小さいもののプラスの効果を示しています。アブレーション調査により、クエリに事前学習済みのビデオモデル自体を使用することが効果的である一方、ゼロから学習させた個別のクエリモジュールでは有用なコンテキスト条件付けを学習できないことがさらに示されました。
論文の注目点
- MemLearnerはクエリトークンを使用して、将来のビデオ生成のために有用な過去の履歴情報を適応的に抽出し、そのクエリは事前学習済みのビデオ拡散モデル内で実行される。
- コンテキストのクエリ処理を初期の層に限定し、不要なアテンションパターンを削除することで、トレーニングと推論のコストを削減する効率化戦略を導入している。
- 提案手法は、オクルージョン、動的オブジェクト、再訪、及びカメラ姿勢を含む新しいレンダリング長尺ビデオデータセットによって裏付けられており、合成環境および実世界環境の評価全体にわたって堅牢な改善を示している。
参考リンク
- arXiv: https://arxiv.org/abs/2606.31734v1
- Fugu-MT: https://fugumt.com/fugumt/paper_check/2606.31734v1
- Hugging Face Papers: https://huggingface.co/papers/2606.31734
- Project: https://yujiwen.github.io/memlearner/