論文の概要: MemLearner: Learning to Query Context memory for Video World Models
- arxiv url: http://arxiv.org/abs/2606.31734v1
- Date: Tue, 30 Jun 2026 14:31:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.269955
- Title: MemLearner: Learning to Query Context memory for Video World Models
- Title(参考訳): MemLearner: ビデオワールドモデルのためのコンテキストメモリのクエリを学ぶ
- Authors: Jiwen Yu, Jianxiong Gao, Jianhong Bai, Yiran Qin, Kaiyi Huang, Quande Liu, Xintao Wang, Pengfei Wan, Kun Gai, Xihui Liu,
- Abstract要約: 本稿では,クエリトークンを用いてコンテキストと予測トークンをブリッジする学習型適応型コンテキストクエリ手法であるMemLearnerを提案する。
MemLearnerは、スクラッチから追加モジュールをトレーニングすることなく、事前トレーニングされた視覚的事前を活用でき、トレーニングと推論のための効率的な戦略が組み込まれている。
大規模な実験により、MemLearnerはシーンの一貫性とメモリの点で、以前のビデオワールドモデルよりも大幅に優れていた。
- 参考スコア(独自算出の注目度): 54.156384983859816
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video World Models are interactive video generation models that predict future world states based on user actions and history video frames. A critical challenge in video world models is the lack of memory, causing inconsistent generated scenes over extended durations. Previous methods explored rule-based context frame retrieval as memory, but they fail to generalize in scenarios with scene occlusions and dynamic objects. We propose MemLearner, a learning-based adaptive context query method using query tokens to bridge context and predicted tokens. By leveraging the video generation model itself for context querying, MemLearner exploits pre-trained visual priors without training additional modules from scratch, and incorporates efficient strategies for training and inference. We collect a dataset of long videos with scene occlusions and dynamic objects, paired with camera pose annotations, and propose a multi-dataset training strategy leveraging both annotated rendered and unannotated real-world videos. Extensive experiments demonstrate that MemLearner significantly outperforms prior video world models in terms of scene consistency and memory, particularly under challenging occlusion and dynamic scenarios.
- Abstract(参考訳): ビデオワールドモデル(英語: Video World Models)は、ユーザーアクションと履歴ビデオフレームに基づいて将来の世界状態を予測するインタラクティブなビデオ生成モデルである。
ビデオワールドモデルにおける重要な課題は、記憶の欠如であり、長期にわたる不整合の生成シーンを引き起こすことである。
従来の手法では、ルールベースのコンテキストフレームの検索をメモリとして検討していたが、シーン閉塞や動的オブジェクトのシナリオでは一般化できなかった。
本稿では,クエリトークンを用いてコンテキストと予測トークンをブリッジする学習型適応型コンテキストクエリ手法であるMemLearnerを提案する。
ビデオ生成モデル自体をコンテキストクエリに活用することにより、MemLearnerは、スクラッチから追加モジュールをトレーニングすることなく、事前トレーニングされた視覚的事前を活用でき、トレーニングと推論のための効率的な戦略が組み込まれている。
シーンオクルージョンとダイナミックオブジェクトのデータセットを収集し、カメラポーズアノテーションと組み合わせて、アノテーション付きおよび非アノテーション付き実世界のビデオを活用するマルチデータセットトレーニング戦略を提案する。
大規模な実験により、MemLearnerはシーンの一貫性と記憶の点で、特に挑戦的な閉塞と動的なシナリオにおいて、以前のビデオワールドモデルよりも大幅に優れていたことが示される。
関連論文リスト
- VideoWeave: A Data-Centric Approach for Efficient Video Understanding [54.5804686337209]
我々は、合成長文学習サンプルを構築して、データ効率を改善するためのシンプルで効果的な方法であるVideoWeaveを提案する。
VideoWeaveは、利用可能なビデオテキストペアを再編成して、固定計算内で時間的多様性を拡大する。
我々の結果は、アーキテクチャを変更するのではなく、トレーニングデータを再編成することで、ビデオ言語モデルをトレーニングするためのシンプルでスケーラブルなパスを提供できることを強調している。
論文 参考訳(メタデータ) (2026-01-09T20:55:26Z) - FrameMind: Frame-Interleaved Video Reasoning via Reinforcement Learning [65.42201665046505]
現在のビデオ理解モデルは、各質問の特定の推論条件にかかわらず、固定されたフレームサンプリング戦略に依存し、所定の視覚入力を処理する。
この静的アプローチは、視覚的エビデンスを適応的に収集する能力を制限し、広範囲の時間的カバレッジやきめ細かい空間的詳細を必要とするタスクにおいて、最適以下のパフォーマンスをもたらす。
Frame-Interleaved Chain-of-Thought (FiCOT)を通して、モデルが推論中に視覚情報を動的に要求することを可能にする強化学習で訓練されたエンドツーエンドフレームワークであるFrameMindを紹介する。
従来のアプローチとは異なり、FrameMindは複数のターンで動作し、モデルがテキスト推論とアクティブな視覚知覚を交互に切り替え、ツールを使って抽出する。
論文 参考訳(メタデータ) (2025-09-28T17:59:43Z) - Video In-context Learning: Autoregressive Transformers are Zero-Shot Video Imitators [46.40277880351059]
環境と相互作用するモデルのための新しいインタフェースとして視覚信号を活用することを検討する。
デモビデオからセマンティクスを推測し,そのセマンティクスを未知のシナリオに模倣する,ゼロショット機能を実現していることがわかった。
その結果,本モデルでは,デモビデオが提供する意味指導と正確に一致した高品質なビデオクリップを生成できることがわかった。
論文 参考訳(メタデータ) (2024-07-10T04:27:06Z) - VidCoM: Fast Video Comprehension through Large Language Models with Multimodal Tools [44.78291853329394]
textbfVidCoMは、Large Language Models (LLM)を活用して、軽量なビジュアルツールを使用して動画を推論する高速適応フレームワークである。
InsOVERアルゴリズムは、言語命令の分解とビデオイベントの間の効率的なハンガリー語マッチングに基づいて、対応するビデオイベントを特定する。
論文 参考訳(メタデータ) (2023-10-16T17:05:56Z) - Pre-training Contextualized World Models with In-the-wild Videos for
Reinforcement Learning [54.67880602409801]
本稿では,視覚制御タスクの学習を効率的に行うために,Wild 動画を多用した事前学習型世界モデルの課題について検討する。
本稿では、コンテキストと動的モデリングを明確に分離したContextualized World Models(ContextWM)を紹介する。
実験により,ContextWMを内蔵したWildビデオ事前学習は,モデルベース強化学習のサンプル効率を大幅に向上できることが示された。
論文 参考訳(メタデータ) (2023-05-29T14:29:12Z) - CLIP-It! Language-Guided Video Summarization [96.69415453447166]
この作業では、ジェネリックとクエリにフォーカスしたビデオ要約に対処する単一のフレームワークであるCLIP-Itを導入する。
本稿では,言語誘導型マルチモーダルトランスフォーマーを提案する。
本モデルは, 地道的な監督を伴わずに, 訓練により教師なしの設定に拡張することができる。
論文 参考訳(メタデータ) (2021-07-01T17:59:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。