論文の概要: MIND: Benchmarking Memory Consistency and Action Control in World Models
- arxiv url: http://arxiv.org/abs/2602.08025v2
- Date: Wed, 11 Feb 2026 18:42:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-12 15:03:20.026381
- Title: MIND: Benchmarking Memory Consistency and Action Control in World Models
- Title(参考訳): MIND:世界モデルにおけるメモリ一貫性とアクション制御のベンチマーク
- Abstract要約: 我々は、WarrlDモデルにおけるメモリ一貫性とアクションcoNtrolを評価するための、最初のオープンドメインクローズドループ再検討ベンチマークであるMINDを紹介する。
MINDには1080pと24FPSの高画質ビデオが250本あり、その中には100本(ファーストパーソン)+100本(サードパーソン)のビデオクリップが共有アクションスペースの下に置かれている。
共有シーン下でのアクション空間間のアクション一般化能力を評価するために,キャラクタ移動速度やカメラ回転角など,さまざまなアクション空間を設計する。
- 参考スコア(独自算出の注目度): 28.346879515303755
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: World models aim to understand, remember, and predict dynamic visual environments, yet a unified benchmark for evaluating their fundamental abilities remains lacking. To address this gap, we introduce MIND, the first open-domain closed-loop revisited benchmark for evaluating Memory consIstency and action coNtrol in worlD models. MIND contains 250 high-quality videos at 1080p and 24 FPS, including 100 (first-person) + 100 (third-person) video clips under a shared action space and 25 + 25 clips across varied action spaces covering eight diverse scenes. We design an efficient evaluation framework to measure two core abilities: memory consistency and action control, capturing temporal stability and contextual coherence across viewpoints. Furthermore, we design various action spaces, including different character movement speeds and camera rotation angles, to evaluate the action generalization capability across different action spaces under shared scenes. To facilitate future performance benchmarking on MIND, we introduce MIND-World, a novel interactive Video-to-World baseline. Extensive experiments demonstrate the completeness of MIND and reveal key challenges in current world models, including the difficulty of maintaining long-term memory consistency and generalizing across action spaces. Code: https://github.com/CSU-JPG/MIND.
- Abstract(参考訳): 世界モデルは、動的な視覚環境を理解し、記憶し、予測することを目的としている。
このギャップに対処するため、WarrlDモデルにおけるメモリの一貫性と動作coNtrolを評価するための、最初のオープンドメインクローズドループ再検討ベンチマークであるMINDを紹介する。
MINDには1080pと24FPSの高画質ビデオが250本含まれており、100本(ファーストパーソン)+100本(サードパーソン)のビデオクリップが共有アクションスペースで共有され、25本+25本がアクションスペースで8つのシーンをカバーする。
我々は,記憶の一貫性と動作制御,時間的安定性と視点間のコンテキスト的コヒーレンスといった2つのコア能力を測定するための効率的な評価フレームワークを設計する。
さらに,異なる動きの速度やカメラ回転角を含む様々なアクション空間を設計し,共有シーン下でのアクション空間間のアクション一般化能力を評価する。
MIND上での将来のパフォーマンスベンチマークを容易にするため,新しいインタラクティブなビデオ・ツー・ワールドベースラインであるMIND-Worldを紹介した。
大規模な実験は、MINDの完全性を実証し、長期記憶の整合性を維持することの難しさや行動空間全体の一般化など、現在の世界のモデルにおける重要な課題を明らかにする。
コード:https://github.com/CSU-JPG/MIND。
関連論文リスト
- WorldRoamBench: An Open-World Benchmark for Long-Horizon Stability of Interactive World Models [37.59051701511746]
4次元にわたる長期安定のためのオープンワールドベンチマークであるWorldRoamBenchを紹介する。
このベンチマークは、WASD 10-60sの連続的なインタラクションで、Nature、Urban、Indoorの各シーンで600以上のテストケースで構成されている。
論文 参考訳(メタデータ) (2026-06-30T13:51:44Z) - Mem-World: Memory-Augmented Action-Conditioned World Models for Persistent Robot Manipulation [55.42006264038458]
アクション条件付き世界モデルは、ロボット学習の有望なパラダイムとして登場した。
Mem-Worldはメモリ拡張されたマルチビューアクション条件の世界モデルである。
W-VMemは4次元手首ビュー中心のサーベイルインデクシングメモリで、歴史的観測を時間的に変化する表面要素に固定する。
論文 参考訳(メタデータ) (2026-06-17T11:42:00Z) - DisCo: World Models with Discrete Camera Motion Control [79.86256515640231]
本研究では、離散アクションプリミティブのコンパクトなセットで生成し、アクション分離性を改善する制御可能なビデオワールドモデルであるDisCoを提案する。
DisCoは、視覚的品質を維持しながら、はるかに信頼性の高いアクションを達成する。
論文 参考訳(メタデータ) (2026-06-06T03:50:45Z) - WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation [56.5415838759151]
WBenchはインタラクティブな世界モデルを評価するための総合的なベンチマークである。
ビデオの品質、セッティングアテンジェンス、インタラクションアテンデンス、一貫性、物理コンプライアンスをカバーしている。
289件のテストケースと1,058件のインタラクション・ターンが含まれており、多様なシーン、スタイル、主題、一対三の視点をカバーしている。
論文 参考訳(メタデータ) (2026-05-25T14:01:31Z) - LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment [19.95295518800639]
一般的な視覚基盤モデルは、特殊エンボディ化潜在行動モデルより一貫して優れている。
ラテントベースの視覚空間は、ピクセルベースの空間よりも物理アクション空間に整合している。
論文 参考訳(メタデータ) (2026-04-13T16:30:35Z) - ActionParty: Multi-Subject Action Binding in Generative Video Games [117.52562594944679]
ActionPartyは、ゲーム生成のための制御可能な多目的世界モデルである。
46の多様な環境において最大7人のプレイヤーを同時に制御できる最初のビデオワールドモデルを実証する。
論文 参考訳(メタデータ) (2026-04-02T17:59:58Z) - Out of Sight but Not Out of Mind: Hybrid Memory for Dynamic Video World Models [56.44348799741838]
静的な背景の正確なアーキビストと動的対象の警戒トラッカーを同時に行うためにモデルを必要とする新しいパラダイムであるHybrid Memoryを導入する。
HM-Worldは、ハイブリッドメモリに特化した最初の大規模ビデオデータセットである。
また,メモリをトークンに圧縮し,時間的関連性に基づく検索機構を利用する専用メモリアーキテクチャHyDRAを提案する。
論文 参考訳(メタデータ) (2026-03-26T17:56:01Z) - Olaf-World: Orienting Latent Actions for Video World Modeling [100.96069208914957]
アクションコントロール可能な世界モデルのスケーリングは、アクションラベルの不足によって制限される。
大規模受動的ビデオから行動条件付きビデオワールドモデルを事前訓練するパイプラインであるOraf-Worldを紹介する。
論文 参考訳(メタデータ) (2026-02-10T18:58:41Z) - DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos [110.98100817695307]
私たちはDreamDojoを紹介します。DreamDojoは、多種多様なインタラクションと、エゴセントリックな人間ビデオの44万時間から厳密なコントロールを学ぶ基礎的な世界モデルです。
本研究は, 遠隔操作, 政策評価, モデルベース計画など, 生成的世界モデルに基づくいくつかの重要な応用を可能にする。
論文 参考訳(メタデータ) (2026-02-06T18:49:43Z) - DreamActor-M2: Universal Character Image Animation via Spatiotemporal In-Context Learning [24.808926786222376]
本研究では,DreamActor-M2を提案する。DreamActor-M2は,動作条件をコンテキスト内学習問題として再定義する汎用アニメーションフレームワークである。
まず、参照の出現と動きの手がかりを統一された潜在空間に融合させることにより、入力モダリティギャップを橋渡しする。
次に、擬似的クロスアイデンティティトレーニングペアをキュレートする自己ブートストラップデータ合成パイプラインを導入する。
論文 参考訳(メタデータ) (2026-01-29T13:43:17Z) - Towards High-Consistency Embodied World Model with Multi-View Trajectory Videos [24.111891848073288]
身体的世界モデルは、視覚的な観察と行動を通じて物理的世界と予測し、相互作用することを目的としている。
MTV-Worldは正確なビジュモータ予測のためのマルチビュートラジェクトリ・ビデオ制御を導入した。
MTV-Worldは、複雑なデュアルアームシナリオにおける正確な制御実行と正確な物理的相互作用モデリングを実現する。
論文 参考訳(メタデータ) (2025-11-17T02:17:04Z) - SVAG-Bench: A Large-Scale Benchmark for Multi-Instance Spatio-temporal Video Action Grounding [48.64661382961745]
本研究では,ビデオ中のすべての参照オブジェクトを同時に検出,追跡,時間的ローカライズするモデルを必要とする新しいタスクである,SVAG(Spatio-temporal Video Action Grounding)を紹介する。
SVAG-Benchは688の動画、19,590の注釈付きレコード、903のユニークな動詞からなる大規模ベンチマークである。
実験の結果、既存のモデルではSVAG、特に密集したシーンや複雑なシーンでは性能が良くないことがわかった。
論文 参考訳(メタデータ) (2025-10-14T22:10:49Z) - IWR-Bench: Can LVLMs reconstruct interactive webpage from a user interaction video? [56.33950760097989]
IWR-Benchは、ビデオからインタラクティブなWebページ再構築におけるLVLM(Large Vision-Language Models)の機能を評価するための新しいベンチマークである。
IWR-Benchは100の現実世界のウェブサイトから1,001のアクションで1,3の精巧にキュレートされたタスクで構成されている。
このベンチマークは、ビデオとアセットからインタラクションロジックを推論する包括的なマルチモーダル推論と、このロジックを関数コードに変換するための高度なコード生成という、2つの基本的な課題に関するモデルを評価する。
論文 参考訳(メタデータ) (2025-09-29T12:38:06Z) - HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding [120.84817886550765]
MLLM(Multimodal Large Language Models)は、画像とビデオの両方を含む視覚的理解タスクにおいて、大きな進歩を見せている。
既存の人間中心のベンチマークは、主にビデオ生成の品質と行動認識を強調し、人間中心のシナリオに必要な知覚と認知の能力を見落としている。
我々は,人間中心のビデオ理解におけるMLLMのより総合的な評価を提供するために,厳格にキュレートされたベンチマークを提案する。
論文 参考訳(メタデータ) (2025-07-07T11:52:24Z) - VMem: Consistent Interactive Video Scene Generation with Surfel-Indexed View Memory [55.73900731190389]
Surfel-Indexed View Memory (VMem) は、過去のビューを記憶するメモリモジュールであり、それらが観測した3次元表面要素(サーフェル)に基づいて幾何学的にインデックス化することで、過去のビューを記憶する。
VMemは、新しいビューを生成する際に、最も関連性の高い過去のビューを効率的に検索することを可能にする。
論文 参考訳(メタデータ) (2025-06-23T17:59:56Z) - Training-Free Robust Interactive Video Object Segmentation [82.05906654403684]
対話型ビデオオブジェクトセグメンテーション(I-PT)のためのトレーニングフリープロンプトトラッキングフレームワークを提案する。
スパースポイントとボックストラッキングを共同で採用し、不安定なポイントをフィルタリングし、オブジェクトワイズ情報をキャプチャします。
我々のフレームワークは、人気のあるVOSデータセット上で、ゼロショットビデオセグメンテーションの堅牢な結果を示してきた。
論文 参考訳(メタデータ) (2024-06-08T14:25:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。