論文の概要: MemoBench: Benchmarking World Modeling in Dynamically Changing Environments
- arxiv url: http://arxiv.org/abs/2606.27537v3
- Date: Wed, 01 Jul 2026 17:30:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 15:15:53.050424
- Title: MemoBench: Benchmarking World Modeling in Dynamically Changing Environments
- Title(参考訳): MemoBench: 動的に変化する環境でのベンチマークワールドモデリング
- Authors: Haoyu Chen, Kaichen Zhou, Hang Hua, Kaile Zhang, Jingwen Qian, Wufei Ma, Haonan Chen, Chunjiang Liu, Yizhou Zhao, Xiaoyuan Wang, Weiyue Li, Alan Yuille, Paul Pu Liang, Yilun Du,
- Abstract要約: MemoBenchは動的に変化する環境において、消失・再出現するパラダイムを中心に構築された診断ベンチマークである。
合成シーンと実世界のシーンにまたがる360度地上トラスクリップをキュレートし,VQAに基づく評価と自動メトリクスを組み合わせた評価スイートを設計する。
- 参考スコア(独自算出の注目度): 72.23517478870605
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video generation models aspire to simulate dynamic environments, and several benchmarks now evaluate memory consistency across frames. However, most assess consistency only while the target remains in view, and the few that force objects out of view evaluate static scenes where nothing changes during occlusion. To bridge this gap, we introduce MemoBench, a diagnostic benchmark built around the disappear-and-reappear paradigm in dynamically changing environments: a target object undergoes a physical process, disappears from view, and must be correctly recovered in its updated state upon reappearance. We curate 360 ground-truth clips spanning synthetic and real-world scenes, and design an evaluation suite combining automated metrics with VQA-based assessment across four diagnostic pillars. Evaluation of eight state-of-the-art models reveals key insights and open challenges regarding memory consistency under the disappear-and-reappear paradigm.
- Abstract(参考訳): ビデオ生成モデルは動的環境をシミュレートすることを目的としており、いくつかのベンチマークがフレーム間のメモリ一貫性を評価している。
しかしながら、ほとんどの場合、ターゲットが表示されている間のみ一貫性を評価し、オブジェクトをビューから外す数少ないものは、閉塞時に何も変化しない静的なシーンを評価します。
このギャップを埋めるために、我々はMemoBenchを紹介します。これは動的に変化する環境において、消失と再出現のパラダイムを中心に構築された診断ベンチマークです。ターゲットオブジェクトは物理的プロセスを実行し、ビューから消え、再出現時にその更新状態で正しく回復する必要があります。
合成シーンと実世界のシーンにまたがる360度地中トルースクリップをキュレートし、VQAに基づく自動計測と4つの診断ピラーによる評価を組み合わせた評価スイートを設計した。
8つの最先端モデルの評価は、消失・再出現パラダイムの下でのメモリ一貫性に関する重要な洞察とオープンな課題を明らかにしている。
関連論文リスト
- Mem-World: Memory-Augmented Action-Conditioned World Models for Persistent Robot Manipulation [55.42006264038458]
アクション条件付き世界モデルは、ロボット学習の有望なパラダイムとして登場した。
Mem-Worldはメモリ拡張されたマルチビューアクション条件の世界モデルである。
W-VMemは4次元手首ビュー中心のサーベイルインデクシングメモリで、歴史的観測を時間的に変化する表面要素に固定する。
論文 参考訳(メタデータ) (2026-06-17T11:42:00Z) - CRONOS: Benchmarking Counterfactual Physical Consistency in Video Models [25.976578205889776]
CRONOSは、実際の物理的一貫性を評価するために設計された介入ベースのベンチマークである。
Unreal Engine環境で構築されたCRONOSは、さまざまなシーンやダイナミックスにわたる、制御された高忠実なビデオ生成を可能にする。
論文 参考訳(メタデータ) (2026-05-22T14:51:22Z) - ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning [59.558706734431276]
空間知能の現在の評価は、現代の視覚言語モデル(VLM)設定下で体系的に無効にすることができる。
本稿では,各QAペアが実際の入力の下で応答可能で正しいことを保証するためのベンチマークとプロトコルであるReVSIを紹介する。
論文 参考訳(メタデータ) (2026-04-27T10:45:51Z) - Can Vision Foundation Models Navigate? Zero-Shot Real-World Evaluation and Lessons Learned [5.561294055181353]
ビジュアルナビゲーションモデル(VNM)は、大規模な視覚的なデモンストレーションから学ぶことで、一般化可能なロボットナビゲーションを約束する。
室内と屋外にまたがる2つのロボットプラットフォームと5つの環境にまたがる5つの最先端VNMの現実的評価について述べる。
論文 参考訳(メタデータ) (2026-03-26T22:04:49Z) - EvoEmpirBench: Dynamic Spatial Reasoning with Agent-ExpVer [5.855255212938064]
空間的理解と適応計画におけるモデルの能力を評価する2つの動的空間的ベンチマークを導入する。
実験の結果、我々のベンチマークは、動的空間推論と長期記憶における主流モデルの鍵となる限界を明らかにしている。
論文 参考訳(メタデータ) (2025-09-16T06:21:38Z) - EOC-Bench: Can MLLMs Identify, Recall, and Forecast Objects in an Egocentric World? [52.99661576320663]
マルチモーダル・大規模言語モデル(MLLM)は、自我中心の視覚応用において画期的な進歩を遂げた。
EOC-Benchは、動的自我中心のシナリオにおいて、オブジェクト中心の具体的認識を体系的に評価するために設計された革新的なベンチマークである。
EOC-Benchに基づく各種プロプライエタリ,オープンソース,オブジェクトレベルのMLLMの総合評価を行う。
論文 参考訳(メタデータ) (2025-06-05T17:44:12Z) - DynaVINS++: Robust Visual-Inertial State Estimator in Dynamic Environments by Adaptive Truncated Least Squares and Stable State Recovery [11.37707868611451]
我々はmboxtextitDynaVINS++と呼ばれる堅牢なVINSフレームワークを提案する。
我々のアプローチは、突然の動的オブジェクトを含む動的環境における有望なパフォーマンスを示す。
論文 参考訳(メタデータ) (2024-10-20T12:13:45Z) - Tracking through Containers and Occluders in the Wild [32.86030395660071]
重い閉塞と封じ込めによる視覚追跡のための新しいベンチマークとモデルである$textbfTCOW$を紹介した。
我々は、教師付き学習とモデル性能の構造化評価の両方をサポートするために、合成データセットと注釈付き実データセットの混合を作成する。
最近の2つのトランスフォーマーベースビデオモデルを評価し,タスク変動の特定の設定下でターゲットを驚くほど追跡できるが,トラッキングモデルが真のオブジェクト永続性(permanence)の概念を獲得したと主張するまでには,かなりの性能差が残っていることを発見した。
論文 参考訳(メタデータ) (2023-05-04T17:59:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。