論文の概要: WorldOdysseyBench: An Open-World Benchmark for Long-Horizon Stability of Interactive World Models
- arxiv url: http://arxiv.org/abs/2606.31672v2
- Date: Thu, 02 Jul 2026 13:17:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 15:16:32.256409
- Title: WorldOdysseyBench: An Open-World Benchmark for Long-Horizon Stability of Interactive World Models
- Title(参考訳): WorldOdysseyBench: 対話型世界モデルの長期安定のためのオープンワールドベンチマーク
- Authors: Ting-Bing Xu, Jiacheng Sui, Zhe Gao, Kewei Shi, Wenjin Yang, Zhicheng Liu, Zhaoxu Sun, Mingchao Sun, Hongyu Pan, Fan Jiang, Mu Xu, Qi Fan, Yang Gao, Yong Li, Baoquan Chen,
- Abstract要約: 我々は4次元にわたる長期安定のためのオープンワールドベンチマークであるWorldOdysseyBenchを紹介する。
このベンチマークは、WASD 10-60sの連続的なインタラクションで、Nature、Urban、Indoorの各シーンで600以上のテストケースで構成されている。
- 参考スコア(独自算出の注目度): 37.59051701511746
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Despite rapid progress in interactive world models (IWMs), existing benchmarks evaluate action following only at trajectory level and ignore memory and interaction physics. We introduce WorldOdysseyBench, an open-world benchmark for long-horizon stability across four dimensions, each with tailored innovations: (i) Action: per-frame action metric bypassing cross-model semantic scale disparity and exposing failures hidden by trajectory; (ii) Vision: segment-based drift metric capturing non-monotonic mid-sequence collapse missed by start-vs-end comparisons; (iii) Physics: controllability-gated evaluation over mechanics, optics, and 3D consistency, scoring plausibility under faithful action execution; (iv) Memory: action-decoupled protocol evaluating scene memory via transition-localized 3D point-cloud reconstruction and subject memory via tracking-plus-VLM reasoning. The benchmark comprises 600+ test cases across Nature, Urban, and Indoor scenes in first/third-person views with WASD 10-60s continuous interaction. Evaluating 10+ open/closed-source models reveals none reliably satisfies all dimensions; even the best achieves only moderate scores. Advances on WorldOdysseyBench are steps toward IWMs that are stable, physically grounded, memory-faithful, and deployable in real-world applications.
- Abstract(参考訳): 対話型世界モデル(IWM)の急速な進歩にもかかわらず、既存のベンチマークでは、軌道レベルでのみ行動を評価し、メモリと相互作用の物理を無視している。
WorldOdysseyBenchは、4次元にわたる長期安定のためのオープンワールドベンチマークです。
一 アクション:クロスモデルセマンティックスケールの相違を回避し、軌道に隠された障害を露呈するフレーム毎のアクションメトリック
(二)視覚:非単調な中間系列の崩壊を捉えたセグメントベースドリフト距離を始末比較で見逃す。
三 物理 機械、光学及び立体整合性に対する可制御性評価であって、忠実な行動実行下での可否を評価すること。
(iv) メモリ: トランジションローカライズされた3Dポイントクラウド再構成と、トラッキング+VLM推論による主観記憶によりシーンメモリを評価するアクションデカップリングプロトコル。
このベンチマークは、WASD 10-60sの連続的なインタラクションで、Nature、Urban、Indoorの各シーンで600以上のテストケースで構成されている。
10以上のオープン/クローズドソースモデルを評価することは、すべての次元を確実に満足させるものではない。
WorldOdysseyBenchの進歩は、安定的で物理的基盤があり、メモリフルで、現実世界のアプリケーションでデプロイ可能なIWMへのステップである。
関連論文リスト
- MemoBench: Benchmarking World Modeling in Dynamically Changing Environments [72.23517478870605]
MemoBenchは動的に変化する環境において、消失・再出現するパラダイムを中心に構築された診断ベンチマークである。
合成シーンと実世界のシーンにまたがる360度地上トラスクリップをキュレートし,VQAに基づく評価と自動メトリクスを組み合わせた評価スイートを設計する。
論文 参考訳(メタデータ) (2026-06-25T20:37:39Z) - Mem-World: Memory-Augmented Action-Conditioned World Models for Persistent Robot Manipulation [55.42006264038458]
アクション条件付き世界モデルは、ロボット学習の有望なパラダイムとして登場した。
Mem-Worldはメモリ拡張されたマルチビューアクション条件の世界モデルである。
W-VMemは4次元手首ビュー中心のサーベイルインデクシングメモリで、歴史的観測を時間的に変化する表面要素に固定する。
論文 参考訳(メタデータ) (2026-06-17T11:42:00Z) - WorldMark: A Unified Benchmark Suite for Interactive Video World Models [29.83820642224732]
We introduced WorldMark, the first benchmark that provide a common play field for interactive Image-to-Video world models。
ワールドマークは、(1)共通のWASDスタイルのアクション語彙を各モデルのネイティブコントロール形式に変換し、同一のシーンと軌跡の6つの主要モデル間でリンゴとアプリの比較を可能にする統一アクションマッピング層、(2)1人目と3人目、フォトリアリスティックでスタイリングされたシーン、そして容易からハードまでの3つの難易度を含む500の評価ケースの階層的なテストスイート、(3)視覚品質、制御アライメント、世界一貫性のためのモジュラー評価ツールキット
論文 参考訳(メタデータ) (2026-04-23T13:50:47Z) - Can Vision Foundation Models Navigate? Zero-Shot Real-World Evaluation and Lessons Learned [5.561294055181353]
ビジュアルナビゲーションモデル(VNM)は、大規模な視覚的なデモンストレーションから学ぶことで、一般化可能なロボットナビゲーションを約束する。
室内と屋外にまたがる2つのロボットプラットフォームと5つの環境にまたがる5つの最先端VNMの現実的評価について述べる。
論文 参考訳(メタデータ) (2026-03-26T22:04:49Z) - Omni-WorldBench: Towards a Comprehensive Interaction-Centric Evaluation for World Models [39.648000265543445]
ビデオベースの世界モデルは、ビデオ生成と3D再構成という2つの支配的なパラダイムに沿って登場した。
世界モデリングの未来は、空間構造と時間的進化を共同でモデル化する4D世代にあると我々は主張する。
Omni-WorldBenchは,世界モデルの対話的応答能力を4次元設定で評価するためのベンチマークである。
論文 参考訳(メタデータ) (2026-03-23T17:10:29Z) - MIND: Benchmarking Memory Consistency and Action Control in World Models [28.346879515303755]
我々は、WarrlDモデルにおけるメモリ一貫性とアクションcoNtrolを評価するための、最初のオープンドメインクローズドループ再検討ベンチマークであるMINDを紹介する。
MINDには1080pと24FPSの高画質ビデオが250本あり、その中には100本(ファーストパーソン)+100本(サードパーソン)のビデオクリップが共有アクションスペースの下に置かれている。
共有シーン下でのアクション空間間のアクション一般化能力を評価するために,キャラクタ移動速度やカメラ回転角など,さまざまなアクション空間を設計する。
論文 参考訳(メタデータ) (2026-02-08T15:57:23Z) - Infinite-World: Scaling Interactive World Models to 1000-Frame Horizons via Pose-Free Hierarchical Memory [101.2076718776139]
複雑な実環境において,1000フレーム以上のコヒーレントな視覚記憶を維持することのできる,堅牢な対話型世界モデルを提案する。
我々は,歴史的潜水剤を固定予算の幾何学的表現に蒸留するpose-free Memory (HPMC)を導入する。
また,連続動作を三状態論理に識別する不確実性認識型アクションラベルモジュールを提案する。
論文 参考訳(メタデータ) (2026-02-02T17:52:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。