論文の概要: FireWorldBench: Benchmarking Complex Physical World Intelligence through Coupled-Field Fire Dynamics
- arxiv url: http://arxiv.org/abs/2609.23064v1
- Date: Sat, 19 Sep 2026 14:50:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:03.922433
- Title: FireWorldBench: Benchmarking Complex Physical World Intelligence through Coupled-Field Fire Dynamics
- Title(参考訳): FireWorldBench: 結合フィールドファイアダイナミクスによる複雑な物理世界インテリジェンスベンチマーク
- Abstract要約: FireWorldBenchは、大規模な言語モデルとエージェントで複雑な物理世界のインテリジェンスを評価するためのベンチマークである。
FireWorldBenchは、物理能力軸と火災シナリオタスク軸の2つの補完軸に沿って構成されている。
ベンチマークには520のファイアワールドエントリが含まれており、494の制御されたシミュレーションワールドと26の実世界のイベントグループが含まれている。
- 参考スコア(独自算出の注目度): 29.083752420705395
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Understanding the physical world requires more than object recognition, scene description, and short-term visual prediction, as real-world physical systems involve multiple continuous fields, latent causal mechanisms, partial observations, and intervention-sensitive dynamics. We propose FireWorldBench, a benchmark for evaluating complex physical world intelligence in multimodal large language models and agents through coupled-field fire dynamics. Fire provides a canonical stress-test environment, where multiple interacting physical fields jointly shape observable states and temporal dynamics. FireWorldBench is organized along two complementary axes, a physical capability axis and a fire scenario task axis, jointly covering physical-state understanding, temporal dynamics, causal mechanisms, and intervention reasoning. The benchmark comprises 520 fire-world entries, including 494 controlled simulation worlds and 26 real-world-aligned event groups, spanning 47 scene archetypes across 7 environment families. These entries combine structured textual observations, multiple 2D physical-field visualizations, and 3D event-level scene modeling, yielding 9,074 text-image interleaved question-answer pairs across choice-based and open-ended report-generation formats. FireWorldBench evaluates whether models can infer latent physical states, explain underlying mechanisms, forecast coupled-field evolution, and assess intervention consequences from multimodal partial observations, providing a challenging testbed for complex physical world intelligence.
- Abstract(参考訳): 物理的な世界を理解するには、物体認識、シーン記述、短期的な視覚的予測以上のものが必要である。
本研究では,多モーダル大言語モデルとエージェントにおける複雑な物理世界インテリジェンスを評価するためのベンチマークFireWorldBenchを提案する。
火災は標準的なストレステスト環境を提供し、複数の相互作用する物理的場が観測可能な状態と時間的ダイナミクスを共同で形成する。
FireWorldBenchは、物理的能力軸と火災シナリオタスク軸の2つの補完軸に沿って組織され、物理的状態理解、時間力学、因果機構、介入推論を共同でカバーしている。
494の制御されたシミュレーションワールドと26の実世界のイベントグループを含む520のファイアワールドエントリーで構成されており、7つの環境ファミリーにわたる47のシーンアーキタイプにまたがっている。
これらのエントリは、構造化されたテキスト観察、複数の2次元物理フィールドの可視化、および3Dイベントレベルのシーンモデリングを組み合わせることで、選択ベースおよびオープンなレポート生成フォーマット間で9,074のテキストイメージ間の問合せペアを生成する。
FireWorldBenchは、モデルが遅延物理状態を推論し、基礎となるメカニズムを説明し、結合フィールドの進化を予測し、マルチモーダルな部分的な観測による介入の結果を評価し、複雑な物理世界知能のための挑戦的なテストベッドを提供するかどうかを評価する。
関連論文リスト
- Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning [79.29811222102721]
実行可能な世界表現を通じて物理世界を表現するパラダイムであるCode-as-Worldを紹介する。
物理的な構成、動的進化、視覚的な外観を実行可能なコードとして表現することで、Code-as-Worldは物理的世界のコンパクトで定量的に基礎付けられ、制御可能な抽象化を提供する。
検証可能世界を用いて、定量的物理推論に基づく視覚言語モデルのトレーニングにスケーラブルな物理監視を提供する。
論文 参考訳(メタデータ) (2026-08-27T17:57:25Z) - GAUGE: A Measurement-Grounded Benchmark for Physical Fidelity in Simulation Engines and Video World Models [66.77745044586173]
GAUGEは、数値シミュレータと生成ビデオワールドモデルがどのように現実の物理学から再現または逸脱するかを評価するための実世界の診断ベンチマークである。
一般化された軌道誤差を用いて14のタスクファミリー上でIsaac Sim,Genesis,Newtonをベンチマークし,5つの剛体タスクに対して6つのイメージ・ツー・ビデオモデルを評価する。
この結果から, 衝撃的接触, 高速繊維運動, 体積変形に起因する最大の相違点を有する一様忠実な物理エンジンは見つからなかった。
論文 参考訳(メタデータ) (2026-08-06T12:19:38Z) - Event-Conditioned Diagnostics of Kinematic, Contact, and Object-Permanence Fields in Passive Object-State World Models [6.556150313826966]
受動オブジェクト状態世界モデルにおけるイベント条件付潜時物理構造について検討する。
隠れ表現がイベント登録情報をエンコードするかどうかをテストする。
その結果、イベントコンディショニングされた組織と、潜伏した物理的フィールドの固定水平機能感度が支援された。
論文 参考訳(メタデータ) (2026-06-26T10:11:59Z) - ACWM-Phys: Investigating Generalized Physical Interaction in Action-Conditioned Video World Models [30.527810700174488]
行動条件付き世界モデル(ACWM)は,映像の予測と意思決定に強く期待されている。
本稿では,多様な物理力学下での行動条件予測のための新しいベンチマークであるACWM-Physを紹介する。
論文 参考訳(メタデータ) (2026-05-09T00:00:47Z) - Thinking in Dynamics: How Multimodal Large Language Models Perceive, Track, and Reason Dynamics in Physical 4D World [49.80040477190479]
人間は物理的4Dの世界に住み、幾何学的構造と意味的内容は時間とともに進化する。
さまざまな実世界および合成ビデオデータセットから構築された大規模ベンチマークであるDyn-Benchを紹介した。
既存のモデルでは,時間的推論と動的オブジェクトグラウンドの両面において,高い性能を同時に維持できないことがわかった。
論文 参考訳(メタデータ) (2026-03-13T07:42:16Z) - FOLIAGE: Towards Physical Intelligence World Models Via Unbounded Surface Evolution [8.895165270489167]
本稿では,物理インフォームド・マルチモーダル世界モデルFOLIAGEを提案する。
Action-Perceptionループでは、統合コンテキストがイメージ、メッシュ接続、ポイントクラウドを共有潜在状態にマップする。
物理制御アクションを条件とした物理認識予測器は、この潜伏状態に時間をかけて、表面の目標潜伏状態と整合する。
論文 参考訳(メタデータ) (2025-05-29T01:16:58Z) - ContPhy: Continuum Physical Concept Learning and Reasoning from Videos [86.63174804149216]
ContPhyは、マシン物理常識を評価するための新しいベンチマークである。
私たちは、さまざまなAIモデルを評価し、ContPhyで満足なパフォーマンスを達成するのに依然として苦労していることがわかった。
また、近年の大規模言語モデルとパーティクルベースの物理力学モデルを組み合わせるためのオラクルモデル(ContPRO)を導入する。
論文 参考訳(メタデータ) (2024-02-09T01:09:21Z) - ThreeDWorld: A Platform for Interactive Multi-Modal Physical Simulation [75.0278287071591]
ThreeDWorld (TDW) はインタラクティブなマルチモーダル物理シミュレーションのためのプラットフォームである。
TDWは、リッチな3D環境において、高忠実な感覚データのシミュレーションと、移動体エージェントとオブジェクト間の物理的相互作用を可能にする。
我々は、コンピュータビジョン、機械学習、認知科学における新たな研究方向において、TDWによって実現された初期実験を提示する。
論文 参考訳(メタデータ) (2020-07-09T17:33:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。