論文の概要: One Model, Two Physical Stories: Auditing Misalignment in Multi-Modal World Modeling
- arxiv url: http://arxiv.org/abs/2609.14833v1
- Date: Sun, 13 Sep 2026 22:56:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:06.00666
- Title: One Model, Two Physical Stories: Auditing Misalignment in Multi-Modal World Modeling
- Title(参考訳): 1モデル、2つの物理ストーリー:マルチモーダル・ワールド・モデリングにおけるミスアライメントの検証
- Abstract要約: EmphInternal misalignment と emphexternal misalignment の2つの失敗に焦点を当てる
イベント、マグニチュード、タイミングの共通コントラクトを導出し、比較を測定可能な物理基底パイプラインを構築します。
4つのメカニズムと20の設定で、言語が22のテキストプローブすべてに対して、真の環境に関して正しく答えているのに対して、中立的なビデオは、しばしば不一致である。
- 参考スコア(独自算出の注目度): 2.3869847763504715
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: World models, systems that generate what happens next given current environmental conditions, are increasingly being implemented with multi-modal generation in mind. However, generating multiple modalities simultaneously, such as visual simulations alongside physical state predictions in the form of text, introduces the risk of cross-modal inconsistency. Tested separately, both outputs may look convincing while still disagreeing: a model can calculate that a ball should rebound in one modality, then generate no rebound in another modality, to say nothing of diverging from real-world dynamics entirely. In this work we focus on two failures explicitly: \emph{Internal misalignment}, the disagreement between the world model's generated video and the same world model's prediction in a different modalities, and \emph{external misalignment} the disagreement between the world model's generation and an analytic physical environment. We derive common contracts of event, magnitude, timing, and construct a physics grounded pipeline to make comparisons measurable in both external and internal settings. We then ask whether progressively supplying the model's own contract (the A ladder for the internal setting) or a corrected physical contract (the B ladder for the external setting) closes the respective gaps. Across four mechanisms and 20 settings, we find that while language answers all 22 text probes correctly with respect to the true environment, the neutral video is often in disagreement, suggesting that the current unified backbones may not be capable of correct reasoning, internal consistency, and external physical fidelity all at once.
- Abstract(参考訳): 世界モデルは、現在の環境条件から次に何が起こるかを生成するシステムであり、マルチモーダル世代を念頭に置いてますます実装されている。
しかし、テキスト形式での物理的状態予測と並行して視覚シミュレーションなどの複数のモーダルを同時に生成すると、モダル間の不整合のリスクが生じる。
モデルは、ボールが1つのモードでリバウンドすべきであると計算し、次に別のモードでリバウンドを発生させることなく、現実世界のダイナミクスから完全に分岐することはない。
本研究では,世界モデル生成ビデオと同一世界モデル生成予測との相違点と,世界モデル生成と解析物理環境との相違点に着目する。
イベント、マグニチュード、タイミングの共通コントラクトを導出し、物理基底パイプラインを構築して、外部設定と内部設定の両方で比較を測定できるようにします。
次に、モデル自身の契約(内部設定のAラグ)を段階的に供給するか、または修正された物理的契約(外部設定のBラグ)がそれぞれのギャップを閉じるのかを問う。
4つのメカニズムと20の設定で、言語が22のテキストプローブすべてに真の環境に関して正しく答えているのに対して、中立的なビデオはしばしば不一致であり、現在の統一されたバックボーンは、正しい推論、内部整合性、外部の物理的忠実さを同時に行うことができない可能性があることを示唆している。
関連論文リスト
- PhysWeep: Does a Video Generator Realize the Physics You Ask For? [0.8594140167290097]
各サンプルは確実に間違った定数にロックされ、正確には確率スコアが構造的に盲目である。
PhysWeepは、固定されたラベルのない監査でそれを閉じ、冷凍発電機をブラックボックスとして扱う。
論文 参考訳(メタデータ) (2026-09-05T17:52:46Z) - PAWBench: How Far Are We from Probabilistically Aligned World Modeling? [60.16773899025656]
この分布レベルの要件を確率的アライメント(probabilistic alignment)と呼ぶ。
PAWBenchは、ビデオジェネレータを世界ダイナミクスのサンプルとして評価するためのベンチマークである。
本稿では、繰り返しビデオのロールアウトを経験的分布に変換する結果レベルプロトコルであるPAWEvalを紹介する。
論文 参考訳(メタデータ) (2026-08-27T16:46:38Z) - Marionette: Predicting World States, Rendering Geometry, Painting Appearance [30.170848813370444]
われわれはこのアイデアを,対話型ゲームと明瞭なキャラクタを持つ世界モデルであるMarionetteとしてインスタント化する。
二段階自己回帰力学モデルは、明示的で解釈可能な276次元の3次元世界状態を予測する。
制御条件付きビデオ拡散観測モデルは、結果として得られる制御からフォトリアリスティックなRGB観測を合成する。
論文 参考訳(メタデータ) (2026-08-14T17:48:16Z) - GAUGE: A Measurement-Grounded Benchmark for Physical Fidelity in Simulation Engines and Video World Models [66.77745044586173]
GAUGEは、数値シミュレータと生成ビデオワールドモデルがどのように現実の物理学から再現または逸脱するかを評価するための実世界の診断ベンチマークである。
一般化された軌道誤差を用いて14のタスクファミリー上でIsaac Sim,Genesis,Newtonをベンチマークし,5つの剛体タスクに対して6つのイメージ・ツー・ビデオモデルを評価する。
この結果から, 衝撃的接触, 高速繊維運動, 体積変形に起因する最大の相違点を有する一様忠実な物理エンジンは見つからなかった。
論文 参考訳(メタデータ) (2026-08-06T12:19:38Z) - Testing Frontier Large Language Models' Physics Literacy in Parallel Physical Worlds [8.965092869576262]
そこで本研究では,LLMが未知の物理フレームワーク内で理にかなうことができるかどうかを評価するための,監査可能な4段階診断手法を提案する。
この診断には、ロックされた事前登録、ステージ間の新鮮なセッション、デュアルLLM判定、および人間の監査経路が組み合わされている。
クロードオプス4.7、GPT-5.5、ジェミニ3.1 Proの3つの世界はそれぞれ6/15、6/15、0/15である。
論文 参考訳(メタデータ) (2026-06-30T23:52:15Z) - Can Machines Really See Objects in Images? A Study Based on Syntactic Distance and Visual Self-Referential Instances [53.65561607407989]
そのような局所的な手がかりが区別の安定な基盤を提供しない場合、モデルが依然として正しく分類できるかどうかを問う。
ResNetとVision Transformersの実験では、一貫した位相遷移現象が明らかになった。
結果は、汎用インテリジェンスは、既存の言語を再利用するのではなく、新しい言語を作成する必要があることを示唆している。
論文 参考訳(メタデータ) (2026-06-28T14:27:40Z) - A Physics-Grounded Benchmark for Multi-Agent Dynamics in World Models [96.64934195520802]
我々は、世界モデルの物理的信頼性をストレステストするために設計された物理地上評価フレームワークであるCrashTwinを紹介する。
CrashTwinは、25K制御可能な合成12K実世界の衝突シーケンスを含む、多様なマルチエージェント衝突シナリオのデータセットを結合している。
本稿では,時間的一貫性,運動量,運動エネルギーの保存,世界力学の整合性という3つの次元を体系的に評価する診断スイートを提案する。
論文 参考訳(メタデータ) (2026-06-27T06:13:35Z) - Trimming the Long-Tail of Visual World Modeling Evaluation [67.17191772079316]
本論文では,不規則な物理的相互作用をシミュレートするために世界モデルに挑戦するベンチマークであるTailor-Benchを紹介する。
通常のシナリオは共通のツールとタスクのペアを反映し、従来型のツールを属性互換の代替品に置き換え、Impossibleシナリオは属性違反ツールを導入している。
実験結果から,物理世界モデリングの長期的ギャップは明らかであり,共通相互作用を超越した一般化の限界が示唆された。
論文 参考訳(メタデータ) (2026-06-23T07:43:41Z) - HalluWorld: A Controlled Benchmark for Hallucination via Reference World Models [24.61808957290675]
幻覚は依然として大きな言語モデルの中心的な失敗モードである。
既存のベンチマークでは、要約、質問応答、検索強化生成、エージェント間相互作用など、矛盾なく運用されている。
明示的な参照ワールドの定式化を基礎としたベンチマークであるHaluWorldを紹介する。
論文 参考訳(メタデータ) (2026-05-19T04:29:03Z) - WorldLens: Full-Spectrum Evaluations of Driving World Models in Real World [100.68103378427567]
エージェントは現実的な4D駆動環境を合成し、説得力があるように見えるが、物理的または行動的に失敗することが多い。
モデルがどのように構築され、理解され、その生成された世界の中でどのように振る舞うかを評価するフルスペクトルベンチマークであるWorldLensを紹介します。
さらに、数値的なスコアとテキストの合理性を備えた人間の注釈付きビデオの大規模データセット WorldLens-26K を構築し、WorldLens-Agent を開発した。
論文 参考訳(メタデータ) (2025-12-11T18:59:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。