論文の概要: Mental World Modeling
- arxiv url: http://arxiv.org/abs/2607.27201v1
- Date: Wed, 29 Jul 2026 17:59:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.780248
- Title: Mental World Modeling
- Title(参考訳): メンタルワールドモデリング
- Authors: Hao Fei, Yiran Zhao,
- Abstract要約: メンタル・ワールド・モデリング(英: Mental World Modeling、MWM)は、メンタル変数を世界モデルのコアコンポーネントとする一般的な理論フレームワークである。
トレーニング不要で完全に検査可能なベースラインであるMENTISのフレームワークをインスタンス化する。
現代の8つのLLMベースの世界モデルを用いた実験では、人間の決定を予測するためには、精神状態を明示的にモデル化することが不可欠であることが示されている。
- 参考スコア(独自算出の注目度): 16.554275457748606
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: World models enable a predictive substrate for planning and action, yet existing formulations merely answer a physical question: what/where it is, and how will it evolve. Human behavior, however, is driven by hidden mental state (what a person believes, wants, intends, feels, and considers socially permissible), so a model that tracks the physical scene but not what each agent knows and believes about it predicts the wrong action for the right-looking scene. We formulate Mental World Modeling (MWM), a generic theoretical framework that makes mental variables core components of a world model rather than posthoc rationales: MWM aintains a coupled physical-mental world state, renders a target-specific partial observation, and simulates how candidate actions jointly update both components. We instantiate the framework in MENTIS, a training-free and fully inspectable baseline that decomposes the process into state parsing, target-observation generation, action decomposition, coupled physical and mental transition, and branch-level value evaluation. On a manually constructed, quality-controlled dataset of situated decision scenarios spanning text, image, and sounding-video stories, experiments with 8 modern LLM-based world models demonstrate that explicitly modeling the mental state is essential for predicting human decisions. Deeper analyses further expose the bottlenecks of current mental world modeling. We expect MWM as a next stage of world modeling, from simulating physical scenes to simulating the minds that act in them.
- Abstract(参考訳): 世界モデルは計画と行動のための予測的な基質を可能にするが、既存の定式化は単に物理的な疑問に答えるだけである。
しかし、人間の行動は隠れた精神状態(人が信じているもの、望んでいるもの、感じているもの、社会的に許容できるもの)によって駆動されるため、各エージェントが知っているものではなく、正しい場面の間違った行動を予測するモデルである。
我々は、心的世界モデリング(MWM: Mental World Modeling)を定式化した。それは、心的変数のコアコンポーネントを、ポストホックな合理性ではなく、世界モデルのコアコンポーネントにする一般的な理論フレームワークである。
我々は、このフレームワークをMENTISでインスタンス化し、トレーニング不要で完全に検査可能なベースラインで、プロセスを状態解析、目標観測生成、行動分解、身体と精神の同時移行、分岐レベルの価値評価に分解する。
手動で構築され、テキスト、画像、トーキングビデオにまたがる位置決定シナリオの質制御されたデータセット上で、8つの現代のLCMベースの世界モデルによる実験は、人間の決定を予測するために精神状態を明示的にモデル化することが不可欠であることを示した。
より深い分析は、現在のメンタルワールドモデリングのボトルネックをさらに明らかにする。
MWMは、物理シーンのシミュレートから、それらに作用する心のシミュレートまで、世界モデリングの次の段階として期待している。
関連論文リスト
- Inferring World Belief States in Dynamic Real-World Environments [0.46498278084317707]
本研究では,動的・3次元・部分的に観察可能な環境下でのロボットの観察による人間の世界信念状態の推定について検討する。
本手法を現実的なシミュレーションで評価し、実世界のロボットプラットフォームに拡張し、アクティブ・アシスト・セマンティック・推論タスクを通じて信念状態の下流適用を実演する。
論文 参考訳(メタデータ) (2026-04-13T05:34:26Z) - Grounding Social Perception in Intuitive Physics [55.69427097024444]
本稿では,計画,確率的計画,物理シミュレーションを統合し,エージェントの目標と関係を軌道から推測するモデルを提案する。
以上の結果から,本モデルが社会的場面の物理的理解の方法の計算的説明を提供する可能性が示唆された。
論文 参考訳(メタデータ) (2026-03-28T21:14:49Z) - WorldLens: Full-Spectrum Evaluations of Driving World Models in Real World [100.68103378427567]
エージェントは現実的な4D駆動環境を合成し、説得力があるように見えるが、物理的または行動的に失敗することが多い。
モデルがどのように構築され、理解され、その生成された世界の中でどのように振る舞うかを評価するフルスペクトルベンチマークであるWorldLensを紹介します。
さらに、数値的なスコアとテキストの合理性を備えた人間の注釈付きビデオの大規模データセット WorldLens-26K を構築し、WorldLens-Agent を開発した。
論文 参考訳(メタデータ) (2025-12-11T18:59:58Z) - WoW: Towards a World omniscient World model Through Embodied Interaction [83.43543124512719]
世界モデルの正当性的な物理的直観は、現実世界との広範囲で因果的に豊かな相互作用に基礎を置いていなければならない。
このWoWは、200万のロボットインタラクショントラジェクトリに基づいてトレーニングされた、ジェネレーティブな世界モデルである。
WoWBenchは、ビデオの物理的一貫性と因果推論に焦点を当てた新しいベンチマークである。
論文 参考訳(メタデータ) (2025-09-26T17:59:07Z) - Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation [54.3628937181904]
内部世界モデル(英語版)(WM)は、エージェントが世界の状態を理解し、遷移を予測することを可能にする。
近年,OpenAI o3, GPT-4o, Geminiなどの大規模視覚言語モデル(VLM)は汎用的なWMとしての可能性を示している。
論文 参考訳(メタデータ) (2025-06-27T03:24:29Z) - Whole-Body Conditioned Egocentric Video Prediction [98.94980209293776]
我々は、人間行動(PEVA)からエゴ中心のビデオを予測するモデルを訓練する。
身体の関節階層によって構成される運動的ポーズの軌跡を条件にすることで,人間の身体行動が1対1の視点から環境をどう形成するかをシミュレートする。
我々の研究は、複雑な現実世界の環境をモデル化し、人間の視点から映像を予測するエージェントの振る舞いを具体化するための最初の試みである。
論文 参考訳(メタデータ) (2025-06-26T17:59:59Z) - WorldPrediction: A Benchmark for High-level World Modeling and Long-horizon Procedural Planning [52.36434784963598]
我々は、異なるAIモデルのワールドモデリングと手続き計画能力を評価するためのビデオベースのベンチマークであるWorldPredictionを紹介する。
現在のフロンティアモデルでは,WorldPrediction-WMでは57%,WorldPrediction-PPでは38%の精度しか達成できないが,人間は両タスクを完璧に解くことができる。
論文 参考訳(メタデータ) (2025-06-04T18:22:40Z) - Causal World Models by Unsupervised Deconfounding of Physical Dynamics [20.447000858907646]
世界の精神モデルで内部を想像する能力は、人間の認知にとって極めて重要である。
本稿では,相互関係の教師なしモデリングを可能にするCausal World Models(CWMs)を提案する。
強化学習タスクの複雑性サンプルの削減と、反実物的推論の改善を示します。
論文 参考訳(メタデータ) (2020-12-28T13:44:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。