論文の概要: World Models for Embodied Intelligence: From Plausible to Controllable to Actionable
- arxiv url: http://arxiv.org/abs/2609.16697v1
- Date: Tue, 15 Sep 2026 06:22:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.37425
- Title: World Models for Embodied Intelligence: From Plausible to Controllable to Actionable
- Title(参考訳): 身体的インテリジェンスのための世界モデル:プラチブルからコントロール可能からアクション可能へ
- Abstract要約: 世界モデルは、隠れた状態を維持し、結果を予測し、介入を比較し、実行が期待から外れたときに適応することによって、インテリジェンスにおける知覚と意思決定を結びつける。
これは、どの予測能力が振る舞いを改善するかという、中心的な疑問を提起する。
可塑性モデルは、タスク関連時間的・幾何学的・物理的構造を保存し、制御可能なモデルは、介入がどのように構造を変えるかを予測し、アクション可能なモデルは、予測を計画、行動、学習、評価、検証、回復、データ選択において測定可能な利得に変換する。
- 参考スコア(独自算出の注目度): 100.13060753774657
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: World models connect perception and decision-making in embodied intelligence by maintaining hidden state, anticipating consequences, comparing interventions, and adapting when execution departs from expectations. Although progress is often measured by visual fidelity, their value lies in improving behavior. Before reaching for a cup, a person anticipates its weight and resistance to grasping, shaping the hand before contact. Such anticipation is coarse and rarely pictorial, yet it guides action. This raises a central question: which predictive capabilities improve behavior? Existing surveys, organized by architecture, output modality, or application domain, leave this question implicit. We introduce three progressively stronger capability levels: Plausible models preserve task-relevant temporal, geometric, or physical structure; Controllable models additionally predict how interventions alter that structure; and Actionable models translate predictions into measurable gains in planning, action, learning, evaluation, verification, recovery, or data selection. We complement this hierarchy with a 3 x 4 matrix crossing geometry, physics, and action grounding with improvement loops centered on data, rewards, policies, and the model itself. Using this framework, we survey manipulation, navigation, locomotion, autonomous driving, and general embodied learning, tracing technical progressions, clarifying capability requirements, and examining datasets, benchmarks, and evaluation protocols. We identify challenges in long-horizon consistency, uncertainty calibration, causal intervention testing, latency, verification and recovery, and cross-embodiment transfer. This perspective shifts evaluation from visual plausibility toward whether predictions capture task-relevant state, reflect intervention effects, and improve the closed-loop behavior of embodied agents.
- Abstract(参考訳): 世界モデルは、隠れた状態を維持し、結果を予測し、介入を比較し、実行が期待から外れたときに適応することによって、インテリジェンスにおける知覚と意思決定を結びつける。
進歩はしばしば視覚的忠実度によって測定されるが、その価値は行動を改善することである。
カップに手を伸ばす前に、相手が握る際の重さと抵抗を予想し、接触前に手を形作る。
このような予想は粗く、図像的でないが、行動のガイドとなる。
これは、どの予測能力が振る舞いを改善するかという、中心的な疑問を提起する。
アーキテクチャ、出力モダリティ、アプリケーションドメインによって組織された既存の調査は、この質問を暗黙に残します。
可塑性モデルは、タスク関連時間的・幾何学的・物理的構造を保存し、制御可能なモデルは、介入がどのように構造を変えるかを予測し、アクション可能なモデルは、予測を計画、行動、学習、評価、検証、回復、データ選択において測定可能な利得に変換する。
この階層は、データ、報酬、ポリシー、モデル自体を中心にした改善ループを持つ3×4の行列交差幾何学、物理学、アクショングラウンドで補完する。
このフレームワークを用いて、操作、ナビゲーション、移動、自律運転、一般実施学習、技術的進歩の追跡、能力要件の明確化、データセット、ベンチマーク、評価プロトコルの調査を行う。
我々は,長期の一貫性,不確実性校正,因果介入テスト,レイテンシ,検証と回復,異体間移動の課題を明らかにする。
この視点は、視覚的可視性から、予測がタスク関連状態を捉え、介入効果を反映し、エンボディエージェントのクローズドループ挙動を改善するまで、評価をシフトさせる。
関連論文リスト
- World Models for Robotic Manipulation: A Survey [30.864774708923147]
ロボット操作のための世界モデルについて3つの質問を通して調査する。
我々は,世界モデルを行動条件付き予測システムとして運用的に定義する。
合成経験生成、候補フィルタリング、検索に基づく評価、学習環境、結果検証などのインフラの役割を特徴付ける。
論文 参考訳(メタデータ) (2026-05-27T05:32:17Z) - Is the Future Compatible? Diagnosing Dynamic Consistency in World Action Models [28.165928090888986]
世界行動モデル(WAM)は、将来の観察と行動を予測することにより、想像上のロールアウトを通じて意思決定を可能にする。
動作状態の整合性、予測された動作と誘導された状態遷移の整合性を、WAMの信頼性の欠如の軸として同定する。
テスト時間選択のための価値のないコンセンサス戦略を導入し、予測される未来間での合意によって、候補のロールアウトをランク付けする。
論文 参考訳(メタデータ) (2026-05-08T09:44:43Z) - From Passive Metric to Active Signal: The Evolving Role of Uncertainty Quantification in Large Language Models [77.04403907729738]
このサーベイは、受動的診断基準からリアルタイムモデル動作を導くアクティブ制御信号への不確実性の進化をグラフ化する。
3つのフロンティアにまたがるアクティブ制御信号として不確実性がいかに活用されているかを示す。
この調査は、次世代のスケーラブルで信頼性があり、信頼できるAIを構築するためには、新しい不確実性のトレンドを習得することが不可欠である、と論じている。
論文 参考訳(メタデータ) (2026-01-22T06:21:31Z) - A Comprehensive Survey on World Models for Embodied AI [14.457261562275121]
エンボディードAIは、アクションがどのように将来の世界国家を形作るかを理解し、行動し、予測するエージェントを必要とする。
この調査は、組み込みAIにおける世界モデルのための統一されたフレームワークを示す。
論文 参考訳(メタデータ) (2025-10-19T07:12:32Z) - From Physics to Machine Learning and Back: Part II - Learning and Observational Bias in PHM [52.64097278841485]
物理インフォームドモデリングとデータストラテジーによる学習と観察バイアスの導入は、モデルを物理的に一貫した信頼性のある予測へと導くことができるかを検討する。
メタラーニングや少数ショットラーニングなどの高速適応手法をドメイン一般化手法とともに検討する。
論文 参考訳(メタデータ) (2025-09-25T14:15:43Z) - EgoAgent: A Joint Predictive Agent Model in Egocentric Worlds [119.02266432167085]
EgoAgentは単一変換器内での表現、予測、動作を同時に学習する統合エージェントモデルである。
EgoAgentは、タスクをインターリーブされた状態とアクションのシーケンスとして定式化することで、これらの能力間の因果的および時間的依存関係を明示的にモデル化する。
EgoAgentの画像分類,エゴセントリックな将来の状態予測,3次元人間の動作予測といった代表的課題に対する総合的な評価は,本手法の優位性を示している。
論文 参考訳(メタデータ) (2025-02-09T11:28:57Z) - The Integration of Prediction and Planning in Deep Learning Automated Driving Systems: A Review [43.30610493968783]
我々は、最先端のディープラーニングベースの計画システムについてレビューし、どのように予測を統合するかに焦点を当てる。
異なる統合原則の意味、強み、限界について論じる。
論文 参考訳(メタデータ) (2023-08-10T17:53:03Z) - A Control-Centric Benchmark for Video Prediction [69.22614362800692]
本稿では,アクション条件付きビデオ予測のベンチマークを,制御ベンチマークの形式で提案する。
私たちのベンチマークには、11のタスクカテゴリと310のタスクインスタンス定義を備えたシミュレーション環境が含まれています。
次に、ベンチマークを活用して、スケールするモデルサイズ、トレーニングデータの量、モデルアンサンブルの影響を調査します。
論文 参考訳(メタデータ) (2023-04-26T17:59:45Z) - Inferring Past Human Actions in Homes with Abductive Reasoning [19.950479031985502]
帰納的過去の行動推論」は、家庭内個人による過去の行動を特定することを目的とした新しい研究課題である。
帰納的過去の行動推論に適したモデルをいくつか紹介する。
本研究の貢献により, 深層学習モデルによる現場証拠の推論能力が著しく向上した。
論文 参考訳(メタデータ) (2022-10-24T07:43:59Z) - Empirical Estimates on Hand Manipulation are Recoverable: A Step Towards
Individualized and Explainable Robotic Support in Everyday Activities [80.37857025201036]
ロボットシステムの鍵となる課題は、他のエージェントの振る舞いを理解することである。
正しい推論の処理は、(衝突)因子が実験的に制御されない場合、特に困難である。
人に関する観察研究を行うために必要なツールをロボットに装備することを提案する。
論文 参考訳(メタデータ) (2022-01-27T22:15:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。