論文の概要: Embodied GPT-5.1: Evidence of a World Model?
- arxiv url: http://arxiv.org/abs/2607.23899v1
- Date: Mon, 27 Jul 2026 00:14:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.263561
- Title: Embodied GPT-5.1: Evidence of a World Model?
- Title(参考訳): GPT-5.1: Evidence of a World Model?
- Abstract要約: 本研究では,大規模マルチモーダル言語モデル GPT-5.1 が物理移動ロボットの高レベルコントローラとして機能するかどうかを検討する。
GPT-5.1には事前の実施、模擬環境での訓練、感覚運動の体験への露出がない。
全体として、GPT-5.1は、具体化された環境での世界モデルのような振舞いの兆候を示す。
- 参考スコア(独自算出の注目度): 0.6445605125467574
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This exploratory study examines whether a large multimodal language model, GPT-5.1, can serve as the high-level controller of a physical mobile robot despite having no prior embodiment, no training in simulated environments, and no exposure to sensorimotor experience. Using only low-resolution first-person images and a discrete action set, the model was tasked with navigation and object-directed behaviors such as locating and contacting a target toy. Across multiple trials, GPT-5.1 demonstrated emergent capabilities that suggest elements of spatial reasoning and physical understanding. These included maintaining short-term memory of object locations after they left the camera frame, inferring the physical consequences of its own movements, and executing coherent action sequences such as colliding with an object and reversing to visually verify the outcome. At the same time, the model displayed inefficiencies and perceptual limitations, including imprecise alignment strategies and occasional misidentification of distant distractors. Overall, the results indicate that GPT-5.1 exhibits signs of world-model-like behavior in an embodied setting, despite the absence of any embodiment-related training, a finding that challenges long-standing views in cognitive science and robotics which hold that a physical body is a necessary prerequisite for developing such forms of intelligence. The findings motivate deeper investigation into the emergence, limits, and robustness of physical understanding in large language models.
- Abstract(参考訳): 本研究は,大規模マルチモーダル言語モデルであるGPT-5.1が,事前の実施,模擬環境での訓練,感覚運動者体験への曝露を伴わないにもかかわらず,身体移動ロボットの高レベルコントローラとして機能するかどうかを検討するものである。
低解像度のファーストパーソン画像と離散的なアクションセットのみを使用して、ターゲットのおもちゃの位置や接触などのナビゲーションやオブジェクト指向の動作をタスクした。
複数の試行において、GPT-5.1は空間的推論と物理的理解の要素を示唆する創発的能力を示した。
それらは、カメラフレームを離れた後、オブジェクトの位置の短期記憶を維持すること、自身の動きの物理的影響を推測すること、オブジェクトと衝突したり、結果の視覚的検証を反転したりといったコヒーレントなアクションシーケンスを実行することを含む。
同時に、モデルには非効率なアライメント戦略や、時折遠距離障害者の誤識別を含む、非効率性と知覚的制限が示されていた。
以上の結果から,GPT-5.1は,身体関連トレーニングが存在しないにもかかわらず,身体がそのようなインテリジェンスを発達させるために必要な必須条件であると考える認知科学やロボット工学における長年の見解に異議を唱えている。
この発見は、大きな言語モデルにおける物理的理解の出現、限界、堅牢性に関するより深い研究を動機付けている。
関連論文リスト
- PhysBrain 1.5: From Vision-Language Models to Physical Foundation Models [60.567497085815724]
PhysBrain 1.5は、物理的な環境を理解し、アクションを生成し、将来の状態を予測するための統一モデルである。
事前トレーニングは、人間のインタラクションビデオから完全に具体化された監督を引き出す。
一般的なマルチモーダル機能を維持しながら、14のベンチマークで最高のオープンソース結果を達成する。
論文 参考訳(メタデータ) (2026-09-14T03:25:46Z) - GAUGE: A Measurement-Grounded Benchmark for Physical Fidelity in Simulation Engines and Video World Models [66.77745044586173]
GAUGEは、数値シミュレータと生成ビデオワールドモデルがどのように現実の物理学から再現または逸脱するかを評価するための実世界の診断ベンチマークである。
一般化された軌道誤差を用いて14のタスクファミリー上でIsaac Sim,Genesis,Newtonをベンチマークし,5つの剛体タスクに対して6つのイメージ・ツー・ビデオモデルを評価する。
この結果から, 衝撃的接触, 高速繊維運動, 体積変形に起因する最大の相違点を有する一様忠実な物理エンジンは見つからなかった。
論文 参考訳(メタデータ) (2026-08-06T12:19:38Z) - GIRAF: Towards Generalizable Human Interactions with Articulated Objects [50.52795413484619]
そこで本論文では,テキスト条件付き拡散モデルについて述べる。
提案手法は、現在最先端の手法を超越して、未確認のオブジェクト構成に強い一般化を示した。
論文 参考訳(メタデータ) (2026-07-08T19:30:44Z) - Trimming the Long-Tail of Visual World Modeling Evaluation [67.17191772079316]
本論文では,不規則な物理的相互作用をシミュレートするために世界モデルに挑戦するベンチマークであるTailor-Benchを紹介する。
通常のシナリオは共通のツールとタスクのペアを反映し、従来型のツールを属性互換の代替品に置き換え、Impossibleシナリオは属性違反ツールを導入している。
実験結果から,物理世界モデリングの長期的ギャップは明らかであり,共通相互作用を超越した一般化の限界が示唆された。
論文 参考訳(メタデータ) (2026-06-23T07:43:41Z) - ACWM-Phys: Investigating Generalized Physical Interaction in Action-Conditioned Video World Models [30.527810700174488]
行動条件付き世界モデル(ACWM)は,映像の予測と意思決定に強く期待されている。
本稿では,多様な物理力学下での行動条件予測のための新しいベンチマークであるACWM-Physを紹介する。
論文 参考訳(メタデータ) (2026-05-09T00:00:47Z) - LOME: Learning Human-Object Manipulation with Action-Conditioned Egocentric World Model [14.98308724969322]
LOMEは、入力画像、テキストプロンプト、フレームごとのヒューマンアクションに条件付けされたビデオとして、現実的な人間とオブジェクトのインタラクションを生成することができる。
LOMEは、空間的人間の行動を共同で推定することで、オブジェクト操作に強力で正確なアクションガイダンスを注入する。
LOMEは、シミュレーション環境に制限されずに、AR/VR体験とスケーラブルなロボットトレーニングの道を開く。
論文 参考訳(メタデータ) (2026-03-28T23:58:29Z) - Grounding Social Perception in Intuitive Physics [55.69427097024444]
本稿では,計画,確率的計画,物理シミュレーションを統合し,エージェントの目標と関係を軌道から推測するモデルを提案する。
以上の結果から,本モデルが社会的場面の物理的理解の方法の計算的説明を提供する可能性が示唆された。
論文 参考訳(メタデータ) (2026-03-28T21:14:49Z) - Do-Undo: Generating and Reversing Physical Actions in Vision-Language Models [57.71440995598757]
我々は,視覚言語モデルにおける重要なギャップに対処するために,Do-Undoタスクとベンチマークを導入する。
Do-Undoは、物理的な行動の結果をシミュレートし、それを正確に反転させるモデルを必要とし、視覚の世界における真の原因と効果を反映している。
論文 参考訳(メタデータ) (2025-12-15T18:03:42Z) - WoW: Towards a World omniscient World model Through Embodied Interaction [83.43543124512719]
世界モデルの正当性的な物理的直観は、現実世界との広範囲で因果的に豊かな相互作用に基礎を置いていなければならない。
このWoWは、200万のロボットインタラクショントラジェクトリに基づいてトレーニングされた、ジェネレーティブな世界モデルである。
WoWBenchは、ビデオの物理的一貫性と因果推論に焦点を当てた新しいベンチマークである。
論文 参考訳(メタデータ) (2025-09-26T17:59:07Z) - "PhyWorldBench": A Comprehensive Evaluation of Physical Realism in Text-to-Video Models [38.14213802594432]
PhyWorldBenchは、物理法則に準拠したビデオ生成モデルを評価するために設計されたベンチマークである。
我々は、現実世界の物理学に故意に違反する「反物理学」という新しいカテゴリーを紹介した。
5つのオープンソースモデルと5つのプロプライエタリモデルを含む12の最先端のテキスト・ビデオ生成モデルを評価する。
論文 参考訳(メタデータ) (2025-07-17T17:54:09Z) - Visual Grounding of Learned Physical Models [66.04898704928517]
人間は、物体の物理的特性を直感的に認識し、複雑な相互作用に従事している場合でも、その動きを予測する。
我々は、物理を同時に推論し、視覚と力学の先行に基づく将来の予測を行うニューラルモデルを提案する。
実験により、我々のモデルはいくつかの観測範囲内で物理的特性を推測できることが示され、モデルが目に見えないシナリオに迅速に適応し、将来正確な予測を行うことができる。
論文 参考訳(メタデータ) (2020-04-28T17:06:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。