論文の概要: What Can Latent World Models Know? Physical Parameter Identifiability in Multimodal Predictive Representations
- arxiv url: http://arxiv.org/abs/2607.27017v2
- Date: Thu, 30 Jul 2026 12:14:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 12:52:12.27483
- Title: What Can Latent World Models Know? Physical Parameter Identifiability in Multimodal Predictive Representations
- Title(参考訳): 潜在世界モデルに何がわかるか : 多モーダル予測表現における物理パラメータ同定可能性
- Abstract要約: POKEWORLDは、視覚的に同一の物体が質量、抗力、接触硬さを隠す対話型環境である。
認証付きプロトコルは、まず、生の観測から回復可能な各パラメータを認証し、潜伏状態に入るかどうかを測定する。
RH20Tでは、2つのロボットと4,258エピソードにまたがって両方のメカニズムを再現する。
- 参考スコア(独自算出の注目度): 15.015602453377516
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A central premise of latent world models is that predicting the future forces a representation to internalize the physics of its environment. Which physical quantities does a trained latent actually contain, and what decides this? We answer with controlled interventions in POKEWORLD, an interactive environment whose visually identical objects hide mass, drag, and contact stiffness. A certificate-gated protocol first certifies each parameter as recoverable from raw observations, then measures whether it enters the latent, so a null result can be attributed to the objective rather than to the environment. The resulting identifiability map has two organizing mechanisms and one frontier. Inputs limit what can be known, while prediction targets decide what is retained. Stiffness enters the latent only when touch is forecast ($R^2=0.50$, compared with $-0.02$ when the same signal is merely fused into the input), and under single-step prediction a vision-only latent discards even perfectly visible object state. Drag marks the frontier. It carries a recoverability certificate of 0.89 yet plateaus near 0.13 under every deterministic prediction objective we test, while a supervised head on the same trunk reaches 0.45. Parameters whose readout is slow and ratio-type under the sensed coordinates fall outside what these objectives acquire. On RH20T, an input-target factorial across scaling curves reproduces both mechanisms across two robots and 4,258 episodes. Every arm missing information or prediction pressure stays flat over a fivefold data range, and only the full multimodal objective forecasts force beyond a persistence baseline, with held-out gains that grow with scale. Objective structure determines which physical parameters a latent acquires, and additional data improves only the parameters it already acquires.
- Abstract(参考訳): 潜在世界モデルの中心的な前提は、将来の予測は、その環境の物理を内部化する表現を強制することである。
トレーニングされた潜水剤には、実際にどの物理量が含まれていますか?
我々は、視覚的に同一の物体が質量、抗力、接触剛性を隠蔽する対話型環境であるPOKEWORLDにおける制御された介入に答える。
認証付きプロトコルは、まず、生の観測から回復可能なパラメータを認証し、潜伏状態に入るかどうかを測定する。
結果として生じる識別可能性マップは、2つの機構と1つのフロンティアを持つ。
入力は既知のものを制限するが、予測ターゲットは保持されているものを決定する。
剛性はタッチが予測されたときのみ潜伏状態に入る(R^2=0.50$、同じ信号が入力に融合されたときの$-0.02$)。
ドラッグはフロンティアをマークします。
同じトランク上の監督された頭部が0.45に達するのに対して、私たちがテストする決定論的予測目標のすべての下で、0.89の回復性証明を持ち、0.13に近い高原を持つ。
測定された座標の下で読み出しが遅く、比型となるパラメータは、これらの目的が獲得するものの外にある。
RH20Tでは、2つのロボットと4,258エピソードにまたがって両方のメカニズムを再現する。
すべてのアーム不足情報や予測圧力は、5倍のデータ範囲で平坦であり、持続ベースラインを超えた完全なマルチモーダル目標予測のみであり、スケールとともに増大するホールドアウトゲインを持つ。
対象構造は、潜伏者が獲得する物理パラメータを決定し、追加データは、既に取得したパラメータのみを改善する。
関連論文リスト
- Orthogonal JEPA: Factorized Predictive States for Latent World Models [95.20158869896393]
予測因数分解に基づく潜在的世界モデリングフレームワークであるメソッドを導入する。
そこで本研究では,予測構造を弱め,あるいは矛盾する勾配を抑えつつ,冗長なキャパシティを支配的信号に割り当てる手法を提案する。
制御された視覚、単細胞転写学、縦断的な健康記録、連続的な制御、分子動力学の実験は、表現品質、予測、計画、長期安定性を評価する。
論文 参考訳(メタデータ) (2026-08-20T13:59:57Z) - Why Does the Future Branch? Identifiable Closure Tests for Stochastic Physical World Models [0.0]
ClosurePairsは、繰り返し発生する障害を伴う互換性のあるマイクロステートを横断します。
ソースの属性は確実に回復する。
非線形相互作用ベンチマークにおける等予算分解誤差を低減する。
論文 参考訳(メタデータ) (2026-08-01T11:07:24Z) - From Surface Forecasting to Observability Forecasting: A Latent World Model for Cloud-Aware EO Monitoring [0.0]
予測アーキテクチャの世界モデルであるLeWorldModelをクラウド対応の地球観測シーケンスに適用する。
結果として得られたモデルは18.0Mのトレーニングパラメータを持ち、23,904のトレーニングエピソードでゼロからトレーニングされる。
LeWorldModelは、フルフリーズされたバンドルオブザーバビリティベンチマークにおいて、一貫して永続性を上回っている。
論文 参考訳(メタデータ) (2026-07-15T09:52:22Z) - UWM-JEPA: Predictive World Models That Imagine in Belief Space [0.2864713389096699]
本稿では,JEPAの世界モデルであるUnitary World Model JEPAを紹介した。
この構造はロールアウト中に関節状態スペクトルを正確に保存するため、予測器自体が表現された不確かさを解消することはできない。
JEPAの世界モデルでは、部分的な可観測性、潜伏幾何学、予測力学が重要であり、フリーズされたコンテキストエンコーディング能力だけではありません。
論文 参考訳(メタデータ) (2026-05-25T00:28:51Z) - Emergent Semantic Representations in World Models through Physical Interaction without Linguistic Supervision [0.0]
我々は、ランダムなエンボディド探索に基づいて、VAEベースの世界モデルを訓練する。
その潜在空間は、物理幾何学を反映する空間構造意味を発達させる。
これらの知見は,世界モデル表現の組織原理として物理世界幾何学を確立した。
論文 参考訳(メタデータ) (2026-05-22T03:31:47Z) - Quantifying Uncertainty in Motion Prediction with Variational Bayesian Mixture [17.78048571619575]
安全と堅牢性は、信頼できる自動運転車を開発する上で重要な要素である。
本研究では,1つの移動物体に対する将来の軌跡の分布を記述する生成モデルSeNeVAを提案する。
提案手法は,不確実性を定量化し,競争性能を向上しつつ,アウト・オブ・ディストリビューションデータを識別することができる。
論文 参考訳(メタデータ) (2024-04-04T20:04:12Z) - Physion++: Evaluating Physical Scene Understanding that Requires Online
Inference of Different Physical Properties [100.19685489335828]
この研究は、人工システムにおける視覚的身体的予測を厳格に評価する新しいデータセットとベンチマークであるPhysylon++を提案する。
正確な予測が質量、摩擦、弾性、変形性などの特性の推定に依存するシナリオをテストする。
我々は,様々なレベルの学習と組込み知識にまたがる最先端予測モデルの性能を評価し,その性能を人間の予測と比較した。
論文 参考訳(メタデータ) (2023-06-27T17:59:33Z) - Confidence and Dispersity Speak: Characterising Prediction Matrix for
Unsupervised Accuracy Estimation [51.809741427975105]
この研究は、ラベルを使わずに、分散シフト下でのモデルの性能を評価することを目的としている。
我々は、両方の特性を特徴付けるのに有効であることが示されている核規範を用いる。
核の基準は既存の手法よりも正確で堅牢であることを示す。
論文 参考訳(メタデータ) (2023-02-02T13:30:48Z) - End-to-End Zero-Shot HOI Detection via Vision and Language Knowledge
Distillation [86.41437210485932]
我々は、ゼロショットHOI検出を前進させ、同時に見えないHOIと見えないHOIの両方を検出することを目指している。
本稿では,視覚言語による知識蒸留によるエンドツーエンドのゼロショットHOI検出フレームワークを提案する。
本手法は, 従来のSOTAを8.92%, 全体の10.18%で上回っている。
論文 参考訳(メタデータ) (2022-04-01T07:27:19Z) - Neuro-Symbolic Entropy Regularization [78.16196949641079]
構造化予測では、目的は構造化されたオブジェクトをエンコードする多くの出力変数を共同で予測することである。
エントロピー正則化(Entropy regularization)という1つのアプローチは、決定境界が低確率領域にあるべきであることを示唆している。
我々は、モデルが有効対象を確実に予測することを奨励する損失、ニューロシンボリックエントロピー正規化を提案する。
論文 参考訳(メタデータ) (2022-01-25T06:23:10Z) - TRiPOD: Human Trajectory and Pose Dynamics Forecasting in the Wild [77.59069361196404]
TRiPODは、グラフの注目ネットワークに基づいて身体のダイナミクスを予測する新しい方法です。
実世界の課題を取り入れるために,各フレームで推定された身体関節が可視・視認可能かどうかを示す指標を学習する。
評価の結果,TRiPODは,各軌道に特化して設計され,予測タスクに特化している。
論文 参考訳(メタデータ) (2021-04-08T20:01:00Z) - Learning Transferable Push Manipulation Skills in Novel Contexts [3.1981440103815717]
我々は、ロボットが新しい状況であっても物理的相互作用の結果を予測することができるプッシュインタラクションのためのパラメトリック内部モデルを学ぶ。
様々な条件下で合計24,000回のプッシュで2つのオブジェクトをトレーニングし、合計14,400回のプッシュ結果で6つのオブジェクトをテストします。
その結果,偏りや偏りのない予測器は,慎重に調整された物理シミュレータの結果と一致して,確実に予測を生成できることがわかった。
論文 参考訳(メタデータ) (2020-07-29T11:48:56Z) - Causal Discovery in Physical Systems from Videos [123.79211190669821]
因果発見は人間の認知の中心にある。
本研究では,ビデオの因果発見の課題を,地層構造を監督せずにエンドツーエンドで検討する。
論文 参考訳(メタデータ) (2020-07-01T17:29:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。