論文の概要: Entity-Centric World Models: Interaction-Aware Masking for Causal Video Prediction
- arxiv url: http://arxiv.org/abs/2605.15466v1
- Date: Thu, 14 May 2026 23:10:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 03:45:13.145407
- Title: Entity-Centric World Models: Interaction-Aware Masking for Causal Video Prediction
- Title(参考訳): エンティティ中心世界モデル:因果的映像予測のためのインタラクション対応マスキング
- Abstract要約: JEPA(Joint Embedding Predictive Architectures)はセマンティックな分類のベンチマークを新たに設定した。
本稿では,自己監督型動き中心マスキング戦略を利用したInteraction-Aware JEPA (IA-JEPA)を提案する。
IA-JEPAは因果推論タスクで14.26%の精度を達成しており、標準的なパッチメイクベースラインで達成された3.22%を大きく上回っている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Learning predictive world models from unlabelled video is a foundational challenge in artificial intelligence. While Joint Embedding Predictive Architectures (JEPA) have set new benchmarks in semantic classification, they often remain physics-blind, failing to capture the causal dynamics necessary for downstream reasoning. We hypothesize that this stems from standard patch-based masking strategies, which prioritize visual texture over rare but informative kinematic events. We propose Interaction-Aware JEPA (IA-JEPA), which utilizes a self-supervised motion-centric masking strategy to prioritize physical interactions. By specifically targeting entities engaged in collisions or momentum transfers, we force the architecture to reconstruct latent trajectories rather than static background features. Evaluated on the CLEVRER benchmark, IA-JEPA achieves 14.26% accuracy on causal reasoning tasks, a significant lead over the 3.22% achieved by standard patch-masked baselines. Crucially, we demonstrate that IA-JEPA breaks the "static bias" of standard self-supervision by inducing a higher-entropy, more discriminative latent space (+10% entropy gain) that linearizes physical energy ($R^2=0.43$). We show that this interaction bias generalizes to real-world human actions (Something-Something V2) and zero-shot physical puzzles (PHYRE-Lite). Our results provide a scalable, fully self-supervised path toward building foundational world models that begin to internalize the causal structure of the physical world.
- Abstract(参考訳): ビデオから予測的世界モデルを学ぶことは、人工知能の基本的な課題である。
JEPA(Joint Embedding Predictive Architectures)は、セマンティックな分類の新しいベンチマークを設定しているが、しばしば物理の盲点のままであり、下流の推論に必要な因果ダイナミクスを捉えていない。
これは、まれだが情報的なキネマティックな出来事よりも視覚的なテクスチャを優先する、パッチベースの標準的なマスキング戦略に由来する、という仮説を立てる。
本稿では,身体的相互作用の優先順位付けに自己監督型動き中心マスキング戦略を利用するInteraction-Aware JEPA(IA-JEPA)を提案する。
衝突や運動量移動に係わるエンティティを特に対象とすることにより、静的な背景特徴ではなく、潜在軌道の再構築をアーキテクチャに強制する。
CLEVRERベンチマークで評価すると、IA-JEPAは因果推論タスクで14.26%の精度を達成している。
重要なことに、IA-JEPAは物理エネルギー(R^2=0.43$)を線型化する高エントロピー、より差別的な潜在空間(+10%エントロピーゲイン)を誘導することによって、標準自己超越の「静的バイアス」を破ることを示した。
この相互作用バイアスは実世界の人間行動(Something-Something V2)とゼロショット物理パズル(PHYRE-Lite)に一般化することを示す。
我々の結果は、物理的世界の因果構造を内包し始める基礎的世界モデルを構築するための、スケーラブルで完全に自己管理された経路を提供する。
関連論文リスト
- Semigroup-JEPA: Latent Dynamics Consistency for Zero-Shot Physics Generalization [32.65135632960651]
JEPA(Joint-Embedding Predictive Architecture)の世界モデルは、予測と計画をサポートする世界のコンパクトな潜在表現を学ぶ。
物理制御パラメータを時間モデルに供給することにより,LeWorldModelフレームワークを拡張したSemiGroup-JEPAを提案する。
我々は、同じ物理法則に従うにもかかわらず、定性的に異なる力学を示す異なる重力場の下で動的タスクを設計する。
論文 参考訳(メタデータ) (2026-09-09T17:08:13Z) - UniJEPA: A Unified Joint-Embedding Predictive Architecture for Task-Agnostic Visual World Modeling [24.745715007832953]
JEPA(Joint-Embedding Predictive Architectures)は、コンパクトな潜在空間における世界モデルの自己教師型学習のためのフレームワークとして登場した。
我々は,光度予測(画像レベルの変換)と時間的予測(映像レベルの次状態ダイナミクス)を協調的に学習する統合JEPAであるUniJEPAを提案する。
論文 参考訳(メタデータ) (2026-08-07T16:55:58Z) - FactorJEPA: Factorizing Monolithic Futures into Layout-Agent-Interaction Channels for Crowded and Chaotic Global South Urban Worlds [20.90457097908955]
我々は、人口が多く、混雑し、混乱したグローバル・サウスの都市環境について、ほとんど調査されていない体制について研究している。
既存の評価に支配的な低密度、車線構造の設定とは異なり、これらのシーンは柔らかい空間境界を示す。
私たちはこの体制のための最初の大規模なデータセットを紹介します。ドライブスルー、ウォークスルー、および22都市にわたる空中ビデオの1,000時間です。
論文 参考訳(メタデータ) (2026-08-02T07:32:46Z) - DeSeG: Decoupling Semantic Intent and Geometric Constraints for Physically Plausible Human-Scene Interaction [50.06148080975928]
本稿では,意味的意図を幾何学的制約から明確に分離する階層型フレームワークであるDeSeGを提案する。
DeSeGは最先端のパフォーマンスを実現し、平均シーン浸透率を47%削減し、SOTAベースラインに対するセマンティックアライメントを29%改善した。
論文 参考訳(メタデータ) (2026-07-07T03:21:08Z) - Sensorimotor World Models: Perception for Action via Inverse Dynamics [59.121736411156384]
Inverse dynamics regularization で訓練されたエンド・ツー・エンドのセンサモレータ・ワールドモデルを導入する。
表現の崩壊を防ぎ、アクション整列表現を誘導する。
コンパクトで解釈可能な潜在空間を学習し、単純な2Dおよび3D制御タスク間の競合計画性能を実現する。
論文 参考訳(メタデータ) (2026-06-18T11:25:16Z) - PhyScene3D: Physically Consistent Interactive 3D Tabletop Scene Generation [75.9028457575434]
3Dテーブルトップシーンの生成は、インタラクティブでジェネラリスト的なロボット学習の基本的な問題である。
本稿では,PhyScene3Dについて紹介する。
実験により、PhyScene3Dは意味的精度と物理的妥当性の両方において最先端のアプローチより優れていることが示された。
論文 参考訳(メタデータ) (2026-06-01T03:56:32Z) - UWM-JEPA: Predictive World Models That Imagine in Belief Space [0.2864713389096699]
本稿では,JEPAの世界モデルであるUnitary World Model JEPAを紹介した。
この構造はロールアウト中に関節状態スペクトルを正確に保存するため、予測器自体が表現された不確かさを解消することはできない。
JEPAの世界モデルでは、部分的な可観測性、潜伏幾何学、予測力学が重要であり、フリーズされたコンテキストエンコーディング能力だけではありません。
論文 参考訳(メタデータ) (2026-05-25T00:28:51Z) - ReconPhys: Reconstruct Appearance and Physical Attributes from Single Video [51.2815592637053]
ReconPhysは、単一の単眼ビデオから物理的属性推定と3次元ガウススプラッティング再構成を共同で学習するフィードフォワードフレームワークである。
提案手法では, 自己教師型戦略を用いて訓練したデュアルブランチアーキテクチャを用いて, 地上の物理ラベルの必要性を解消する。
大規模合成データセットの実験は優れた性能を示した。
論文 参考訳(メタデータ) (2026-04-09T06:51:14Z) - Egocentric World Model for Photorealistic Hand-Object Interaction Synthesis [25.153233500074194]
EgoHOIは、このショートカットから分離したエゴセントリックなHOIワールドモデルであり、アクション信号のみからの光リアルで接触一貫性のある相互作用をシミュレートする。
エゴホイは幾何学的およびキネマティックな先駆体を3次元推定から物理インフォームド埋め込みに蒸留する。
HOT3Dデータセットの実験では、強いベースラインよりも一貫したゲインを示し、設計の有効性を検証する。
論文 参考訳(メタデータ) (2026-03-13T21:46:17Z) - HOCA-Bench: Beyond Semantic Perception to Predictive World Modeling via Hegelian Ontological-Causal Anomalies [30.95227838131802]
ビデオLLMは、セマンティック認識において着実に改善されているが、予測的世界モデリングには依然として不足している。
ヘーゲルレンズを通して物理異常をフレーム化するベンチマークであるHOCA-Benchを紹介する。
論文 参考訳(メタデータ) (2026-02-23T07:40:32Z) - HAIC: Humanoid Agile Object Interaction Control via Dynamics-Aware World Model [56.4392302336014]
本稿では,外部状態推定を伴わない多種多様なオブジェクトダイナミクス間のロバストな相互作用のためのフレームワークであるHAICを提案する。
我々の重要な貢献は、主観的歴史のみから高次対象状態(速度、加速度)を推定するダイナミクス予測器である。
ヒューマノイドロボットの実験では、HAICはアジャイルタスクで高い成功率を達成する。
論文 参考訳(メタデータ) (2026-02-12T09:34:35Z) - Causal-JEPA: Learning World Models through Object-Level Latent Interventions [46.562961546550895]
C-JEPAは単純で柔軟なオブジェクト中心の世界モデルであり、イメージパッチからオブジェクト中心の表現まで、マスク付きジョイント埋め込み予測を拡張する。
物体の状態が他の物体から推測される必要があるオブジェクトレベルのマスキングを適用することで、C-JEPAは反事実的効果を伴う潜伏介入を誘導する。
論文 参考訳(メタデータ) (2026-02-11T21:47:26Z) - Walk through Paintings: Egocentric World Models from Internet Priors [65.30611174953958]
本稿では,エゴセントリック・ワールド・モデル(EgoWM)について述べる。
我々は、スクラッチからトレーニングするよりも、インターネット規模のビデオモデルのリッチワールドを再利用し、軽量なコンディショニング層を通じてモーターコマンドを注入する。
当社のアプローチは,3-DoF移動ロボットから25-DoFヒューマノイドまで,エボディメントやアクションスペースを自然に拡張する。
論文 参考訳(メタデータ) (2026-01-21T18:59:32Z) - EscherVerse: An Open World Benchmark and Dataset for Teleo-Spatial Intelligence with Physical-Dynamic and Intent-Driven Understanding [56.89359230139883]
本稿では,Teleo-Spatial Intelligence(TSI)について紹介する。
本稿では、大規模なオープンワールドベンチマーク(Escher-Bench)、データセット(Escher-35k)、モデル(Escherシリーズ)からなるEscherVerseを紹介する。
これはIntent-Driven Reasoningを体系的に評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2026-01-04T14:42:39Z) - How JEPA Avoids Noisy Features: The Implicit Bias of Deep Linear Self Distillation Networks [14.338754598043968]
データ表現の自己教師型学習には2つの競合パラダイムが存在する。
JEPA(Joint Embedding Predictive Architecture)は、意味的に類似した入力が互いに予測可能な表現に符号化されるアーキテクチャのクラスである。
論文 参考訳(メタデータ) (2024-07-03T19:43:12Z) - TRiPOD: Human Trajectory and Pose Dynamics Forecasting in the Wild [77.59069361196404]
TRiPODは、グラフの注目ネットワークに基づいて身体のダイナミクスを予測する新しい方法です。
実世界の課題を取り入れるために,各フレームで推定された身体関節が可視・視認可能かどうかを示す指標を学習する。
評価の結果,TRiPODは,各軌道に特化して設計され,予測タスクに特化している。
論文 参考訳(メタデータ) (2021-04-08T20:01:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。