論文の概要: Entity-Centric World Models: Interaction-Aware Masking for Causal Video Prediction
- arxiv url: http://arxiv.org/abs/2605.15466v1
- Date: Thu, 14 May 2026 23:10:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 03:45:13.145407
- Title: Entity-Centric World Models: Interaction-Aware Masking for Causal Video Prediction
- Title(参考訳): エンティティ中心世界モデル:因果的映像予測のためのインタラクション対応マスキング
- Authors: Santosh Kumar Paidi,
- Abstract要約: JEPA(Joint Embedding Predictive Architectures)はセマンティックな分類のベンチマークを新たに設定した。
本稿では,自己監督型動き中心マスキング戦略を利用したInteraction-Aware JEPA (IA-JEPA)を提案する。
IA-JEPAは因果推論タスクで14.26%の精度を達成しており、標準的なパッチメイクベースラインで達成された3.22%を大きく上回っている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Learning predictive world models from unlabelled video is a foundational challenge in artificial intelligence. While Joint Embedding Predictive Architectures (JEPA) have set new benchmarks in semantic classification, they often remain physics-blind, failing to capture the causal dynamics necessary for downstream reasoning. We hypothesize that this stems from standard patch-based masking strategies, which prioritize visual texture over rare but informative kinematic events. We propose Interaction-Aware JEPA (IA-JEPA), which utilizes a self-supervised motion-centric masking strategy to prioritize physical interactions. By specifically targeting entities engaged in collisions or momentum transfers, we force the architecture to reconstruct latent trajectories rather than static background features. Evaluated on the CLEVRER benchmark, IA-JEPA achieves 14.26% accuracy on causal reasoning tasks, a significant lead over the 3.22% achieved by standard patch-masked baselines. Crucially, we demonstrate that IA-JEPA breaks the "static bias" of standard self-supervision by inducing a higher-entropy, more discriminative latent space (+10% entropy gain) that linearizes physical energy ($R^2=0.43$). We show that this interaction bias generalizes to real-world human actions (Something-Something V2) and zero-shot physical puzzles (PHYRE-Lite). Our results provide a scalable, fully self-supervised path toward building foundational world models that begin to internalize the causal structure of the physical world.
- Abstract(参考訳): ビデオから予測的世界モデルを学ぶことは、人工知能の基本的な課題である。
JEPA(Joint Embedding Predictive Architectures)は、セマンティックな分類の新しいベンチマークを設定しているが、しばしば物理の盲点のままであり、下流の推論に必要な因果ダイナミクスを捉えていない。
これは、まれだが情報的なキネマティックな出来事よりも視覚的なテクスチャを優先する、パッチベースの標準的なマスキング戦略に由来する、という仮説を立てる。
本稿では,身体的相互作用の優先順位付けに自己監督型動き中心マスキング戦略を利用するInteraction-Aware JEPA(IA-JEPA)を提案する。
衝突や運動量移動に係わるエンティティを特に対象とすることにより、静的な背景特徴ではなく、潜在軌道の再構築をアーキテクチャに強制する。
CLEVRERベンチマークで評価すると、IA-JEPAは因果推論タスクで14.26%の精度を達成している。
重要なことに、IA-JEPAは物理エネルギー(R^2=0.43$)を線型化する高エントロピー、より差別的な潜在空間(+10%エントロピーゲイン)を誘導することによって、標準自己超越の「静的バイアス」を破ることを示した。
この相互作用バイアスは実世界の人間行動(Something-Something V2)とゼロショット物理パズル(PHYRE-Lite)に一般化することを示す。
我々の結果は、物理的世界の因果構造を内包し始める基礎的世界モデルを構築するための、スケーラブルで完全に自己管理された経路を提供する。
関連論文リスト
- ReconPhys: Reconstruct Appearance and Physical Attributes from Single Video [51.2815592637053]
ReconPhysは、単一の単眼ビデオから物理的属性推定と3次元ガウススプラッティング再構成を共同で学習するフィードフォワードフレームワークである。
提案手法では, 自己教師型戦略を用いて訓練したデュアルブランチアーキテクチャを用いて, 地上の物理ラベルの必要性を解消する。
大規模合成データセットの実験は優れた性能を示した。
論文 参考訳(メタデータ) (2026-04-09T06:51:14Z) - Egocentric World Model for Photorealistic Hand-Object Interaction Synthesis [25.153233500074194]
EgoHOIは、このショートカットから分離したエゴセントリックなHOIワールドモデルであり、アクション信号のみからの光リアルで接触一貫性のある相互作用をシミュレートする。
エゴホイは幾何学的およびキネマティックな先駆体を3次元推定から物理インフォームド埋め込みに蒸留する。
HOT3Dデータセットの実験では、強いベースラインよりも一貫したゲインを示し、設計の有効性を検証する。
論文 参考訳(メタデータ) (2026-03-13T21:46:17Z) - HOCA-Bench: Beyond Semantic Perception to Predictive World Modeling via Hegelian Ontological-Causal Anomalies [30.95227838131802]
ビデオLLMは、セマンティック認識において着実に改善されているが、予測的世界モデリングには依然として不足している。
ヘーゲルレンズを通して物理異常をフレーム化するベンチマークであるHOCA-Benchを紹介する。
論文 参考訳(メタデータ) (2026-02-23T07:40:32Z) - HAIC: Humanoid Agile Object Interaction Control via Dynamics-Aware World Model [56.4392302336014]
本稿では,外部状態推定を伴わない多種多様なオブジェクトダイナミクス間のロバストな相互作用のためのフレームワークであるHAICを提案する。
我々の重要な貢献は、主観的歴史のみから高次対象状態(速度、加速度)を推定するダイナミクス予測器である。
ヒューマノイドロボットの実験では、HAICはアジャイルタスクで高い成功率を達成する。
論文 参考訳(メタデータ) (2026-02-12T09:34:35Z) - Causal-JEPA: Learning World Models through Object-Level Latent Interventions [46.562961546550895]
C-JEPAは単純で柔軟なオブジェクト中心の世界モデルであり、イメージパッチからオブジェクト中心の表現まで、マスク付きジョイント埋め込み予測を拡張する。
物体の状態が他の物体から推測される必要があるオブジェクトレベルのマスキングを適用することで、C-JEPAは反事実的効果を伴う潜伏介入を誘導する。
論文 参考訳(メタデータ) (2026-02-11T21:47:26Z) - Walk through Paintings: Egocentric World Models from Internet Priors [65.30611174953958]
本稿では,エゴセントリック・ワールド・モデル(EgoWM)について述べる。
我々は、スクラッチからトレーニングするよりも、インターネット規模のビデオモデルのリッチワールドを再利用し、軽量なコンディショニング層を通じてモーターコマンドを注入する。
当社のアプローチは,3-DoF移動ロボットから25-DoFヒューマノイドまで,エボディメントやアクションスペースを自然に拡張する。
論文 参考訳(メタデータ) (2026-01-21T18:59:32Z) - EscherVerse: An Open World Benchmark and Dataset for Teleo-Spatial Intelligence with Physical-Dynamic and Intent-Driven Understanding [56.89359230139883]
本稿では,Teleo-Spatial Intelligence(TSI)について紹介する。
本稿では、大規模なオープンワールドベンチマーク(Escher-Bench)、データセット(Escher-35k)、モデル(Escherシリーズ)からなるEscherVerseを紹介する。
これはIntent-Driven Reasoningを体系的に評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2026-01-04T14:42:39Z) - How JEPA Avoids Noisy Features: The Implicit Bias of Deep Linear Self Distillation Networks [14.338754598043968]
データ表現の自己教師型学習には2つの競合パラダイムが存在する。
JEPA(Joint Embedding Predictive Architecture)は、意味的に類似した入力が互いに予測可能な表現に符号化されるアーキテクチャのクラスである。
論文 参考訳(メタデータ) (2024-07-03T19:43:12Z) - TRiPOD: Human Trajectory and Pose Dynamics Forecasting in the Wild [77.59069361196404]
TRiPODは、グラフの注目ネットワークに基づいて身体のダイナミクスを予測する新しい方法です。
実世界の課題を取り入れるために,各フレームで推定された身体関節が可視・視認可能かどうかを示す指標を学習する。
評価の結果,TRiPODは,各軌道に特化して設計され,予測タスクに特化している。
論文 参考訳(メタデータ) (2021-04-08T20:01:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。