論文の概要: Beyond Instance Slots: Semantically Rich World Models for Physical Interaction Planning
- arxiv url: http://arxiv.org/abs/2608.22294v2
- Date: Thu, 27 Aug 2026 11:31:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 14:16:51.620585
- Title: Beyond Instance Slots: Semantically Rich World Models for Physical Interaction Planning
- Title(参考訳): インスタンススロットを超えて: 物理的相互作用計画のためのセマンティックにリッチな世界モデル
- Authors: Juntao Cheng, Jingkai Wang, Yijun Shen, Xiansheng Chen, Zhiwei Yu,
- Abstract要約: 本稿では,5つの機能的役割を中心に構成されたタスク条件付き世界モデルであるSemantically Rich World Model (SR-WM)を提案する。
SR-WM内では、ビジュアルエンティティエンコーダが事前訓練されたパッチ機能からソフトエンティティ仮説を抽出し、セグメンテーションマスクがオプションの提案先として機能する。
ロールバインダーはこれらの仮説をタスク固有のロールにマッピングし、アクション条件付きダイナミクスモデルは、きめ細かいセマンティクスと共にロール遷移を予測する。
- 参考スコア(独自算出の注目度): 3.284163275977256
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: World models for physical interaction are typically trained to predict future observations or latent features; however, a planning-oriented model must answer a fundamentally different question: whether a candidate action produces a task consistent future while preserving essential relations. Monolithic state representations obscure the underlying entities, while standard instance-level object slots merely identify what is present without specifying what role each entity plays in the task context. To bridge this gap, we present the Semantically Rich World Model (SR-WM), a task-conditioned world model structured around five functional roles: gripper, target, goal, relation, and phase. Within SR-WM, a visual entity encoder extracts soft entity hypotheses from pretrained patch features, allowing segmentation masks to serve as optional proposal priors without mandating them as required state representations or inference inputs. A role binder subsequently maps these hypotheses to task-specific roles, while an action conditioned dynamics model predicts role transitions alongside fine-grained semantics, including grasp/contact, predicate establishment, relation preservation, fixture state, and phase change. Crucially, this unified role state grounds downstream multi-candidate action generation, stage-aware reranking, and violation-aware suffix resampling. Our comprehensive evaluation protocol spans all four LIBERO simulation suites, cross-suite transfer, perception diagnostics, and action sensitivity analysis. Ultimately, this formulation transforms object-centric prediction into a semantic interface linking visual dynamics with planning-oriented decision making
- Abstract(参考訳): 物理的相互作用のための世界モデルは、一般的に将来の観測や潜伏する特徴を予測するために訓練されるが、計画指向のモデルは基本的に異なる疑問に答えなければならない。
標準的なインスタンスレベルのオブジェクトスロットは、タスクコンテキストで各エンティティが果たす役割を指定せずに、その存在を単に識別するだけである。
このギャップを埋めるために、我々は、グラッパー、目標、目標、関係、フェーズの5つの機能的な役割を中心に構成されたタスク条件付き世界モデルであるSemantically Rich World Model(SR-WM)を提示する。
SR-WM内では、ビジュアルエンティティエンコーダが事前訓練されたパッチ特徴からソフトエンティティ仮説を抽出し、セグメンテーションマスクが要求された状態表現や推論入力としてそれらを強制することなく、任意の提案先として機能できるようにする。
ロールバインダーは、これらの仮説をタスク固有のロールにマッピングし、アクション条件付きダイナミクスモデルは、把握/接触、述語確立、関係保存、フィクスチャ状態、位相変化を含む、きめ細かい意味論と共にロール遷移を予測する。
重要なことに、この統一された役割状態は、下流のマルチ候補アクション生成、ステージアウェアのリランク、および違反アウェアのサフィックスのリサンプリングを基盤としている。
総合評価プロトコルは,4つのLIBEROシミュレーションスイート,クロススーツ転送,知覚診断,行動感度解析のすべてにまたがる。
最終的に、この定式化は、オブジェクト中心の予測を、視覚力学と計画指向の意思決定を結びつけるセマンティックインターフェースに変換する。
関連論文リスト
- Orthogonal JEPA: Factorized Predictive States for Latent World Models [95.20158869896393]
予測因数分解に基づく潜在的世界モデリングフレームワークであるメソッドを導入する。
そこで本研究では,予測構造を弱め,あるいは矛盾する勾配を抑えつつ,冗長なキャパシティを支配的信号に割り当てる手法を提案する。
制御された視覚、単細胞転写学、縦断的な健康記録、連続的な制御、分子動力学の実験は、表現品質、予測、計画、長期安定性を評価する。
論文 参考訳(メタデータ) (2026-08-20T13:59:57Z) - From World Action Models to Embodied Brains: A Roadmap for Open-World Physical Intelligence [54.62791372989525]
アクションモデル、ビジョン言語-アクションポリシー、世界モデルは、この目標を前進させた。
世界行動モデル(WAM)は、候補者の介入と予測された結果とを結びつけるため、特に有望である。
我々は、WAMへの進化をレビューし、これらの制限をモデルの役割と表現、目的と標準化、システム構成という3つの組み合わせのギャップにまとめる。
論文 参考訳(メタデータ) (2026-07-13T15:22:56Z) - EV-WM: Event-Verified World Models for Long-Horizon Robotic Manipulation [0.815557531820863]
ロングホライゾン操作は、関係性、述語レベル、物理的に接地された進行信号を必要とする。
我々は,ワールド・モデル・プランニングのための述語型検証フレームワークである textbfEV-WM を紹介する。
論文 参考訳(メタデータ) (2026-06-11T08:35:37Z) - HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models [58.191567345416836]
世界行動モデル(WAM)は、物理力学のモデリングによるロボット制御のための有望なパラダイムとして登場した。
HarmoWAMは、予測と反応の制御を統一するために世界モデルを完全に活用し、一般的なトランジットと正確な操作を可能にする。
実世界の6つのロボットタスクにまたがる3つのトレーニング未確認テスト環境を構築し、背景、位置、オブジェクトの意味のバリエーションをカバーした。
論文 参考訳(メタデータ) (2026-05-11T17:59:56Z) - Temporal Graph Pattern Machine [17.352525018007473]
時間的グラフパターンマシン(TGPM)は、時間的に偏ったランダムウォークによって合成された相互作用パッチとして、各相互作用を概念化する。
TGPMは、トランスダクティブリンク予測とインダクティブリンク予測の両方において、常に最先端の性能を達成する。
論文 参考訳(メタデータ) (2026-01-30T01:46:13Z) - Zero-Shot Human Mobility Forecasting via Large Language Model with Hierarchical Reasoning [27.096256356447117]
ZHMFはゼロショット人間の移動予測のためのフレームワークである。
セマンティック強化された検索とリフレクション機構と階層型言語モデルに基づく推論システムを組み合わせる。
論文 参考訳(メタデータ) (2025-09-20T08:46:38Z) - Neural Network Reprogrammability: A Unified Theme on Model Reprogramming, Prompt Tuning, and Prompt Instruction [57.19302613163439]
モデル適応のための統一フレームワークとして,ニューラルネットワークの再プログラム可能性を導入する。
本稿では,4つの重要な側面にまたがる情報操作アプローチを分類する分類法を提案する。
残る技術的課題や倫理的考察も分析する。
論文 参考訳(メタデータ) (2025-06-05T05:42:27Z) - Deep hybrid models: infer and plan in a dynamic world [0.0]
3つの特徴に基づいて離散的かつ連続的な処理を利用する能動的推論手法を提案する。
モデルが異なる条件下で提示された課題に対処できることが示される。
論文 参考訳(メタデータ) (2024-02-01T15:15:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。