論文の概要: RoBoSR: Structured Scene Representations for Embodied Robotic Reasoning
- arxiv url: http://arxiv.org/abs/2606.24338v1
- Date: Tue, 23 Jun 2026 09:24:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-24 22:16:48.859459
- Title: RoBoSR: Structured Scene Representations for Embodied Robotic Reasoning
- Title(参考訳): RoBoSR: ロボット推論のための構造化されたシーン表現
- Authors: Kewei Hu, Wanchan Yu, Fangwen Chen, Jing Jiajian, Zimeng Li, Ying Wei, Tianhao Liu, Michael Zhang, Hanwen Kang,
- Abstract要約: ステップワイズ状態遷移として操作を定式化する中間構造表現であるRoBoSRを導入する。
物体の状態とその空間的関係を知覚作用インタフェースでモデル化することにより、RoBoSRは生の入力から高レベルなタスク推論を解き放つ。
我々は、シーン理解、命令解釈、サブタスク計画を共同で監督するオープンワールドデータセットであるManip-Cognition-1.6Mを構築した。
- 参考スコア(独自算出の注目度): 14.955041656490849
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Despite rapid progress, embodied reasoning under real-world variability remains challenging. Existing approaches rely on demonstration-driven sequential biases, limiting flexibility in open-ended and long-horizon tasks that require structured reasoning over evolving states. We introduce RoBoSR, an intermediate structural representation that formulates manipulation as step-wise state transitions over semantically grounded, object-centric scene graphs. By modeling object states and their spatial relations at the perception-action interface, RoBoSR disentangles high-level task reasoning from raw inputs and enables structured reasoning over preconditions, effects, and goal states. This representation endows the agent with causal reasoning capability, enforcing subtask dependencies and supporting coherent long-horizon task planning. To learn such structure-aware reasoning, we construct Manip-Cognition-1.6M, an open-world dataset that jointly supervises scene understanding, instruction interpretation, and subtask planning across diverse tasks. Across several benchmarks and real-world demonstrations, our method consistently outperforms prompting-based methods and classical TAMP baselines in zero-shot generalization and long-horizon tasks. The results underscore structured intermediate representations as a critical inductive bias for scalable embodied reasoning.
- Abstract(参考訳): 急速な進歩にもかかわらず、現実世界の変動性の下での具体的推論は依然として困難である。
既存のアプローチはデモ駆動のシーケンシャルバイアスに依存しており、進化する状態に対する構造化推論を必要とするオープンエンドおよびロングホライゾンタスクの柔軟性を制限する。
セマンティックグラウンド化されたオブジェクト中心のシーングラフ上のステップワイズ状態遷移として操作を定式化する中間構造表現であるRoBoSRを紹介する。
物体の状態とその空間的関係を知覚作用インタフェースでモデル化することにより、RoBoSRは生の入力から高レベルなタスク推論を解き、事前条件、効果、目標状態に対する構造化された推論を可能にする。
この表現は、エージェントに因果推論能力を与え、サブタスク依存を強制し、一貫性のある長期タスク計画をサポートする。
このような構造を意識した推論を学習するために,様々なタスクにまたがるシーン理解,命令解釈,サブタスク計画を共同で監督するオープンワールドデータセットManip-Cognition-1.6Mを構築した。
いくつかのベンチマークや実世界の実演では、ゼロショットの一般化や長い水平タスクにおいて、プロンプトベースの手法や古典的なTAMPベースラインよりも一貫して優れています。
結果は、スケーラブルなエンボディード推論のための重要な帰納的バイアスとして構造化された中間表現の基盤となる。
関連論文リスト
- ThinkingVLA: Interleaved Vision and Language Reasoning for Robotic Manipulation [71.69632267962993]
我々は、操作計画が自然に予測に分解され、次の視覚状態が予測され、逆ダイナミクスとなることを論じる。
我々は、この分解を実現する生成モデルである textbfThinkingVLA を提案する。
シミュレーションと実世界のベンチマークの実験では、ThinkingVLAは最先端のベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-06-16T13:45:17Z) - Steered Generation via Gradient-Based Optimization on Sparse Query Features [1.587869707099313]
Prototype-Based Sparse Steeringは、Sparse Autoencodersを特にクエリアクティベーションに適用するフレームワークである。
本研究では,スパースクエリ表現が論理的計画法と構造的ニュアンスの両方を統一的かつ解釈可能な制御に必要であることを示す。
論文 参考訳(メタデータ) (2026-05-21T21:13:14Z) - Deep Reasoning in General Purpose Agents via Structured Meta-Cognition [58.185853639335896]
構造化メタ推論を用いてタスク固有の足場を構築するための推論時アプローチを提案する。
我々は、より制御された推論スレッドに複雑なタスクを分散する汎用エージェントでこのアプローチをインスタンス化する。
論文 参考訳(メタデータ) (2026-05-12T01:21:37Z) - Dynamics Within Latent Chain-of-Thought: An Empirical Study of Causal Structure [58.89643769707751]
表現空間における潜在連鎖を操作可能な因果過程として研究する。
遅延ステップの予算は、均質な余分な深さよりも、非局所的なルーティングを備えたステージ機能のように振る舞う。
これらの結果は、モード条件と安定性を意識した分析を、潜伏推論システムの解釈と改善のための信頼性の高いツールとして動機付けている。
論文 参考訳(メタデータ) (2026-02-09T15:25:12Z) - Emergent Structured Representations Support Flexible In-Context Inference in Large Language Models [77.98801218316505]
大型言語モデル(LLM)は、人間のような推論を示唆する創発的な行動を示す。
テキスト内概念推論におけるLLMの内部処理について検討する。
論文 参考訳(メタデータ) (2026-02-08T03:14:39Z) - Differentiate-and-Inject: Enhancing VLAs via Functional Differentiation Induced by In-Parameter Structural Reasoning [9.966857651301515]
iSTARは視覚言語アクションモデルを強化するためのフレームワークである。
タスクレベルのセマンティック構造を直接モデルパラメータに埋め込む。
これは、コンテキスト内およびエンドツーエンドのVLAベースラインよりも信頼性の高いタスク分解と、より高い成功率を達成する。
論文 参考訳(メタデータ) (2026-02-07T13:31:11Z) - GSR: Learning Structured Reasoning for Embodied Manipulation [10.756456261056867]
グラウンドド・シーングラフ推論(グラウンドド・シーングラフ・レアソニング、英語: Grounded Scene-graph Reasoning、GSR)は、セマンティックグラウンドド・シーングラフ上の遷移として、世界状態の進化を明示的にモデル化する構造的推論パラダイムである。
GSRは、物理的に接地された空間における行動条件、結果、および目標満足度に関する明確な推論を可能にする。
論文 参考訳(メタデータ) (2026-02-02T06:07:42Z) - Explainable Chain-of-Thought Reasoning: An Empirical Analysis on State-Aware Reasoning Dynamics [69.00587226225232]
本研究では,CoTトラジェクトリを構造化潜在力学に抽象化する状態認識遷移フレームワークを提案する。
推論のグローバルな構造を特徴づけるために、それらの進行をマルコフ連鎖としてモデル化する。
この抽象化は、意味的役割の識別、時間的パターンの可視化、一貫性評価など、さまざまな分析をサポートする。
論文 参考訳(メタデータ) (2025-08-29T18:53:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。