論文の概要: OOWM: Structuring Embodied Reasoning and Planning via Object-Oriented Programmatic World Modeling
- arxiv url: http://arxiv.org/abs/2604.09580v1
- Date: Wed, 25 Feb 2026 16:01:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-19 19:09:11.514782
- Title: OOWM: Structuring Embodied Reasoning and Planning via Object-Oriented Programmatic World Modeling
- Title(参考訳): OOWM:オブジェクト指向プログラムワールドモデリングによる身体的推論と計画の構築
- Authors: Hongyu Chen, Liang Lin, Guangrun Wang,
- Abstract要約: ソフトウェア工学のフォーマリズムのレンズを通して推論を具体化する新しいフレームワークであるオブジェクト指向世界モデリング(OOWM)を提案する。
OOWMはクラスダイアグラムを使用して、厳密なオブジェクト階層に視覚的知覚を基盤とし、アクティビティダイアグラムを使用して、計画を実行可能な制御フローに運用する。
- 参考スコア(独自算出の注目度): 62.3458279176813
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Standard Chain-of-Thought (CoT) prompting empowers Large Language Models (LLMs) with reasoning capabilities, yet its reliance on linear natural language is inherently insufficient for effective world modeling in embodied tasks. While text offers flexibility, it fails to explicitly represent the state-space, object hierarchies, and causal dependencies required for robust robotic planning. To address these limitations, we propose Object-Oriented World Modeling (OOWM), a novel framework that structures embodied reasoning through the lens of software engineering formalisms. We redefine the world model not as a latent vector space, but as an explicit symbolic tuple $W = \langle S, T \rangle$: a State Abstraction ($G_\text{state}$) instantiating the environmental state $S$, coupled with a Control Policy ($G_\text{control}$) representing the transition logic $T: S \times A \rightarrow S'$. OOWM leverages the Unified Modeling Language (UML) to materialize this definition: it employs Class Diagrams to ground visual perception into rigorous object hierarchies, and Activity Diagrams to operationalize planning into executable control flows. Furthermore, we introduce a three-stage training pipeline combining Supervised Fine-Tuning (SFT) with Group Relative Policy Optimization (GRPO). Crucially, this method utilizes outcome-based rewards from the final plan to implicitly optimize the underlying object-oriented reasoning structure, enabling effective learning even with sparse annotations. Extensive evaluations on the MRoom-30k benchmark demonstrate that OOWM significantly outperforms unstructured textual baselines in planning coherence, execution success, and structural fidelity, establishing a new paradigm for structured embodied reasoning.
- Abstract(参考訳): CoT(Standard Chain-of-Thought)はLarge Language Models(LLMs)を推論能力で強化するが、線形自然言語への依存は、具体的タスクにおける効果的な世界モデリングには本質的に不十分である。
テキストは柔軟性を提供するが、堅牢なロボット計画に必要な状態空間、オブジェクト階層、因果依存関係を明示的に表現することができない。
このような制約に対処するため,ソフトウェア工学のフォーマリズムのレンズを通して,具体的推論を構築する新しいフレームワークであるObject-Oriented World Modeling (OOWM)を提案する。
我々は、世界モデルを潜在ベクトル空間としてではなく、明示的な記号的なタプル $W = \langle S, T \rangle$: a State Abstraction ($G_\text{state}$) として再定義し、遷移ロジック $T: S \times A \rightarrow S'$ を表す制御ポリシー ($G_\text{control}$) と合わせて、環境状態 $S$ をインスタンス化する。
OOWMはこの定義を実現するためにUnified Modeling Language(UML)を活用し、クラスダイアグラムを使用して、厳密なオブジェクト階層に視覚的認識を基盤とし、アクティビティダイアグラムを使用して、実行可能な制御フローに計画を運用します。
さらに,スーパービジョンファインチューニング(SFT)とグループ相対政策最適化(GRPO)を組み合わせた3段階のトレーニングパイプラインを導入する。
重要なことは、この手法は最終計画の成果に基づく報酬を利用して、基礎となるオブジェクト指向推論構造を暗黙的に最適化し、希少なアノテーションであっても効果的な学習を可能にする。
MRoom-30kベンチマークの広範囲な評価により、OOWMはコヒーレンス、実行成功、構造的忠実性の計画において非構造的テキストベースラインを著しく上回り、構造的具体的推論の新しいパラダイムを確立した。
関連論文リスト
- LOGIGEN: Logic-Driven Generation of Verifiable Agentic Tasks [4.6880826836662814]
検証可能なトレーニングデータを合成するロジック駆動フレームワークである textbfLOGIGEN を紹介する。
2$-Benchでは、LOGIGEN-32B(RL)がtextbf79.5%の成功率を獲得し、ベースモデルを大幅に上回っている。
論文 参考訳(メタデータ) (2026-02-28T08:35:30Z) - Executable Analytic Concepts as the Missing Link Between VLM Insight and Precise Manipulation [70.8381970762877]
VLM(Vision-Language Models)は、セマンティック推論とタスク計画において顕著な能力を示す。
本稿では,VLMに基づく推論を実行可能な解析概念を通じて基礎づける新しいフレームワークであるGRACEを紹介する。
G GRACEは高レベル命令理解と低レベルロボット制御の統一的で解釈可能なインターフェースを提供する。
論文 参考訳(メタデータ) (2025-10-09T09:08:33Z) - Dynamic Generation of Multi-LLM Agents Communication Topologies with Graph Diffusion Models [99.85131798240808]
我々はtextitGuided Topology Diffusion (GTD) と呼ばれる新しい生成フレームワークを導入する。
条件付き離散グラフ拡散モデルにインスパイアされたGTD式は、反復的な構成過程としてトポロジー合成を行う。
各ステップで生成は、多目的報酬を予測する軽量プロキシモデルによって制御される。
実験により、GTDは高いタスク適応性、スパース、効率的な通信トポロジを生成できることが示されている。
論文 参考訳(メタデータ) (2025-10-09T05:28:28Z) - UML-CoT: Structured Reasoning and Planning with Unified Modeling Language for Robotic Room Cleaning [18.505621596668163]
CoT(Chain-of-Thought)は、大規模言語モデル(LLM)の推論を改善するが、非構造化テキストへの依存は、エンボディされたタスクの解釈可能性と実行可能性を制限する。
本稿では,UML(Unified Modeling Language)を利用してシンボルCoTと実行可能なアクションプランを生成する構造的推論・計画フレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-26T17:51:46Z) - Unveiling the Potential of Diffusion Large Language Model in Controllable Generation [36.05635830551406]
最先端の自己回帰型大規模言語モデル(LLM)でさえ、構造化された出力を生成するために必要な場合、信頼性が低い。
現在の拡散型大規模言語モデル(dLLM)に触発されて、アーキテクチャ上の違いが次世代の制御可能生成をアンロックする鍵であることに気付いた。
本稿では,dLLMが安定して構造化された出力を生成できる新しいフレームワークであるSelf-Adaptive Scaffoldingを提案する。
論文 参考訳(メタデータ) (2025-07-06T18:41:34Z) - Deliberate Planning in Language Models with Symbolic Representation [5.869782631289138]
構造化計画機能を備えた大規模言語モデルを備えた新しいフレームワークであるSymPlannerを紹介する。
SymPlannerは、純粋に自然言語の推論に頼るのではなく、計画プロセスを象徴的な状態空間に置きます。
反復補正(IC)は、シンボル環境からのフィードバックを利用して、これまで提案されていた行動を洗練する。
Contrastive Ranking (CR) は、それらを共同で評価することで、候補プランのきめ細かい比較を可能にする。
論文 参考訳(メタデータ) (2025-05-02T15:18:03Z) - On The Planning Abilities of OpenAI's o1 Models: Feasibility, Optimality, and Generalizability [59.72892401927283]
さまざまなベンチマークタスクでOpenAIのo1モデルの計画能力を評価する。
その結果,o1-preview は GPT-4 よりもタスク制約に順応していることがわかった。
論文 参考訳(メタデータ) (2024-09-30T03:58:43Z) - Autoregressive Structured Prediction with Language Models [73.11519625765301]
本稿では, PLM を用いた自己回帰的手法を用いて, モデル構造を行動列として記述する。
我々のアプローチは、私たちが見てきた全ての構造化予測タスクにおいて、新しい最先端を実現する。
論文 参考訳(メタデータ) (2022-10-26T13:27:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。