論文の概要: Representation-Guided Generation and Integration of Executable Programs for Robot Manipulation
- arxiv url: http://arxiv.org/abs/2609.31337v1
- Date: Fri, 25 Sep 2026 14:41:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.441957
- Title: Representation-Guided Generation and Integration of Executable Programs for Robot Manipulation
- Title(参考訳): ロボットマニピュレーションのための表現誘導型生成と実行可能プログラムの統合
- Abstract要約: 本稿では,VLM生成実行可能タスクプログラム(RIVET)の表現誘導統合について述べる。
RIVETは、共有オブジェクト中心表現を中心とした完全な操作システムを生成するためのフレームワークである。
我々は,立方体積み重ね,タングラム再構成,シミュレーションおよび物理ロボットにおける3次元組立について RIVET の評価を行った。
- 参考スコア(独自算出の注目度): 17.390448172399374
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Building a robotic manipulation system requires connecting perception, planning, and control through carefully designed representations and interfaces. VLM code generation offers a way to automate this construction, but independently generated components may operate on incompatible geometric and task-level information. We present Representation-guided Integration of VLM-generated Executable Task programs (RIVET), a framework for generating complete manipulation systems around a shared object-centric representation. The representation combines per-object 6D poses, which preserve the metric information required for action grounding, with a relation graph that exposes the task-level structure required for planning. Guided by this representation, a VLM generates cooperating perception, rendering, relation-inference, and planning programs, each combining task-specific computation with available packages where useful. The resulting programs are authored once for a manipulation domain and reused on unseen start and goal configurations without code regeneration. We evaluate RIVET on cube stacking, tangram rearrangement, and three-dimensional assembly in simulation and on a physical robot, where we achieve 83% overall success rate in the real world by reusing offline-generated systems. Our results demonstrate that representation-guided program generation can adapt a common manipulation framework to tasks with different geometric, relational, and sequential requirements.
- Abstract(参考訳): ロボット操作システムを構築するには、慎重に設計された表現とインターフェースを通じて知覚、計画、制御を接続する必要がある。
VLMコード生成は、この構成を自動化する手段を提供するが、独立に生成されたコンポーネントは、互換性のない幾何学的およびタスクレベルの情報を扱うことができる。
本稿では,VLM 生成した Executable Task Program (RIVET) の表現誘導型統合について述べる。
この表現は、アクショングラウンドに必要なメトリック情報を保持するオブジェクトごとの6Dポーズと、計画に必要なタスクレベル構造を公開する関係グラフを組み合わせる。
この表現によって、VLMは協調的な知覚、レンダリング、関係推論、計画プログラムを生成し、それぞれが有用なタスク固有の計算と利用可能なパッケージを組み合わせる。
生成したプログラムは、操作ドメインのために一度作成され、コードの再生なしで、目に見えないスタートとゴールの設定で再利用される。
RIVETを立方体積み重ね、タングラム再構成、シミュレーションおよび物理ロボットで評価し、オフライン生成システムの再利用により実世界で83%の成功率を達成した。
その結果、表現誘導型プログラム生成は、幾何学的、リレーショナル、シーケンシャルな要求の異なるタスクに共通の操作フレームワークを適用することができることを示した。
関連論文リスト
- RAPID: Robot Agentic Programming from Demonstrations [47.78221527883912]
この研究は、ロボットプログラムを自動生成し、検証し、洗練するロボットエージェントプログラミング(RAPID)を導入している。
すべての実験において、RAPIDはオブジェクトのポーズ、形状、材料、環境を一般化し、強い性能を示した。
論文 参考訳(メタデータ) (2026-09-24T17:58:21Z) - CAD-Based Relation Learning and Geometric-Symbolic Planning for Robotic Assembly [0.8594140167290097]
本稿では,学習に基づく関係抽出と幾何学的シンボリック推論を組み合わせたハイブリッドASPフレームワークを提案する。
ニューラルネットワークはポイントクラウドからセマンティックな関係を予測し、Human-in-the-loop検証は不確実な予測と計画上の失敗の修正を可能にする。
提案したハイブリッドフレームワークにより,CADデータから効率的なロボット組立計画が可能であり,計画時間を大幅に短縮できることを示す。
論文 参考訳(メタデータ) (2026-09-15T14:43:25Z) - TIGeR: Tool-Integrated Geometric Reasoning in Vision-Language Models for Robotics [53.442362491589726]
本稿では、視覚言語モデル(VLM)を幾何学コンピュータに変換する新しいフレームワークであるTIGeR(Tool-Integrated Geometric Reasoning)を提案する。
TIGeRは、ニューラルネットワーク内で複雑な幾何学的操作を内部化しようとするのではなく、幾何学的推論要求を認識するためにモデルに権限を与える。
TIGeRは、実世界のロボット操作タスクにおいて、センチメートルレベルの精度を示しながら、幾何学的推論ベンチマーク上でSOTA性能を達成することを示す。
論文 参考訳(メタデータ) (2025-10-08T16:20:23Z) - Embodied Task Planning with Large Language Models [86.63533340293361]
本研究では,現場制約を考慮した地上計画のための具体的タスクにおけるTAsk Planing Agent (TaPA)を提案する。
推論の際には,オープンボキャブラリオブジェクト検出器を様々な場所で収集された多視点RGB画像に拡張することにより,シーン内の物体を検出する。
実験の結果,我々のTaPAフレームワークから生成されたプランは,LLaVAやGPT-3.5よりも大きなマージンで高い成功率が得られることがわかった。
論文 参考訳(メタデータ) (2023-07-04T17:58:25Z) - Sequential Manipulation Planning on Scene Graph [90.28117916077073]
我々は,効率的な逐次タスク計画のための3次元シーングラフ表現であるコンタクトグラフ+(cg+)を考案する。
ゴール設定は、自然にコンタクトグラフに指定され、最適化法を用いて遺伝的アルゴリズムによって作成することができる。
次に、初期接触グラフと目標設定との間のグラフ編集距離(GED)を計算してタスクプランを簡潔化し、ロボット動作に対応するグラフ編集操作を生成する。
論文 参考訳(メタデータ) (2022-07-10T02:01:33Z) - Graph-based Reinforcement Learning meets Mixed Integer Programs: An
application to 3D robot assembly discovery [34.25379651790627]
我々は、テトリスのような構造ブロックとロボットマニピュレータを用いて、スクラッチから完全に定義済みの任意のターゲット構造を構築するという課題に対処する。
我々の新しい階層的アプローチは、タスク全体を相互に利益をもたらす3つの実行可能なレベルに効率的に分解することを目的としています。
論文 参考訳(メタデータ) (2022-03-08T14:44:51Z) - Long-Horizon Manipulation of Unknown Objects via Task and Motion
Planning with Estimated Affordances [26.082034134908785]
操作可能なオブジェクトの集合に関する事前知識がなくても,タスク・アンド・モーション・プランナが知的行動の計画に利用できることを示す。
この戦略により、単一のシステムが様々な実世界のマルチステップ操作タスクを実行できることを実証する。
論文 参考訳(メタデータ) (2021-08-09T16:13:47Z) - Latent Space Roadmap for Visual Action Planning of Deformable and Rigid
Object Manipulation [74.88956115580388]
プランニングは、イメージを埋め込んだ低次元の潜在状態空間で行われる。
我々のフレームワークは2つの主要なコンポーネントで構成されており、画像のシーケンスとして視覚的な計画を生成するビジュアル・フォレスト・モジュール(VFM)と、それら間のアクションを予測するアクション・プロポーザル・ネットワーク(APN)である。
論文 参考訳(メタデータ) (2020-03-19T18:43:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。