論文の概要: GROW$^2$: Grounding Which and Where for Robot Tool Use
- arxiv url: http://arxiv.org/abs/2606.30632v1
- Date: Mon, 29 Jun 2026 17:56:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.373165
- Title: GROW$^2$: Grounding Which and Where for Robot Tool Use
- Title(参考訳): GROW$^2$: ロボットツールの使用場所と使用場所
- Authors: Yuhong Deng, Yuyao Liu, David Hsu,
- Abstract要約: GROW$2$(GROunding Which and Where)を導入し、基底過程を階層的に意味的および幾何学的レベルに分割する。
ビジョンランゲージモデル(Vision-Language Models)の常識的推論を利用して、自然言語のタスク命令を解析し、ツールとして適切なオブジェクトを選択し、ツールと対象オブジェクトのタスク関連部分を識別する。
実験によると、GROW$2$は、価格予測ベンチマークの最先端ベースラインを上回っている。
- 参考スコア(独自算出の注目度): 18.075618017756238
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Can the robot use a plate to cut a cake if no knife is available? Tool use greatly expands robot capabilities, but to use tools creatively beyond their intended functions, the robot faces the challenge of $\textit{open-world affordance grounding}$: select an open-category object to act as a tool and localize its specific region of action. To this end, we introduce GROW$^2$ (GROunding Which and Where), which leverages object parts as a natural abstraction to split the grounding process hierarchically into semantic and geometric levels, thus bypassing the need for data-heavy, end-to-end training. Semantically, GROW$^2$ harnesses the commonsense reasoning of Vision-Language Models (VLMs) to parse a natural-language task instruction, select a suitable object as the tool, and identify task-relevant parts on the tool and the target object. Geometrically, vision foundation models then ground the selected parts into precise 3D regions from a single RGB-D image. Experiments on established benchmarks show that GROW$^2$ outperforms state-of-the-art baselines on affordance prediction benchmarks. Further, it achieves zero-shot generalization over open-category objects and outperforms baselines in both simulated and real-world robot tool use experiments.
- Abstract(参考訳): ナイフがなければ、このロボットは皿を使ってケーキを切ることができるのか?
ツールの使用は、ロボットの機能を大幅に拡大するが、意図した機能を超えて創造的にツールを使用するために、このロボットは、$\textit{open-world affordance grounding}$: ツールとして機能し、特定のアクション領域をローカライズするためのオープンカテゴリオブジェクトを選択するという課題に直面している。
この目的のために、GROW$^2$(GROunding Which and Where)を導入し、オブジェクト部品を自然な抽象化として活用し、階層的に基底処理を意味的および幾何学的なレベルに分割し、データ量の多いエンドツーエンドトレーニングの必要性を回避した。
GROW$^2$は、視覚言語モデル(VLM)の常識推論を利用して、自然言語のタスク命令を解析し、ツールとして適切なオブジェクトを選択し、ツールと対象オブジェクトのタスク関連部分を識別する。
幾何学的には、視覚基礎モデルは、選択した部分を単一のRGB-D画像から正確な3D領域にグラウンドする。
確立されたベンチマークの実験では、GROW$^2$は、価格予測ベンチマークの最先端ベースラインを上回っている。
さらに、オープンカテゴリオブジェクトに対するゼロショットの一般化を実現し、シミュレーションおよび実世界のロボットツール使用実験においてベースラインを上回ります。
関連論文リスト
- AFUN: Towards an Affordance Foundation Model for Functionality Understanding [12.890216832485647]
我々は,機能理解のための手頃な基礎モデルに向けたステップとして,我々のモデルを提示する。
我々は、異種ロボット、人間、シミュレーション、現実世界のスキャンデータを共有価格スキーマに変換する大規模な標準化データパイプラインを構築します。
私たちのモデルは、4つのベンチマークから8つのテストセットにまたがる大きなマージンで、すべてのベースラインを上回ります。
論文 参考訳(メタデータ) (2026-06-01T17:50:16Z) - VLAD-Grasp: Zero-shot Grasp Detection via Vision-Language Models [11.02910353976723]
VLAD-Graspは視覚言語モデルを用いたゼロショットによる把握手法である。
従来の作業とは異なり、我々のアプローチはトレーニング不要であり、キュレートされた把握データセットに依存しない。
さらに,Franka Research 3ロボットを用いた新しい現実世界オブジェクトへのゼロショットの一般化を実証する。
論文 参考訳(メタデータ) (2025-11-08T01:47:40Z) - R2RGEN: Real-to-Real 3D Data Generation for Spatially Generalized Manipulation [74.41728218960465]
本稿では,実世界のデータを生成するために,ポイントクラウド観測-アクションペアを直接拡張するリアルタイム3Dデータ生成フレームワーク(R2RGen)を提案する。
R2RGenは、広範な実験におけるデータの効率を大幅に向上させ、モバイル操作におけるスケーリングと応用の強い可能性を示す。
論文 参考訳(メタデータ) (2025-10-09T17:55:44Z) - O$^3$Afford: One-Shot 3D Object-to-Object Affordance Grounding for Generalizable Robotic Manipulation [8.1159855043566]
我々は,限られたデータ制約下でのオブジェクト・ツー・オブジェクト・アベイランス・グラウンドディングの課題に対処する。
近年の2次元視覚基礎モデルによる数ショット学習の進歩に触発され,ロボット操作のための1Dオブジェクト・オブジェクト・アベイランス・ラーニング・アプローチを提案する。
3Dオブジェクト・ツー・オブジェクト・アベイランス・グラウンドとロボット操作による実験により,O$3$Affordは,精度と一般化能力の両面で,既存のベースラインを著しく上回っていることが示された。
論文 参考訳(メタデータ) (2025-09-07T22:45:06Z) - FLARE: Robot Learning with Implicit World Modeling [87.81846091038676]
$textbfFLARE$は、予測潜在世界モデリングをロボットポリシー学習に統合する。
$textbfFLARE$は最先端のパフォーマンスを実現し、これまでのポリシー学習のベースラインを最大26%上回っている。
この結果は、暗黙の世界モデリングと高周波ロボット制御を組み合わせた汎用的でスケーラブルなアプローチとして$textbfFLARE$を確立した。
論文 参考訳(メタデータ) (2025-05-21T15:33:27Z) - $π_{0.5}$: a Vision-Language-Action Model with Open-World Generalization [81.73746512639283]
広義の一般化を実現するために異種タスクのコトレーニングを利用する$pi_0.5$に基づく新しいモデルについて述べる。
本研究では,エンド・ツー・エンドの学習支援ロボットシステムが,長期的かつ巧妙な操作能力を発揮することを初めて実証する。
論文 参考訳(メタデータ) (2025-04-22T17:31:29Z) - GAMMA: Generalizable Articulation Modeling and Manipulation for
Articulated Objects [53.965581080954905]
本稿では,GAMMA(Generalizable Articulation Modeling and Manipulating for Articulated Objects)の新たな枠組みを提案する。
GAMMAは,異なるカテゴリーの多種多様な調音オブジェクトから,調音モデルと手取りポーズの相違を学習する。
その結果, GAMMA はSOTA の調音モデルおよび操作アルゴリズムを, 目に見えない, 横断的な調音オブジェクトで著しく上回っていることがわかった。
論文 参考訳(メタデータ) (2023-09-28T08:57:14Z) - A Universal Semantic-Geometric Representation for Robotic Manipulation [42.18087956844491]
本稿では,ロボット工学の汎用認識モジュールであるtextbfSemantic-Geometric Representation (textbfSGR) について述べる。
SGRは、大規模事前訓練された2次元モデルのリッチな意味情報を活用し、3次元空間推論の利点を継承する。
我々の実験は、SGRがエージェントに様々なシミュレーションおよび実世界のロボット操作タスクを完了させることを実証した。
論文 参考訳(メタデータ) (2023-06-18T04:34:17Z) - MetaGraspNet: A Large-Scale Benchmark Dataset for Vision-driven Robotic
Grasping via Physics-based Metaverse Synthesis [78.26022688167133]
本稿では,物理に基づくメタバース合成による視覚駆動型ロボットグルーピングのための大規模ベンチマークデータセットを提案する。
提案するデータセットには,10万の画像と25種類のオブジェクトが含まれている。
また,オブジェクト検出とセグメンテーション性能を評価するためのデータセットとともに,新しいレイアウト重み付け性能指標を提案する。
論文 参考訳(メタデータ) (2021-12-29T17:23:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。