論文の概要: SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments
- arxiv url: http://arxiv.org/abs/2607.20207v1
- Date: Wed, 22 Jul 2026 14:27:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.112625
- Title: SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments
- Title(参考訳): SeedGrasp: 複数の身体を持つ複雑なシーンにおける言語ガイド型グラスピング
- Authors: Yang Xu, Gurpreet Singh Mukker, Raymond Wang, Jasper Gerigk, Maria Attarian, Igor Gilitschenski,
- Abstract要約: 視覚言語モデル(VLM)は、言語を用いて要求を特定する自然な方法を提供する。
既存のアプローチでは、VLMを使用して、空間的認識が限られた状態で直接把握を予測するか、あるいは把握モデルとともにVLMを訓練する。
そこで,本論文では,VLMがその後の軽量な把握生成モデルの条件付けとして使用するシードポイントを予測できる新しいデータ効率フレームワークであるSeededGraspを提案する。
- 参考スコア(独自算出の注目度): 17.165500070631442
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Practical robotic grasping in complex scenes requires both 3D spatial reasoning and alignment with task-specific requirements. Vision-language models (VLMs) offer a natural way to specify these requirements using language, but existing approaches either use a VLM to predict the grasp directly with limited spatial awareness, or train the VLM together with the grasping model, which requires significantly more data and compute. These limitations impede performance and have prevented scaling to multiple embodiments in complex scenes. We address this by proposing SeededGrasp, a novel data-efficient framework that enables a VLM to predict a seed point to be used as conditioning for a subsequent lightweight grasp-generation model. Our architecture decouples high-level semantic reasoning from low-level geometric execution, enabling multi-embodiment support while bypassing the need for expensive end-to-end training. To enable training such models, we release the first multi-embodiment tabletop grasping dataset comprising over 2.5M grasps in cluttered scenes. Experimental results demonstrate that our approach outperforms existing baselines, achieving 72% success in simulation and 78% in real-world grasping experiments. See our project site for data and code: https://uoft-isl.github.io/seeded-grasp/
- Abstract(参考訳): 複雑な場面での実践的なロボットグルーピングには、3次元空間推論とタスク固有の要件との整合が必要とされる。
視覚言語モデル(VLM)は、これらの要件を言語を用いて指定する自然な方法を提供するが、既存のアプローチでは、VLMを使用して、空間的認識が限られた場合に直接把握を予測するか、より多くのデータと計算を必要とする把握モデルと共にVLMを訓練する。
これらの制限はパフォーマンスを阻害し、複雑なシーンにおける複数の実施例へのスケーリングを妨げている。
そこで本論文では,VLM がその後の軽量な把握世代モデルの条件付けとして使用するシードポイントを予測可能な,データ効率のよい新しいフレームワーク SeededGrasp を提案する。
我々のアーキテクチャは、低レベルの幾何学的実行から高レベルの意味推論を分離し、高価なエンドツーエンドトレーニングの必要性を回避しながら、マルチエンボディメントをサポートします。
このようなモデルのトレーニングを可能にするため,散らばったシーンで2.5万以上のグリップからなる,最初のマルチエンボディメントテーブルトップ把握データセットをリリースする。
実験の結果,本手法は既存のベースラインよりも優れており,シミュレーションで72%,実世界の把握実験で78%の成功を収めていることがわかった。
データとコードのサイトをご覧ください。
関連論文リスト
- End-to-End Dexterous Grasp Learning from Single-View Point Clouds via a Multi-Object Scene Dataset [36.127347599544514]
現在の主流のグルーピングデータセットは、主に単一オブジェクトシナリオと事前に定義されたグルーピング構成に焦点を当てている。
DGS-Netは,多目的シーンにおける単一視点の雲から密集した把握構成を学習できる,エンドツーエンドの把握予測ネットワークである。
私たちのデータセットは、307のオブジェクト、240のマルチオブジェクトシーン、350万以上の検証されたグリップで構成されています。
論文 参考訳(メタデータ) (2026-03-16T15:21:13Z) - SIMS-V: Simulated Instruction-Tuning for Spatial Video Understanding [64.86119288520419]
マルチモーダル言語モデルは時間と空間の空間的推論に苦しむ。
SIMS-Vは3次元シミュレータの特権情報を利用するシステムデータ生成フレームワークである。
提案手法は,実世界の空間的タスクの具体的改善を図りながら,一般的な映像理解の性能を維持しながら,堅牢な一般化を実証する。
論文 参考訳(メタデータ) (2025-11-06T18:53:31Z) - DeepInsert: Early Layer Bypass for Efficient and Performant Multimodal Understanding [26.39397960987363]
本稿では,事前学習したトランスモデルに対する簡単な修正を提案する。
まず最初に言語プロンプトと結合するのではなく、マルチモーダルトークンを直接中央に挿入します。
その結果,本手法は,学習と推論の双方において計算コストを削減できることが示唆された。
論文 参考訳(メタデータ) (2025-04-27T18:56:26Z) - ADEM-VL: Adaptive and Embedded Fusion for Efficient Vision-Language Tuning [38.26304604660713]
ADEM-VLは、事前訓練された大規模言語モデルに基づいてモデルをチューニングする効率的な視覚言語手法である。
我々のフレームワークはScienceQAデータセットの平均精度を0.77%上回る。
論文 参考訳(メタデータ) (2024-10-23T11:31:06Z) - NVLM: Open Frontier-Class Multimodal LLMs [64.00053046838225]
NVLM 1.0は、フロンティアクラスのマルチモーダル言語モデル(LLM)のファミリーであり、視覚言語タスクの最先端結果を実現する。
トレーニング効率とマルチモーダル推論能力を両立させる新しいアーキテクチャを提案する。
我々は、NVLM-1.0モデルのための生産級マルチモーダリティを開発し、視覚言語タスクに優れる。
論文 参考訳(メタデータ) (2024-09-17T17:59:06Z) - Coarse Correspondences Boost Spatial-Temporal Reasoning in Multimodal Language Model [51.83436609094658]
本稿では,2次元画像を入力として,MLLMの時空間推論を強化する軽量な手法である粗対応を導入する。
本手法は,映像のフレーム間や異なる視点における主物体の対応性を特定するために,軽量な追跡モデルを用いている。
この単純なトレーニングフリーアプローチは、4つのベンチマークでGPT4-V/Oに一定の利得をもたらすことを実証する。
論文 参考訳(メタデータ) (2024-08-01T17:57:12Z) - eP-ALM: Efficient Perceptual Augmentation of Language Models [70.47962271121389]
本稿では,既存モデルの適応性を向上するための直接的な取り組みを提案し,認識を伴う言語モデルの拡張を提案する。
視覚言語タスクに事前訓練されたモデルを適用するための既存のアプローチは、その効率を妨げているいくつかの重要なコンポーネントに依存している。
総パラメータの99%以上を凍結し,1つの直線射影層のみをトレーニングし,1つのトレーニング可能なトークンのみを予測することにより,我々のアプローチ(eP-ALM)は,VQAとCaptioningの他のベースラインよりも有意に優れていることを示す。
論文 参考訳(メタデータ) (2023-03-20T19:20:34Z) - SimVLM: Simple Visual Language Model Pretraining with Weak Supervision [48.98275876458666]
SimVLM(Simple Visual Language Model)という,最小限の事前学習フレームワークを提案する。
SimVLMは、大規模な弱監視を活用することで、トレーニングの複雑さを低減する。
様々な識別的および生成的視覚言語ベンチマークにおいて、最先端の新たな結果が得られる。
論文 参考訳(メタデータ) (2021-08-24T18:14:00Z) - Convolutional Tensor-Train LSTM for Spatio-temporal Learning [116.24172387469994]
本稿では,ビデオシーケンスの長期相関を効率的に学習できる高次LSTMモデルを提案する。
これは、時間をかけて畳み込み特徴を組み合わせることによって予測を行う、新しいテンソルトレインモジュールによって達成される。
この結果は,幅広いアプリケーションやデータセットにおいて,最先端のパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2020-02-21T05:00:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。