論文の概要: Adaptive Vision-Language Grasping via Composable Foundation Priors and Generalizable Grasp Synthesis
- arxiv url: http://arxiv.org/abs/2609.04096v1
- Date: Thu, 03 Sep 2026 17:03:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:39.162409
- Title: Adaptive Vision-Language Grasping via Composable Foundation Priors and Generalizable Grasp Synthesis
- Title(参考訳): コンポキシブルファンデーションプライドと一般化可能なグラス合成による適応型ビジョンランゲージグラスピング
- Abstract要約: AdaRoboVLGはタスク適応型のVision-Language-Grasp(VLG)フレームワークで、さまざまなロボットハンド間で一般化可能なグリップ合成をサポートする。
AdaRoboVLGは、物理的に実現可能な把握候補を生成し評価する効率的な一般化可能なベースポリシーを学習する。
- 参考スコア(独自算出の注目度): 44.18636885787535
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper proposes AdaRoboVLG, a task-adaptive Vision-Language-Grasp (VLG) framework that supports generalizable grasp synthesis across different robotic hands. Unlike existing VLG methods that tightly couple foundation models with end-to-end grasp policies, AdaRoboVLG learns an efficient generalizable base policy that generates and evaluates physically feasible grasp candidates through explicit kinematic mapping and force-closure-based stability estimation, while offloading task-dependent understanding to specialized foundation-model modules. These modules provide composable priors that are integrated into the grasp synthesis process, enabling contextually adaptive grasp synthesis without retraining the underlying grasp policy. Through extensive simulation and real-world experiments, we demonstrate that (i) the base policy exhibits efficient learning and strong cross-hand generalization, (ii) the framework effectively incorporates spatial, cognitive, and temporal priors to address three representative grasping challenges without compromising grasp synthesis performance compared to state-of-the-art methods, and (iii) these priors can operate jointly to enable functional grasping in cluttered and dynamic environments. These results indicate that decoupling physical grasp synthesis from task-dependent understanding provides a scalable paradigm for robotic grasping, allowing future advances in foundation models to be directly translated into improved grasp capabilities without redesigning or retraining the underlying grasp policy. Supplementary videos are available at https://adarobovlg.github.io/
- Abstract(参考訳): 本稿では,タスク適応型視覚・言語・グラフ(VLG)フレームワークであるAdaRoboVLGを提案する。
AdaRoboVLGは、基本的なモデルをエンドツーエンドの把握ポリシーと密に結合する既存のVLG法とは異なり、特定の基礎モデルモジュールにタスク依存の理解をオフロードしながら、明示的なキネマティックマッピングと力-閉鎖に基づく安定性推定を通じて、物理的に実現可能な把握候補を生成し評価する効率的な一般化可能なベースポリシーを学習する。
これらのモジュールは、グリップ合成プロセスに統合された構成可能な事前情報を提供し、基盤となるグリップポリシーを再訓練することなく、文脈的に適応的なグリップ合成を可能にする。
シミュレーションと実世界の実験を通じて、我々はそれを実証した。
(i)基本方針は、効率的な学習と強力なクロスハンド一般化を示す。
二 この枠組みは、最先端の手法と比較して、把握性能を損なうことなく、3つの代表的把握課題に対処するために、空間的、認知的、時間的事前を効果的に組み込んでおり、かつ、
三 これらの先行は、乱雑で動的な環境において機能的な把握を可能にするために、共同で操作することができる。
これらの結果から,タスク依存理解から物理的グリップ合成を分離することで,ロボットグリップのスケーラブルなパラダイムが実現し,基盤となるグリップポリシーを再設計・再訓練することなく,基礎モデルの今後の進歩を直接グリップ能力に変換できることが示唆された。
補足ビデオはhttps://adarobovlg.github.io/で公開されている。
関連論文リスト
- In-Context Model Predictive Generation: Open-Vocabulary Motion Synthesis from Language Models to Physics [109.99871326497333]
In-Context Model Predictive Generation (ICMPG)は、言語モデル計画と推論時の物理的フィードバックを統合するフレームワークである。
ICMPGは2つのモジュールでモデル予測制御(MPC)のようなプロセスとして運動合成を再構成する。
論文 参考訳(メタデータ) (2026-06-25T12:50:33Z) - OmniGuide: Universal Guidance Fields for Enhancing Generalist Robot Policies [75.40720507604647]
視覚言語アクション(VLA)モデルは、比較的単純なタスクの多岐にわたるジェネラリストポリシーとして、非常に有望である。
本稿では,任意の指導源を活用することで,このようなタスクにおけるVLA性能を向上させるフレキシブルなフレームワークを提案する。
本研究では,3次元空間内に存在するタスク特異的アトラクタとレペラを用いて,自然に何種類のガイダンスを微分可能エネルギー関数として表現できるかを示す。
論文 参考訳(メタデータ) (2026-03-09T17:18:13Z) - Policy-Conditioned Policies for Multi-Agent Task Solving [53.67744322553693]
本研究では,ポリシーを人間の解釈可能なソースコードとして表現することでギャップを埋めるパラダイムシフトを提案する。
本研究では,Large Language Models (LLM) を近似インタプリタとして利用することにより,学習問題を再構築する。
我々はこのプロセスを,ポリシーコードをテキスト勾配で最適化するアルゴリズムである TextitProgrammatic Iterated Best Response (PIBR) として定式化する。
論文 参考訳(メタデータ) (2025-12-24T07:42:10Z) - Compose Your Policies! Improving Diffusion-based or Flow-based Robot Policies via Test-time Distribution-level Composition [52.232968183793986]
General Policy Composition (GPC) は、複数の事前学習されたポリシーの分布スコアを組み合わせることで、パフォーマンスを向上させる訓練のない手法である。
GPCは、さまざまなタスクセットにおけるパフォーマンスと適応性を一貫して改善します。
論文 参考訳(メタデータ) (2025-10-01T16:05:53Z) - Feature-Based vs. GAN-Based Learning from Demonstrations: When and Why [50.191655141020505]
この調査は、デモから学ぶ機能ベースのアプローチとGANベースのアプローチの比較分析を提供する。
特徴に基づく手法とGANに基づく手法の2分法はますます曖昧になっていると我々は主張する。
論文 参考訳(メタデータ) (2025-07-08T11:45:51Z) - BASIL: Best-Action Symbolic Interpretable Learning for Evolving Compact RL Policies [0.0]
BASIL(Best-Action Symbolic Interpretable Learning)は、シンボリックなルールベースのポリシーを生成するための体系的なアプローチである。
本稿では,象徴的表現性,進化的多様性,オンライン学習を組み合わせた新しい解釈可能なポリシー合成手法を提案する。
論文 参考訳(メタデータ) (2025-05-31T00:47:24Z) - NVSPolicy: Adaptive Novel-View Synthesis for Generalizable Language-Conditioned Policy Learning [10.880824035303176]
NVSPolicyは、適応型新規ビュー合成モジュールと階層型ポリシーネットワークを結合した、一般化可能な言語条件付きポリシー学習手法である。
NVSPolicyはすべてのタスクで平均90.4%の成功率を実現しており、最近の手法よりも優れています。
さらに,NVSPolicyを実世界のロボットプラットフォーム上で評価し,実用性を示す。
論文 参考訳(メタデータ) (2025-05-15T14:51:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。