論文の概要: RAGrasp: Geometry-Semantic Template Retrieval and Grasp Transfer
- arxiv url: http://arxiv.org/abs/2610.04438v1
- Date: Sat, 03 Oct 2026 10:59:13 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:45:26.518069
- Title: RAGrasp: Geometry-Semantic Template Retrieval and Grasp Transfer
- Title(参考訳): RAGrasp:Geometry-Semantic Template Retrieval and Grasp Transfer
- Abstract要約: RAGraspは、平面並列ジャウグリップのための検索拡張パイプラインである。
テンプレートメモリは、デプロイメントカメラ、ロボット、およびターゲットワークスペースで収集された観測から構築される。
実世界の試験では、RAGraspは目に見えない物体を20/20で把握し、見えない物体を19/20で把握することに成功した。
- 参考スコア(独自算出の注目度): 1.6795461001108094
- License:
- Abstract: We present RAGrasp, a retrieval-augmented pipeline for planar parallel-jaw grasping from a compact set of locally collected, grasp-annotated RGB-D (color and depth) templates. Unlike task-specific predictors trained primarily on large public or synthetic grasp datasets, RAGrasp requires no end-to-end retraining for a new deployment.Its template memory is constructed from observations collected with the deployment camera, robot, and gripper in the target workspace, thereby aligning stored examples with the local sensing and embodiment conditions. The system uses self-supervised DINOv2 visual fea- tures together with appearance and depth cues to prompt the Segment Anything Model 2 (SAM2), which isolates the query object. A two-stage geometry-semantic retrieval cascade then selects a template, and a confidence gate chooses one of two grasp- transfer estimators. The transferred grasp is refined using mask- support and silhouette-contact constraints before calibrated 2D- to-3D conversion. In real-world trials, RAGrasp achieves 20/20 successful grasps on seen objects and 19/20 on unseen objects. Within the evaluated setting, the results demonstrate deployment- specific grasp adaptation from limited local annotation and tolerance to the tested viewpoint and illumination changes.
- Abstract(参考訳): 本稿では,局所的に収集したRGB-D(色と深さ)テンプレートのコンパクトな集合から平面並列ジャウ把握のための探索拡張パイプラインであるRAGraspを提案する。
RAGraspは、主に大規模な公開または合成的な把握データセットに基づいて訓練されたタスク固有の予測器とは異なり、新しいデプロイメントのためにエンドツーエンドのトレーニングを必要とせず、ターゲットワークスペース内の配置カメラ、ロボット、グリップで収集された観測結果からテンプレートメモリを構築し、格納されたサンプルを局所的なセンシングおよび実施条件と整合させる。
このシステムは、DINOv2ビジュアル・フェースチャーと外観と奥行きの手がかりを使って、クエリオブジェクトを分離するセグメンツ・アセシング・モデル2 (SAM2) を誘導する。
次に、2段階の幾何意味検索カスケードがテンプレートを選択し、信頼ゲートが2つのグリップ転送推定器のうちの1つを選択する。
2D-〜3D変換に先立ち、マスク支持とシルエット接触制約を用いて転写グリップを精製する。
実世界の試験では、RAGraspは目に見えない物体を20/20で把握し、見えない物体を19/20で把握することに成功した。
評価条件の中では、限定的な局所アノテーションからのデプロイメント固有の把握適応と、テストされた視点への耐性と照度の変化を示す。
関連論文リスト
- DeepStratNet: A Context-Aware Coordinate Regression Framework for Seismic Horizon Tracking under Sparse Labels [0.1399948157377307]
地平線追跡は3次元地震の解釈の基本課題である。
既存のアプローチのほとんどは、それを密接なセマンティックセグメンテーションとして定式化している。
我々は、事前訓練された視覚バックボーンと互換性のある軽量回帰ヘッドを提案する。
論文 参考訳(メタデータ) (2026-10-01T21:16:43Z) - DualManip: Agentic Dynamic Manipulation via Dual-Path Semantic Reasoning and Geometric Adaptation [56.09942267971931]
視覚言語モデル(VLM)は、ロボット操作のオープンボキャブラリ推論を可能にするが、高い推論遅延は動的シーンでの応答性を制限している。
応答的幾何適応から頻繁な意味推論を分離するデュアルパスフレームワークであるDualManipを提案する。
実世界の評価は、非剛性変形、調音再構成、剛性運動、高精度アセンブリを含む6つの操作タスクにまたがる。
論文 参考訳(メタデータ) (2026-09-25T10:57:02Z) - G2IA: Geometry-Guided Instance-Aware Retrieval and Refinement for Cross-Modal Place Recognition [24.541278686912616]
クロスモーダル位置認識(CMPR)により、カメラのみのロボットは、自律的なナビゲーションシナリオにおいて、事前に構築されたLiDARマップに対してローカライズすることができる。
このイメージ・ツー・ポイント・クラウド・セッティングは、2つのあいまいさ、すなわち視点RGBの外観とスパースメトリ幾何の間のモダリティギャップによって挑戦される。
画像から点までの位置認識のための幾何学誘導型インスタンス認識フレームワークであるG2IAを提案する。
論文 参考訳(メタデータ) (2026-06-13T12:53:52Z) - Dual-Pathway Geometry-Aware MLLM for Spatial Intelligence [63.11502936651325]
本稿では,空間知能のための二経路幾何対応MLLMであるGAMSIを提案する。
RGB画像のみを入力とし、両方の幾何学的形態を統一された自己回帰バックボーン内に内包する。
GAMSIは、7つの空間インテリジェンスベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-05-25T01:33:19Z) - GS-CLIP: Zero-shot 3D Anomaly Detection by Geometry-Aware Prompt and Synergistic View Representation Learning [11.364765496753074]
3D異常検出は、ターゲットのトレーニングデータなしでターゲットデータセット内の異常を検出することを目的とした、新たなタスクである。
現在の方法は、3Dポイントクラウドを2D表現に投影することでCLIPに適応するが、それらは課題に直面している。
本研究では,2段階の学習プロセスを通じて幾何学的異常を識別するゲノメトリ・アウェア・プロンプトとシネジスティック・ビュー表現学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-22T14:30:41Z) - Recurrent Cross-View Object Geo-Localization [23.685973292321574]
クロスビューオブジェクトジオローカライゼーション (CVOGL) は、問合せ画像と点プロンプトが与えられた場合の高解像度衛星画像における特定のオブジェクトの位置を決定することを目的としている。
本稿では,CVOGLをリカレント・ローカライゼーションタスクとして再構成したリカレント・クロスビュー・オブジェクトのジオローカライゼーション・トランスフォーマであるReCOTを提案する。
ReCOTは、クエリイメージからタスク固有の意図をエンコードし、埋め込みを促す一連の学習可能なトークンを導入し、予測された位置を洗練するための参照機能に反復的に参加する。
論文 参考訳(メタデータ) (2025-09-16T07:18:23Z) - Hi^2-GSLoc: Dual-Hierarchical Gaussian-Specific Visual Relocalization for Remote Sensing [6.997091164331322]
リモートセンシングやUAVアプリケーションには、視覚的再ローカライゼーションが不可欠である。
画像に基づく検索とポーズ回帰アプローチは精度に欠ける。
スパース・トゥ・デンス(sparse-to-dense)と粗粒度(arse-to-fine)のパラダイムに従う二重階層的再ローカライゼーションフレームワークである$mathrmHi2$-GSLocを紹介した。
論文 参考訳(メタデータ) (2025-07-21T14:47:56Z) - S^2Former-OR: Single-Stage Bi-Modal Transformer for Scene Graph Generation in OR [50.435592120607815]
外科手術のシーングラフ生成(SGG)は、手術室(OR)におけるホモロジー認知知能の増強に不可欠である
これまでの研究は主に多段階学習に依存しており、生成したセマンティックシーングラフはポーズ推定とオブジェクト検出を伴う中間プロセスに依存している。
本研究では,S2Former-OR(S2Former-OR)と呼ばれるORにおけるSGGのための新しいシングルステージバイモーダルトランスフォーマフレームワークを提案する。
論文 参考訳(メタデータ) (2024-02-22T11:40:49Z) - Visual Saliency Transformer [127.33678448761599]
RGBとRGB-Dの液状物体検出(SOD)のための、純粋な変圧器であるVST(Visual Saliency Transformer)に基づく新しい統一モデルを開発しました。
イメージパッチを入力として取り、トランスフォーマーを利用してイメージパッチ間のグローバルコンテキストを伝搬する。
実験結果から,RGBとRGB-D SODのベンチマークデータセットにおいて,本モデルが既存の最新結果を上回っていることが示された。
論文 参考訳(メタデータ) (2021-04-25T08:24:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。