論文の概要: Beyond the Current Scene: Event-Referential Grasping with Active View Selection
- arxiv url: http://arxiv.org/abs/2609.39375v1
- Date: Wed, 30 Sep 2026 09:27:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:27.517563
- Title: Beyond the Current Scene: Event-Referential Grasping with Active View Selection
- Title(参考訳): 現在の場面を超えて: アクティブビュー選択によるイベント参照グラフプ
- Abstract要約: ゼロショットロボット把握システムであるBeyondSCeを紹介する。
システムは、要求されたオブジェクトまたは部分を特定し、それを把握するためにローカライズする。
達成率76%、達成目標77%を達成している。
- 参考スコア(独自算出の注目度): 58.13862796903706
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: A robot that observes people interacting with objects should be able to carry out later requests that refer back to those interactions. Such requests may specify a grasp target by the role it played in a past event rather than by its name or appearance. Moreover, the target may no longer be visible when the robot is asked to act. We present BeyondSCe, a zero-shot robotic grasping system for this event-referential setting. Given the event history and the current scene, the system identifies the requested object or part and localizes it for grasping. If the target is occluded, it combines an event prior recovered from the history with current scene geometry to select camera viewpoints likely to reveal the target. The system uses pretrained models without additional task-specific training. In real-robot experiments with a single wrist-mounted RGB-D camera, it achieves grasp success rates of 76% and 77% for initially visible and occluded targets, respectively, compared with 40% and 55% for the strongest baseline in each condition. On four additional scenes with heavy occlusion, it increases grasp success rates from 75% to 95% while reducing the mean number of views from 3.35 to 2.20, compared with an active-perception baseline given the target's ground-truth 3D bounding box.
- Abstract(参考訳): オブジェクトと対話する人々を観察するロボットは、これらのインタラクションを参照する後の要求を実行することができる。
このような要求は、その名前や外観ではなく、過去のイベントで演じた役割によってグリップターゲットを指定することができる。
さらに、ロボットが行動するよう求められると、ターゲットは見えなくなるかもしれない。
我々は、このイベント参照設定のためのゼロショットロボット把握システムであるBeyondSCeを紹介する。
イベント履歴と現在のシーンから、システムは要求されたオブジェクトまたは部分を特定し、それを把握するためにローカライズする。
対象が隠されている場合、過去から回収されたイベントと現在のシーン形状を組み合わせて、ターゲットを明らかにする可能性のあるカメラ視点を選択する。
このシステムは、追加のタスク固有のトレーニングなしで事前訓練されたモデルを使用する。
単一の手首に搭載されたRGB-Dカメラを用いた実ロボット実験では、各条件において最強のベースラインの40%と55%に対して、初期可視目標と隠蔽目標の76%と77%の成功率を把握できる。
重閉塞の4つの追加シーンでは、目標の3Dバウンディングボックスが与えられたアクティブパーセプションベースラインと比較して、平均ビュー数が3.35から2.20に減少し、75%から95%に達成率を上昇させる。
関連論文リスト
- Grounded Action Model: 3D Grounding as a Foundation for Robotics [29.02274437902474]
Grounded Action Models (GAMs) は、3Dグラウンドで構築されたロボット基盤モデルの新たなパラダイムである。
RoboTwin 2.0では、50タスクの平均成功率は55.3%である(空間強制では52.0%)。
LIBERO-PROでは、16の摂動設定で61%(vs.53% for $_0.5$)の最先端の平均成功率を達成する。
論文 参考訳(メタデータ) (2026-09-20T20:35:39Z) - VABench: Measuring Embodied Spatial Intelligence through Visual Demonstrations, Active Perception, and Metric Control [57.5995346750474]
VA-Benchを導入し、完全なオブザーバ・レアソン・アクト・リビジョンループを評価する。
汎用MLLMは、RGBのみのデモンストレーションから手続き的コンテキストを学習する。
モデルには特権オブジェクトのポーズ、オラクルの軌跡、学習されたアクションヘッドは含まれない。
論文 参考訳(メタデータ) (2026-09-17T01:24:51Z) - BRAVE-6D: Benchmark for Robotic Active Vision in 6DOF Pose Estimation [41.7747182499753]
BRAVE-6Dは、オブジェクトポーズ推定のためのロボットアクティブビジョンシステムを評価するために設計されたベンチマークである。
シーン内で視覚サーボを行い、小さなオブジェクトのポーズを正確に推定するベースラインソリューションを示す。
論文 参考訳(メタデータ) (2026-09-15T12:38:20Z) - Robostral Navigate [138.74472687550374]
Robostral Navigateは、大規模なナビゲーションシステムのための視覚言語モデルである。
モノラルなRGB画像のストリームのみを消費し、現在のカメラビューの次のターゲット位置を指して、ウェイポイントを予測する。
我々は、実世界のデータ収集への依存を減らすため、350kのシミュレートされたシーンに240万のトラジェクトリを生成します。
論文 参考訳(メタデータ) (2026-07-22T23:13:05Z) - Sparse2Act: Learning Action-Aligned Sparse 3D Representations for Cross-Domain Robot Manipulation [52.00134393320209]
Sparse2Actは、スパースポイントクラウドエンコーダの事前学習のための観測・動作アライメントフレームワークである。
マスク付きスパース3Dトークンは、観察と組み合わせたワークスペース運動の周囲のシーン特徴を整理するために訓練される。
LIBERO-10ベンチマークでは,500ステップの微調整を行い,平均86.9%の成功を達成した。
論文 参考訳(メタデータ) (2026-06-10T23:56:01Z) - PickScan: Object discovery and reconstruction from handheld interactions [99.99566882133179]
シーンの3次元表現を再構成する対話誘導型クラス依存型手法を開発した。
我々の主な貢献は、操作対象のインタラクションを検出し、操作対象のマスクを抽出する新しいアプローチである。
相互作用ベースとクラス非依存のベースラインであるCo-Fusionと比較すると、これはシャムファー距離の73%の減少に相当する。
論文 参考訳(メタデータ) (2024-11-17T23:09:08Z) - Robot See Robot Do: Imitating Articulated Object Manipulation with Monocular 4D Reconstruction [51.49400490437258]
本研究は,1つの単分子RGB人間の実演から音声による物体操作を模倣する手法を開発した。
まず,モノクロ映像から3次元部分運動を復元する4次元微分可能部品モデル(4D-DPM)を提案する。
この4D再構成を前提として、ロボットは物体の軌道を再現し、両腕の動きを計画し、実証された物体部分の動きを誘導する。
両用するYuMiロボットを用いて,4D-DPMの3D追跡精度を実写3D部分軌跡に基づいて評価し,9つのオブジェクトに対してRSRDの物理的実行性能を評価した。
論文 参考訳(メタデータ) (2024-09-26T17:57:16Z) - CARPE-ID: Continuously Adaptable Re-identification for Personalized
Robot Assistance [16.948256303861022]
今日のHuman-Robot Interaction(HRI)のシナリオでは、ロボットが最も近い個人と協力する必要があると仮定する傾向が一般的である。
連続的な視覚適応技術に基づく人物識別モジュールを提案する。
実験室環境におけるビデオ記録と,移動ロボットによるHRIシナリオを用いて,このフレームワークを単体でテストする。
論文 参考訳(メタデータ) (2023-10-30T10:24:21Z) - Simultaneous Semantic and Collision Learning for 6-DoF Grasp Pose
Estimation [20.11811614166135]
我々は,同時マルチタスク学習問題として6-DoFグリップポーズ推定を定式化する。
統合されたフレームワークでは、実現可能な6-DoFグリップポーズ、インスタンスセマンティックセグメンテーション、衝突情報を共同で予測する。
本モデルは,大規模ベンチマークと実ロボットシステムを用いて評価する。
論文 参考訳(メタデータ) (2021-08-05T07:46:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。