論文の概要: EyeRobot 2.0: Active Gaze for Precise Manipulation without Wrist Cameras
- arxiv url: http://arxiv.org/abs/2610.03710v1
- Date: Fri, 02 Oct 2026 17:57:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.55827
- Title: EyeRobot 2.0: Active Gaze for Precise Manipulation without Wrist Cameras
- Title(参考訳): EyeRobot 2.0: リストカメラなしでの精密マニピュレーションのためのアクティブ・ゲイズ
- Abstract要約: EyeRobot 2.0は、現場の3D固定点に物理的に近づき、2つの視点で視線を照らす。
我々はEyeRobot 2.0と受動ステレオとego+手首カメラのポリシーを比較した。
- 参考スコア(独自算出の注目度): 74.35470013990918
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Inspired by human vision, we introduce a framework using active gaze to enable fine-grained bimanual manipulation with only a single stereo camera. EyeRobot 2.0 physically attends to a 3D fixation point in the scene by swiveling two eye viewpoints to center their gaze on it. The resulting images are processed foveally by allocating more visual tokens to the image centers, focusing computation on task-relevant features. Such Active Visual Fixation (AVF) requires carefully coordinated gaze during task execution, which we accomplish hierarchically by first training a low-level gaze servoing policy conditioned on a goal object, then training a target selector which emits fixation goals based on task progress. Both modules are trained with RL on real-world data: the first is trained with a dense geometric reward and the second co-trains with the BC gripper policy which allows it to discover fixation sequences that can resemble a human's fixation sequence while performing the task. EyeRobot 2.0 further takes advantage of fixation by canonicalizing gripper information into a fixation-relative SE(3) frame, which compacts the size of the action distribution to learn. We collect teleoperation data for 7 real-world and 6 simulated tasks, and conduct over 1000 physical and 1800 simulated robot trials comparing EyeRobot 2.0 against passive stereo and ego + wrist camera policies trained on the same data. Removing wrist cameras is costly for standard policies: with only passive stereo, real-world success drops from 52% to 27%. EyeRobot 2.0 closes this gap with only stereo, outperforming passive stereo by 40% in real and 20% in sim. It matches ego + wrist policies when their wrist views are clear (69% vs. 64%), and more than doubles their success when grasped objects occlude the wrist cameras (48% vs. 22%)
- Abstract(参考訳): 人間の視力に触発されて、単一のステレオカメラだけで細粒度のバイマニュアル操作を可能にするために、能動的視線を用いたフレームワークを導入する。
EyeRobot 2.0は、現場の3D固定点に物理的に近づき、2つの視点で視線を照らす。
結果のイメージは、より視覚的なトークンをイメージセンタに割り当て、タスク関連機能に計算を集中させることで、ファブリックに処理される。
このようなアクティブ・ビジュアル・フィグレーション(AVF)は、タスク実行中に注意深く調整された視線を必要とする。これは、まずゴールオブジェクトに条件付けられた低レベルの視線サーボポリシーをトレーニングし、次にタスク進捗に基づいて修正目標を出力するターゲットセレクタをトレーニングすることで階層的に達成する。
両方のモジュールは実世界のデータに基づいてRLでトレーニングされ、第1は密集した幾何学的な報酬で訓練され、第2はBCのグリップポリシーと共同で、タスクを実行中に人間の固定シーケンスに似た固定シーケンスを発見できる。
EyeRobot 2.0はさらに、グリップ情報を固定相対SE(3)フレームに正準化することで、修正の利点を生かし、学習するアクション分布のサイズをコンパクト化する。
実世界の7つのタスクと6つのシミュレートされたタスクの遠隔操作データを収集し、EyeRobot 2.0と受動ステレオとego+手首カメラのポリシーを比較して1000以上の物理的および1800以上のシミュレートされたロボット試験を行う。
手首カメラの取り外しは、標準的なポリシーではコストがかかる。受動的ステレオのみの場合、現実世界の成功率は52%から27%に低下する。
EyeRobot 2.0はこのギャップを、ステレオのみで埋め、リアルで40%、シミュレートで20%上回る受動的ステレオで埋める。
手首の視界がクリアになったとき(69%対64%)にエゴ+手首のポリシーにマッチし、握った物体が手首のカメラを妨害した場合(48%対22%)、成功率が2倍以上になる。
関連論文リスト
- Beyond the Current Scene: Event-Referential Grasping with Active View Selection [58.13862796903706]
ゼロショットロボット把握システムであるBeyondSCeを紹介する。
システムは、要求されたオブジェクトまたは部分を特定し、それを把握するためにローカライズする。
達成率76%、達成目標77%を達成している。
論文 参考訳(メタデータ) (2026-09-30T09:27:02Z) - Robostral Navigate [138.74472687550374]
Robostral Navigateは、大規模なナビゲーションシステムのための視覚言語モデルである。
モノラルなRGB画像のストリームのみを消費し、現在のカメラビューの次のターゲット位置を指して、ウェイポイントを予測する。
我々は、実世界のデータ収集への依存を減らすため、350kのシミュレートされたシーンに240万のトラジェクトリを生成します。
論文 参考訳(メタデータ) (2026-07-22T23:13:05Z) - Sparse2Act: Learning Action-Aligned Sparse 3D Representations for Cross-Domain Robot Manipulation [52.00134393320209]
Sparse2Actは、スパースポイントクラウドエンコーダの事前学習のための観測・動作アライメントフレームワークである。
マスク付きスパース3Dトークンは、観察と組み合わせたワークスペース運動の周囲のシーン特徴を整理するために訓練される。
LIBERO-10ベンチマークでは,500ステップの微調整を行い,平均86.9%の成功を達成した。
論文 参考訳(メタデータ) (2026-06-10T23:56:01Z) - What Matters When Cotraining Robot Manipulation Policies on Everyday Human Videos? [51.606902362959495]
私たちは、28時間の高品質な三角測量された手ラベルと自然な動きを備えた532人のビデオのデータセットを使用します。
手のポーズの質は移動に影響を与えるが、正確な手であっても、視覚と政策ネットワークがそれぞれの実施に特化しない限り、固有の動きギャップは移動を妨げる。
論文 参考訳(メタデータ) (2026-06-04T18:24:23Z) - ActiveGlasses: Learning Manipulation with Active Vision from Ego-centric Human Demonstration [51.69384671495837]
ActiveGlassesは、エゴ中心の人間のデモからロボット操作を学習するシステムである。
スマートグラスに装着されたステレオカメラは、データ収集とポリシー推論の両方のための唯一の認識装置として機能する。
ゼロ・トランスファーを可能にするために,デモからオブジェクト・トラジェクトリを抽出し,オブジェクト中心のポイント・クラウド・ポリシーを用いて操作と頭部運動を協調的に予測する。
論文 参考訳(メタデータ) (2026-04-09T17:59:08Z) - Eye, Robot: Learning to Look to Act with a BC-RL Perception-Action Loop [41.59038977426419]
EyeRobotは、現実世界のタスクを完了する必要から生じる視線行動を備えたロボットシステムである。
我々は、周囲を自由に回転させて観察し、強化学習を用いて視線ポリシーを訓練できるメカニカルアイボールを開発した。
我々は,ロボットアームを囲む弧の操作を必要とする5つのパノラマワークスペース操作タスクに対して,EyeRobotを評価した。
論文 参考訳(メタデータ) (2025-06-12T17:59:11Z) - Look Closer: Bridging Egocentric and Third-Person Views with
Transformers for Robotic Manipulation [15.632809977544907]
視覚フィードバックから精度に基づく操作タスクを解くことは、従来のロボットシステムに必要なエンジニアリング労力を大幅に削減する可能性がある。
ロボットの手首に装着した3人称カメラと自我中心カメラの両方から視覚フィードバックを受けるロボット操作のための設定を提案する。
また,両カメラの視覚情報を効果的に融合するために,クロスビューアテンション機構を備えたトランスフォーマーを提案する。
論文 参考訳(メタデータ) (2022-01-19T18:39:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。