論文の概要: GuidedAttention: Interpretable and Correctable Visual Attention for OOD-Robust Robot Manipulation via Imitation Learning
- arxiv url: http://arxiv.org/abs/2607.21049v1
- Date: Thu, 23 Jul 2026 08:33:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.33498
- Title: GuidedAttention: Interpretable and Correctable Visual Attention for OOD-Robust Robot Manipulation via Imitation Learning
- Title(参考訳): GuidedAttention:Imitation LearningによるOOD-Robustロボットマニピュレーションの解釈と修正可能な視覚的注意
- Abstract要約: 本稿では,ビジュモータ模倣学習フレームワークである GuidedAttention を提案する。
解釈可能で修正可能な視覚的注意を明示的な中間表現として導入する。
シミュレーションと実世界における実験により, GuidedAttention はロボット操作性能を継続的に改善することが示された。
- 参考スコア(独自算出の注目度): 2.9697920367520827
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: End-to-end visuomotor policies provide little opportunity for humans to understand or correct the policy's visual attention. We propose GuidedAttention, a visuomotor imitation learning framework that introduces interpretable and correctable visual attention as an explicit intermediate representation. Task-relevant attention keypoints are predicted from camera images and condition a diffusion-based action policy. Users can inspect and optionally correct selected keypoints once at rollout initialization, after which the corrected attention is automatically propagated throughout execution by a tracking module. Experiments in simulation and the real world demonstrate that GuidedAttention consistently improves robot manipulation performance, particularly under positional and appearance out-of-distribution (OOD) conditions.
- Abstract(参考訳): エンドツーエンドのビズモータポリシーは、人間がポリシーの視覚的注意を理解または修正する機会をほとんど与えない。
本稿では,解釈可能かつ修正可能な視覚的注意を明示的な中間表現として導入する,ビジュモータ模倣学習フレームワークである GuidedAttention を提案する。
カメラ画像からタスク関連注目キーポイントを予測し、拡散に基づくアクションポリシーを条件とする。
ユーザは、ロールアウト初期化時に選択されたキーポイントを検査し、任意に修正することができる。
シミュレーションと実世界における実験により、特に位置分布と外分布(OOD)条件下では、 GuidedAttention はロボット操作性能を一貫して改善することが示された。
関連論文リスト
- Action with Visual Primitives [36.230909065494345]
VLA(Vision-Language-Action)モデルは、汎用的なロボット操作のための有望なパラダイムとして登場した。
AVP(Action with Visual Primitives)は、このビジュアルプリミティブ中心のインターフェースを実装したエンドツーエンドアーキテクチャである。
AVP は pi_0.5 よりも 27.61% 向上し,近年の手法より優れていることを示す。
論文 参考訳(メタデータ) (2026-05-21T08:52:47Z) - Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models [15.486973209713954]
GTA-VLA(Guide, Think, Act)はインタラクティブなビジョンランゲージ・アクション・フレームワークである。
ユーザがロボットポリシーを明示的な視覚的手がかりでガイドできるようにすることで、空間的に操作可能な具体的推論を可能にする。
論文 参考訳(メタデータ) (2026-05-13T14:58:29Z) - I-Perceive: A Foundation Model for Active Perception with Language Instructions [41.67607728608853]
I-Perceiveは,自然言語命令に基づく能動的知覚の基礎モデルである。
I-Perceiveは、画像ベースのシーンコンテキストに基づいて、オープンな言語命令に従うカメラビューを予測する。
実験により、I-Perceiveは、生成したカメラビューの予測精度とインストラクションの両方において、最先端のVLMを大幅に上回っていることが示された。
論文 参考訳(メタデータ) (2026-02-28T11:38:56Z) - When would Vision-Proprioception Policies Fail in Robotic Manipulation? [24.653339846980376]
原始受容情報は、リアルタイムなロボット状態を提供することによって正確なサーボ制御に不可欠である。
近年の研究では、視覚保護政策の一般化に関する矛盾した観察が報告されている。
本稿では, 位相依存性の最適化を適応的に調節するGAPアルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-02-12T15:00:48Z) - ReViP: Reducing False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance [50.05984919728878]
本稿では、視覚的接地と摂動下での堅牢性を高めるために、視覚-受容器リバランスを備えた新しいVLAフレームワークReViPを提案する。
具体的には、タスクステージオブザーバとして外部VLMを使用して、視覚的な観察からリアルタイムなタスク中心の視覚的手がかりを抽出する。
本稿では,オブジェクトドロップのような制御された設定を持つLIBERO上に構築された最初のFalse-Completion Benchmark Suiteを提案する。
論文 参考訳(メタデータ) (2026-01-23T11:31:07Z) - Attentive Feature Aggregation or: How Policies Learn to Stop Worrying about Robustness and Attend to Task-Relevant Visual Cues [69.24378760740171]
本稿では,乱れたシーンにおけるロバスト性の欠如に対する解決策として,ビジュモータ・ポリシー・プールについて考察する。
AFA(Attentive Feature Aggregation)は、タスク関連視覚的キューに自然に出席することを学ぶ軽量でトレーニング可能なプール機構である。
以上の結果から,視覚情報を無視することは,堅牢で汎用的な視覚運動ポリシーの展開に向けた重要なステップであることが示唆された。
論文 参考訳(メタデータ) (2025-11-13T19:31:05Z) - Exploring Conditions for Diffusion models in Robotic Control [70.27711404291573]
我々は,ロボット制御のためのタスク適応型視覚表現を得るために,事前学習したテキスト・画像拡散モデルを活用することを検討する。
テキスト条件をナビゲート的に適用すると、制御タスクにおいて最小あるいは負の利得が得られることがわかった。
本稿では,制御環境に適応する学習可能なタスクプロンプトと,細粒度でフレーム固有の細部をキャプチャする視覚プロンプトを提案する。
論文 参考訳(メタデータ) (2025-10-17T10:24:14Z) - Sight Over Site: Perception-Aware Reinforcement Learning for Efficient Robotic Inspection [57.37596278863949]
本研究では,認識・認識の観点からの検査を再考する。
本稿では,目標視認性を主目的とするエンドツーエンド強化学習フレームワークを提案する。
提案手法は,既存の古典的および学習的ナビゲーション手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2025-09-22T15:14:02Z) - Visual Prompting for Robotic Manipulation with Annotation-Guided Pick-and-Place Using ACT [3.281128493853064]
本稿では,アノテーションを用いた視覚的プロンプトを利用した知覚行動パイプラインを提案する。
我々は、ロボットアームが人間のデモンストレーションからチャンクされたアクションシーケンスを予測することができる模倣学習アルゴリズムとして、Action Chunking with Transformers (ACT)を採用している。
本システムは,小売環境における把握行動の成功率と視覚的分析に基づいて評価し,把握精度と適応性の向上を実証した。
論文 参考訳(メタデータ) (2025-08-12T08:45:09Z) - Cycle-Correspondence Loss: Learning Dense View-Invariant Visual Features from Unlabeled and Unordered RGB Images [8.789674502390378]
本稿では、ビュー不変な高密度記述子学習のためのCCL(Cycle-Cor correspondingence Loss)を紹介する。
鍵となるアイデアは、新しい画像に対する予測を使って、有効なピクセル対応を自律的に検出することである。
評価の結果、他の自己教師付きRGB専用手法よりも優れており、教師付き手法の性能にアプローチしていることがわかった。
論文 参考訳(メタデータ) (2024-06-18T09:44:56Z) - MOKA: Open-World Robotic Manipulation through Mark-Based Visual Prompting [97.52388851329667]
我々は,自由形式の言語命令で指定されたロボット操作タスクを解決するために,マーキングオープンワールドキーポイントアフォード(Moka)を導入する。
我々のアプローチの中心は、VLMの観測画像と物理世界におけるロボットの行動に関する予測を橋渡しする、コンパクトな点ベースの可測性表現である。
ツールの使用,変形可能な身体操作,オブジェクト再構成など,さまざまなテーブルトップ操作タスクにおけるMokaの性能評価と解析を行った。
論文 参考訳(メタデータ) (2024-03-05T18:08:45Z) - What Makes Pre-Trained Visual Representations Successful for Robust
Manipulation? [57.92924256181857]
照明やシーンテクスチャの微妙な変化の下では,操作や制御作業のために設計された視覚表現が必ずしも一般化されないことがわかった。
創発的セグメンテーション能力は,ViTモデルにおける分布外一般化の強い予測因子であることがわかった。
論文 参考訳(メタデータ) (2023-11-03T18:09:08Z) - Self-Supervision by Prediction for Object Discovery in Videos [62.87145010885044]
本稿では,この予測タスクを自己監督として利用し,画像シーケンス表現のための新しいオブジェクト中心モデルを構築する。
私たちのフレームワークは、手動アノテーションや事前トレーニングされたネットワークを使わずにトレーニングできます。
最初の実験では、提案されたパイプラインがオブジェクト中心のビデオ予測への有望なステップであることを確認した。
論文 参考訳(メタデータ) (2021-03-09T19:14:33Z) - Goal-Conditioned End-to-End Visuomotor Control for Versatile Skill
Primitives [89.34229413345541]
本稿では,制御器とその条件をエンドツーエンドに学習することで,落とし穴を回避する条件付け手法を提案する。
本モデルでは,ロボットの動きのダイナミックな画像表現に基づいて,複雑な動作シーケンスを予測する。
代表的MPCおよびILベースラインに対するタスク成功の大幅な改善を報告した。
論文 参考訳(メタデータ) (2020-03-19T15:04:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。