論文の概要: Learning to See While Learning to Act: Diffusion Models for Active Perception in Robot Imitation
- arxiv url: http://arxiv.org/abs/2606.23625v1
- Date: Mon, 22 Jun 2026 17:19:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-24 17:40:05.53287
- Title: Learning to See While Learning to Act: Diffusion Models for Active Perception in Robot Imitation
- Title(参考訳): 行動の学習:ロボット模倣における能動的知覚のための拡散モデル
- Authors: Kuancheng Wang, Vaibhav Saxena, Shuo Cheng, Yotto Koga, Danfei Xu,
- Abstract要約: 本研究では,テスト時に積極的に推論された視点の列に対して,行動予測を条件付ける模倣学習手法であるSeries2Actを提案する。
このポリシーは、オフラインのデモからアクションに固定されたカメラのポーズを使って訓練され、行動の仕方を学びながら、どこを見るべきかを暗黙的に学ぶことができる。
- 参考スコア(独自算出の注目度): 13.13689771374717
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Most imitation learning methods assume full observability in table-top settings. In practice, objects are often occluded, requiring robots to both search and act, and learning this coupled behavior from limited demonstrations remains challenging. We propose See2Act, an imitation learning approach that conditions action prediction on a sequence of actively-inferred viewpoints at test time, by coupling action denoising with viewpoint refinement. The policy is trained using camera poses anchored to keyframe actions from offline demonstrations, enabling implicit learning of where to see, while learning how to act. We empirically demonstrate that in Ravens the policy recovers informative viewpoints under severe occlusions, and on RLBench tasks it improves performance by up to 34% over prior methods. In the real world, we collect 50 demonstrations in a digital twin and achieve zero-shot sim-to-real transfer on pick-and-place tasks using depth observations. The policy handles significant occlusions, showing that learned viewpoint reasoning enables robust manipulation under partial observability.
- Abstract(参考訳): ほとんどの模倣学習法は、テーブルトップ設定で完全な可観測性を前提としている。
実際には、オブジェクトはしばしば隠蔽され、ロボットは検索と行動の両方を必要とする。
本研究では,視覚障害者の視点改善に配慮した協調行動によって,テスト時に積極的に推論された視点の列に行動予測を条件付ける模倣学習手法であるSee2Actを提案する。
このポリシーは、オフラインのデモからキーフレームアクションに固定されたカメラのポーズを使用してトレーニングされ、行動の仕方を学びながら、どこで見るべきかを暗黙的に学ぶことができる。
RLBench タスクでは,Ravens では厳密な隠蔽の下で情報的視点を回復し,従来の手法に比べて最大 34% の性能向上を図っている。
実世界では、50個のデモをデジタルツインで収集し、深度観測を用いて、ピック・アンド・プレイス・タスクのゼロショット・シミュレートを実現する。
このポリシーは、学習された視点推論が部分的可観測性の下で堅牢な操作を可能にすることを示す、重要な閉塞を処理している。
関連論文リスト
- Videos are Sample-Efficient Supervisions: Behavior Cloning from Videos via Latent Representations [22.561305437484975]
本稿では,ビデオからの模倣学習を実現するために,遅延表現(BCV-LR)を用いた動画からの行動クローニングを提案する。
BCV-LRは、自己監督タスクを通じて高次元映像入力から行動関連潜伏特徴を抽出する。
我々は、離散制御と連続制御の両方を含む、難易度の高い視覚的タスクのセットについて広範な実験を行う。
論文 参考訳(メタデータ) (2025-12-25T09:11:14Z) - Dexplore: Scalable Neural Control for Dexterous Manipulation from Reference-Scoped Exploration [58.4036440289082]
ハンドオブジェクトモーションキャプチャ(MoCap)は、大規模でコンタクトに富んだデモと、器用なロボットスコープの約束を提供する。
Dexploreは、リポジトリとトラッキングを実行し、MoCapから直接ロボット制御ポリシーを学習する、統一された単一ループ最適化である。
論文 参考訳(メタデータ) (2025-09-11T17:59:07Z) - CBIL: Collective Behavior Imitation Learning for Fish from Real Videos [58.81930297206828]
魚の学習行動を直接ビデオから学習するためのスケーラブルなアプローチCBIL(Collective Behavior Imitation Learning)を提案する。
MVAEは2次元の観察を、模倣学習段階に従うためにコンパクトで表現力のある暗黙の状態に効果的にマッピングする。
CBILは、学習された集合的な動きの前の様々なアニメーションタスクに使用することができる。
論文 参考訳(メタデータ) (2025-03-31T21:15:00Z) - BEAC: Imitating Complex Exploration and Task-oriented Behaviors for Invisible Object Nonprehensile Manipulation [9.453992660558256]
本稿では,BEAC(Belief Exploration-Action Cloning)と呼ばれる新しい模倣学習フレームワークを提案する。
提案手法は, ユーザの認知負荷を低減しつつ, タスク性能, より高いモード, 行動予測精度を達成した。
論文 参考訳(メタデータ) (2025-03-21T02:26:14Z) - Extraneousness-Aware Imitation Learning [25.60384350984274]
Extraneousness-Aware Learning (EIL)は、外部サブシーケンスを用いた第三者によるデモンストレーションから、ビズモタポリシーを学ぶ。
EILは、自己監督された方法で行動条件付き観察埋め込みを学習し、視覚的なデモンストレーション全体にわたってタスク関連観測を検索する。
実験の結果、EILは強いベースラインを上回り、完璧なデモで訓練した人たちと同等のポリシーを達成していることがわかった。
論文 参考訳(メタデータ) (2022-10-04T04:42:26Z) - Self-Supervised Learning of Multi-Object Keypoints for Robotic
Manipulation [8.939008609565368]
本稿では,下流政策学習におけるDense Cor correspondence pretext Taskによる画像キーポイントの学習の有効性を示す。
我々は,多様なロボット操作タスクに対するアプローチを評価し,他の視覚表現学習手法と比較し,その柔軟性と有効性を示した。
論文 参考訳(メタデータ) (2022-05-17T13:15:07Z) - Action-Conditioned Contrastive Policy Pretraining [39.13710045468429]
深層運動のポリシー学習は、ロボット操作や自律運転などの制御タスクにおいて有望な結果を達成する。
トレーニング環境との膨大な数のオンラインインタラクションが必要です。
本研究では、数時間の未計算YouTubeビデオを用いて、タスクを駆動するためのポリシー表現を事前訓練することを目的とする。
論文 参考訳(メタデータ) (2022-04-05T17:58:22Z) - Playful Interactions for Representation Learning [82.59215739257104]
本稿では,下流タスクの視覚的表現を学習するために,遊び心のあるインタラクションを自己指導的に利用することを提案する。
19の多様な環境で2時間の遊び心のあるデータを収集し、自己予測学習を用いて視覚的表現を抽出する。
我々の表現は、標準的な行動クローニングよりも一般化され、必要なデモの半数しか必要とせず、同様の性能を達成できる。
論文 参考訳(メタデータ) (2021-07-19T17:54:48Z) - Visual Adversarial Imitation Learning using Variational Models [60.69745540036375]
逆関数仕様は、深い強化学習を通しての学習行動にとって大きな障害であり続けている。
望ましい行動の視覚的なデモンストレーションは、エージェントを教えるためのより簡単で自然な方法を示すことが多い。
変動モデルに基づく対向的模倣学習アルゴリズムを開発した。
論文 参考訳(メタデータ) (2021-07-16T00:15:18Z) - Visual Imitation Made Easy [102.36509665008732]
本稿では,ロボットへのデータ転送を容易にしながら,データ収集プロセスを単純化する,模倣のための代替インターフェースを提案する。
我々は、データ収集装置やロボットのエンドエフェクターとして、市販のリーチ・グラブラー補助具を使用する。
我々は,非包括的プッシュと包括的積み重ねという2つの課題について実験的に評価した。
論文 参考訳(メタデータ) (2020-08-11T17:58:50Z) - State-Only Imitation Learning for Dexterous Manipulation [63.03621861920732]
本稿では,国家のみの模倣学習について考察する。
我々は、逆ダイナミクスモデルをトレーニングし、状態のみのデモンストレーションのアクションを予測するためにそれを使用します。
我々の手法は状態-作用アプローチと同等に動作し、RL単独よりもかなり優れています。
論文 参考訳(メタデータ) (2020-04-07T17:57:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。