論文の概要: Mirror Learning
- arxiv url: http://arxiv.org/abs/2607.28737v1
- Date: Thu, 30 Jul 2026 18:00:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.430528
- Title: Mirror Learning
- Title(参考訳): ミラーラーニング
- Abstract要約: 第三者観察のレンズによる模倣学習について検討する。
本稿では、受動的観察から実行可能なポリシーを取得することを目的としたミラーラーニングの枠組みを提案する。
- 参考スコア(独自算出の注目度): 12.913079669397433
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: We investigate imitation learning through the lens of third-person observation and propose a framework for mirror learning: acquiring actionable policies from passive observation. While behavior cloning (BC) excels under dense, well-aligned first-person data, it fundamentally fails to leverage the rich observational signals arising from third-person demonstrations that humans and animals routinely exploit. We introduce a method that composes (i) a learned perspective transformation that places learners in demonstrators' shoes using a fine-tuned video diffusion model and (ii) an inverse dynamics model that infers action trajectories in the learners' control space. This enables the synthesis of mirror data, pseudo first-person expert data generated from third-person observations of demonstrator behavior. Empirically, we show that mirror data alone can train effective policies, and that augmenting first-person BC training with mirror data further improves downstream policy performance. Our results suggest that modern generative world models implicitly encode sufficient structure to enable a scalable and safe alternative to teleoperation-heavy data collection.
- Abstract(参考訳): 本研究では、第三者観察のレンズによる模倣学習について検討し、受動的観察から実行可能なポリシーを取得するミラー学習の枠組みを提案する。
行動クローニング(BC)は、密集した、きちんと整列した個人データの下では優れているが、人間や動物が日常的に利用する第三者によるデモンストレーションから生じる豊かな観察信号を活用することは、基本的に失敗する。
構成する手法を紹介する。
一 微調整ビデオ拡散モデルを用いて、デモ参加者の靴に学習者を配置する学習視点変換
(II)学習者の制御空間における行動軌跡を推論する逆ダイナミクスモデル。
これにより、実演者の行動の第三者観察から生成された擬似一人称専門家データであるミラーデータの合成が可能となる。
ミラーデータだけで効果的なポリシーを訓練できることを実証的に示し、ミラーデータを用いた一人称BCトレーニングを増強することで、下流ポリシーのパフォーマンスがさらに向上することを示した。
この結果から,現代の生成的世界モデルは,遠隔操作に重きを置くデータ収集に代わる,スケーラブルで安全な代替手段を実現するのに十分な構造を暗黙的にエンコードしていることが示唆された。
関連論文リスト
- Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation [63.54377402784965]
視覚言語ナビゲーション(VLN)のためのリライト駆動型AugMentation(RAM)パラダイムを提案する。
書き換え機構から, シミュレータフリー, 省力両面において, 新たな観察・指導ペアを得ることができた。
離散環境(R2R,REVERIE,R4Rデータセット)と連続環境(R2R-CEデータセット)の両方における実験は,本手法の優れた性能と優れた一般化能力を示している。
論文 参考訳(メタデータ) (2025-03-23T13:18:17Z) - DynaMo: In-Domain Dynamics Pretraining for Visuo-Motor Control [18.737628473949048]
模倣学習は、複雑なビジュモータポリシーを訓練するための強力なツールであることが証明されている。
現在の手法では、高次元の視覚的観察を扱うために数百から数千の専門家によるデモンストレーションが必要となることが多い。
視覚表現を学習するための新しいドメイン内自己教師型DynaMoを提案する。
論文 参考訳(メタデータ) (2024-09-18T17:59:43Z) - A Dual Approach to Imitation Learning from Observations with Offline Datasets [19.856363985916644]
報酬関数の設計が困難な環境では、エージェントを学習するためのタスク仕様の効果的な代替手段である。
専門家の行動を必要とせずに任意の準最適データを利用してポリシーを模倣するアルゴリズムであるDILOを導出する。
論文 参考訳(メタデータ) (2024-06-13T04:39:42Z) - Zero-shot Imitation Policy via Search in Demonstration Dataset [0.16817021284806563]
行動クローンは、ポリシーを学ぶためにデモのデータセットを使用する。
本稿では,事前学習した基礎モデルの潜在空間を用いて,実演データセットをインデックス化することを提案する。
提案手法は,マインクラフト環境において,有意義なデモンストレーションを効果的に再現し,エージェントの人間的行動を示す。
論文 参考訳(メタデータ) (2024-01-29T18:38:29Z) - Learning Robust Representations via Bidirectional Transition for Visual Reinforcement Learning [49.23256535551141]
本稿では, 環境遷移を前方と後方の両方で双方向に予測し, 信頼性のある表現を抽出するBidirectional Transition (BiT) モデルを提案する。
本モデルでは,DeepMind Controlスイートの2つの設定に対して,競合一般化性能とサンプル効率を示す。
論文 参考訳(メタデータ) (2023-12-04T14:19:36Z) - ALP: Action-Aware Embodied Learning for Perception [60.64801970249279]
認知のための行動認識型身体学習(ALP)について紹介する。
ALPは、強化学習ポリシーと逆ダイナミクス予測目標を最適化することにより、行動情報を表現学習に組み込む。
ALPは、複数の下流認識タスクにおいて、既存のベースラインよりも優れていることを示す。
論文 参考訳(メタデータ) (2023-06-16T21:51:04Z) - Learning Sentinel-2 reflectance dynamics for data-driven assimilation
and forecasting [11.0735899248545]
我々は、クープマン作用素理論から着想を得たディープラーニングモデルを訓練し、教師なしの方法で長期反射率ダイナミクスをモデル化する。
この訓練されたモデルは、微分可能であり、直接的にデータ同化の先駆けとして使用できることを示す。
論文 参考訳(メタデータ) (2023-05-05T10:04:03Z) - MoDem: Accelerating Visual Model-Based Reinforcement Learning with
Demonstrations [36.44386146801296]
サンプルの低さは、現実世界のアプリケーションに深層強化学習(RL)アルゴリズムをデプロイする上で、依然として最大の課題である。
モデルベースRLのサンプル効率を劇的に向上させることができるのは,ごく少数のデモンストレーションのみである。
本研究では,3つの複雑なビジュオモータ制御領域を実験的に検討し,スパース報酬タスクの完了に150%-250%成功していることを確認した。
論文 参考訳(メタデータ) (2022-12-12T04:28:50Z) - SSMTL++: Revisiting Self-Supervised Multi-Task Learning for Video
Anomaly Detection [108.57862846523858]
自己教師型マルチタスク学習フレームワークを再考し、元の手法にいくつかのアップデートを提案する。
マルチヘッド・セルフアテンション・モジュールを導入することで3次元畳み込みバックボーンを近代化する。
モデルをさらに改良するために,セグメントマップの予測などの自己指導型学習タスクについて検討した。
論文 参考訳(メタデータ) (2022-07-16T19:25:41Z) - Improving Contrastive Learning with Model Augmentation [123.05700988581806]
このシーケンシャルレコメンデーションは,ユーザ行動における次の項目を予測することを目的としている。
シーケンスにおけるデータの分散性やノイズの問題から,新たな自己教師付き学習(SSL)パラダイムが提案され,性能が向上した。
論文 参考訳(メタデータ) (2022-03-25T06:12:58Z) - S^3-Rec: Self-Supervised Learning for Sequential Recommendation with
Mutual Information Maximization [104.87483578308526]
本稿では,シーケンスレコメンデーションのための自己改善学習のためのモデルS3-Recを提案する。
そこで本稿では,属性,項目,サブシーケンス,シーケンス間の相関関係を学習するために,4つの補助的自己教師対象を考案する。
6つの実世界のデータセットで実施された大規模な実験は、既存の最先端手法よりも提案手法が優れていることを示す。
論文 参考訳(メタデータ) (2020-08-18T11:44:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。