Fugu-MT 論文翻訳(概要): PI-QT-Opt: Predictive Information Improves Multi-Task Robotic Reinforcement Learning at Scale

論文の概要: PI-QT-Opt: Predictive Information Improves Multi-Task Robotic Reinforcement Learning at Scale

arxiv url: http://arxiv.org/abs/2210.08217v1
Date: Sat, 15 Oct 2022 07:30:31 GMT
ステータス: 翻訳完了
システム内更新日: 2022-10-18 18:08:15.171448
Title: PI-QT-Opt: Predictive Information Improves Multi-Task Robotic Reinforcement Learning at Scale
Title（参考訳）: pi-qt-opt: 予測情報によるマルチタスクロボット強化学習の大規模化
Authors: Kuang-Huei Lee, Ted Xiao, Adrian Li, Paul Wohlhart, Ian Fischer, Yao Lu
Abstract要約: 予測情報QT-Optは、予測情報の表現を学習し、シミュレーションおよび実世界における最大297個の視覚に基づくロボット操作タスクを解決する。予測情報のモデリングはトレーニング作業の成功率を大幅に向上させ,未知の新規タスクへのゼロショット転送を改善することを実証する。
参考スコア（独自算出の注目度）: 14.444439310266873
License: http://creativecommons.org/licenses/by/4.0/
Abstract: The predictive information, the mutual information between the past and future, has been shown to be a useful representation learning auxiliary loss for training reinforcement learning agents, as the ability to model what will happen next is critical to success on many control tasks. While existing studies are largely restricted to training specialist agents on single-task settings in simulation, in this work, we study modeling the predictive information for robotic agents and its importance for general-purpose agents that are trained to master a large repertoire of diverse skills from large amounts of data. Specifically, we introduce Predictive Information QT-Opt (PI-QT-Opt), a QT-Opt agent augmented with an auxiliary loss that learns representations of the predictive information to solve up to 297 vision-based robot manipulation tasks in simulation and the real world with a single set of parameters. We demonstrate that modeling the predictive information significantly improves success rates on the training tasks and leads to better zero-shot transfer to unseen novel tasks. Finally, we evaluate PI-QT-Opt on real robots, achieving substantial and consistent improvement over QT-Opt in multiple experimental settings of varying environments, skills, and multi-task configurations.
Abstract（参考訳）: 過去と未来の間の相互情報である予測情報は、トレーニング強化学習エージェントの補助的損失として有用であることが示されており、次に何が起こるかをモデル化する能力は多くの制御タスクの成功に不可欠である。そこで本研究では,ロボットエージェントの予測情報をモデル化し,大量のデータから多種多様なスキルのレパートリーを習得する訓練を行う汎用エージェントの重要性について検討する。具体的には、予測情報QT-Opt(PI-QT-Opt)を補助的損失で強化したQT-Optエージェントを導入し、予測情報の表現を学習し、シミュレーションにおける最大297個の視覚ベースのロボット操作タスクを1組のパラメータで解決する。予測情報のモデル化はトレーニング作業の成功率を大幅に向上させ,未知の新規タスクへのゼロショット転送を改善することを実証する。最後に,pi-qt-optを実ロボット上で評価し,様々な環境,スキル,マルチタスク構成の複数の実験環境において,qt-optに対して有意かつ一貫した改善を実現する。

関連論文リスト

Is Diversity All You Need for Scalable Robotic Manipulation? [50.747150672933316]
ロボット学習におけるデータ多様性の役割について,従来の「より多様な方がよい」という直観に固執する3つの重要な次元(タスク),実施形態(ロボットの使用方法),専門家(専門家)を用いて検討する。タスクの多様性は、タスクごとのデモンストレーション量よりも重要であり、多様な事前学習タスクから新しい下流シナリオへの移行に有効であることを示す。本稿では,速度のあいまいさを緩和する分散デバイアス法を提案する。GO-1-Proは,2.5倍の事前学習データを用いて,15%の性能向上を実現している。
論文参考訳（メタデータ） (2025-07-08T17:52:44Z)
Few-Shot Vision-Language Action-Incremental Policy Learning [55.07841353049953]
トランスフォーマーに基づくロボット操作手法は,多視点空間表現と言語命令を用いてロボットの運動軌跡を学習する。既存のメソッドには、いくつかのデモだけで新しいタスクを継続的に学習する能力がない。我々はこれらの問題に対処するタスク-prOmpt graPh evolutIon poliCy (TOPIC) を開発した。
論文参考訳（メタデータ） (2025-04-22T01:30:47Z)
Reinforcement Learning with Action Sequence for Data-Efficient Robot Learning [62.3886343725955]
本稿では,行動列上のQ値を出力する批判ネットワークを学習する新しいRLアルゴリズムを提案する。提案アルゴリズムは,現在および将来の一連の行動の実行結果を学習するために値関数を明示的に訓練することにより,ノイズのある軌道から有用な値関数を学習することができる。
論文参考訳（メタデータ） (2024-11-19T01:23:52Z)
Robot Fine-Tuning Made Easy: Pre-Training Rewards and Policies for Autonomous Real-World Reinforcement Learning [58.3994826169858]
ロボット強化学習のためのリセット不要な微調整システムであるRoboFuMEを紹介する。我々の洞察は、オフラインの強化学習技術を利用して、事前訓練されたポリシーの効率的なオンライン微調整を確保することである。提案手法では,既存のロボットデータセットからのデータを組み込んで,目標タスクを3時間以内の自律現実体験で改善することができる。
論文参考訳（メタデータ） (2023-10-23T17:50:08Z)
Analysis of the Reasoning with Redundant Information Provided Ability of Large Language Models [0.0]
大きな言語モデル(LLM)は、さまざまな自然言語処理タスクにまたがる印象的な機能を示している。このギャップに対処するため,Reasoning with Redundant Information Provided (RRIP) と呼ばれる新しいQAタスクが導入された。本研究は,LlaMA2-13B-chatとGPT-3.5 (generative pre-trained transformer 3.5)の2つのLLMを評価し,従来のQAタスクとRRIPタスクとの対比を行った。
論文参考訳（メタデータ） (2023-10-06T06:20:06Z)
Pre-Training for Robots: Offline RL Enables Learning New Tasks from a Handful of Trials [97.95400776235736]
新しいタスクを効果的に学習しようとするオフラインRLに基づくフレームワークを提案する。既存のロボットデータセットの事前トレーニングと、新しいタスクの迅速な微調整と、最大10のデモを組み合わせたものだ。我々の知る限り、PTRは本物のWidowXロボットで新しいドメインで新しいタスクを学習する最初のRL手法である。
論文参考訳（メタデータ） (2022-10-11T06:30:53Z)
Hierarchical Few-Shot Imitation with Skill Transition Models [66.81252581083199]
FIST(Few-shot Imitation with Skill Transition Models)は、オフラインデータからスキルを抽出し、それらを利用して見えないタスクに一般化するアルゴリズムである。本稿では,FISTが新たなタスクに一般化し,ナビゲーション実験において従来のベースラインを大幅に上回っていることを示す。
論文参考訳（メタデータ） (2021-07-19T15:56:01Z)
Pre-Trained Models: Past, Present and Future [126.21572378910746]
大規模事前訓練モデル(PTM)は近年大きな成功を収め、人工知能(AI)分野におけるマイルストーンとなった。知識を巨大なパラメータに格納し、特定のタスクを微調整することで、巨大なパラメータに暗黙的にエンコードされた豊富な知識は、さまざまな下流タスクの恩恵を受けることができる。 AIコミュニティが、モデルをスクラッチから学習するのではなく、下流タスクのバックボーンとしてPTMを採用することは、今、コンセンサスになっている。
論文参考訳（メタデータ） (2021-06-14T02:40:32Z)
Parrot: Data-Driven Behavioral Priors for Reinforcement Learning [79.32403825036792]
そこで本研究では,実験で得られた複雑なインプット・アウトプット関係を事前に学習する手法を提案する。 RLエージェントが新規な動作を試す能力を阻害することなく、この学習が新しいタスクを迅速に学習するのにどのように役立つかを示す。
論文参考訳（メタデータ） (2020-11-19T18:47:40Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。