論文の概要: Adaptive Expert Guidance for Efficient On-Policy Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2610.06019v1
- Date: Mon, 05 Oct 2026 09:18:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-09 19:23:50.82693
- Title: Adaptive Expert Guidance for Efficient On-Policy Reinforcement Learning
- Title(参考訳): 効果的なオンライン強化学習のための適応的エキスパートガイダンス
- Abstract要約: スクラッチから学ぶことは、サンプル非効率であり、準最適専門家の存在を活用できない。
本稿では,学習者と専門家が各トレーニングエピソード内で交互に制御する手法を提案し,専門家のコントロールの共有は,ポリシーと協調して最適化された単一の学習可能なパラメータである。
我々は,学習者およびモデルベースの専門家を用いて,離散的かつ連続的な行動空間にまたがる34のタスクについて評価を行った。
- 参考スコア(独自算出の注目度): 42.448601672927
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: With massively parallel simulation, on-policy Reinforcement Learning methods such as PPO have become standard in many domains. However, learning from scratch is sample-inefficient and fails to exploit the potential existence of a suboptimal expert, such as a heuristic, a model-based controller, or a policy trained on a related task. Such an expert is often available and can guide early training, but its sub-optimality limits final performance. The challenge then becomes balancing expert guidance against learning from rewards. Existing methods set the expert's influence through a blending weight, a schedule, or an evaluation-driven curriculum. Alternatively, they adapt it with additional learned components such as critics over expert actions or auxiliary agents. However, none optimizes it using the same on-policy objective as the policy itself. We propose a method in which the learner and the expert alternate control within each training episode, and the expert's share of control is a single learnable parameter optimized jointly with the policy. The learner benefits from the expert early in training, but its share of control declines as the learner becomes more competent, until eventually vanishing completely. This leaves the learner acting alone and better than the suboptimal expert. We evaluate our method on 34 tasks across two benchmarks, spanning discrete and continuous action spaces, using both learned and model-based experts. Our method improves sample efficiency over guided and unguided baselines while requiring minimal hyperparameter variation. The expert's share decays to zero as the learner improves, vanishing when the expert is no longer useful.
- Abstract(参考訳): 大規模並列シミュレーションにより、PPOのようなオンライン強化学習法は多くの領域で標準となっている。
しかしながら、スクラッチからの学習はサンプリング非効率であり、ヒューリスティックやモデルベースのコントローラ、関連するタスクで訓練されたポリシーといった、最適下限の専門家の潜在的な存在を活用できない。
このような専門家は、しばしば利用でき、早期トレーニングをガイドできるが、その準最適性は最終的なパフォーマンスを制限する。
課題は、報酬から学ぶことに対する専門家のガイダンスのバランスを取ることです。
既存の手法は、ブレンディングウェイト、スケジュール、評価駆動のカリキュラムを通じて専門家の影響を定めている。
あるいは、専門家の行動や補助的なエージェントに対する批判など、さらに学習されたコンポーネントで適応する。
しかし、政策そのものと同じ政治上の目的を使って最適化する人はいない。
本稿では,学習者と専門家が各トレーニングエピソード内で交互に制御する手法を提案し,専門家のコントロールの共有は,ポリシーと協調して最適化された単一の学習可能なパラメータである。
学習者は訓練の早い段階で専門家から恩恵を受けるが、学習者がより有能になるにつれてコントロールのシェアは減少し、最終的には完全に消滅する。
これにより、学習者は、最適でない専門家よりも一人で行動し、良くなる。
我々は,学習者およびモデルベースの専門家を用いて,離散的かつ連続的な行動空間にまたがる34のタスクについて評価を行った。
本手法は,最小限のハイパーパラメータ変動を必要としながら,ガイド・アンガイドベースライン上でのサンプル効率を向上させる。
学習者が向上するにつれて、専門家のシェアはゼロに低下し、専門家がもはや役に立たないときに消滅する。
関連論文リスト
- When Does On-Policy Interaction Help? Representational Tradeoffs in Value-Based Imitation Learning [70.72643569128316]
イミテーション学習(Imitation Learning, IL)は、エージェントがデモンストレーションから専門家の行動を再現するように訓練する。
我々は,学習者が専門家の値関数を表現できる場合,統計的に効率的である,インタラクティブなオンラインILアルゴリズムであるOVIを紹介する。
OVIは、オフラインポリシーベース(BC)、インタラクティブポリシーベース(DAgger)、オフライン価値ベースのILメソッドよりも優れており、学習者ネットワークが専門家よりも表現力に乏しい場合に最大である。
論文 参考訳(メタデータ) (2026-07-31T16:52:47Z) - Inverse Reinforcement Learning with Sub-optimal Experts [56.553106680769474]
与えられた専門家の集合と互換性のある報酬関数のクラスの理論的性質について検討する。
以上の結果から,複数の準最適専門家の存在が,相反する報酬の集合を著しく減少させる可能性が示唆された。
我々は,最適なエージェントの1つに十分近い準最適専門家のパフォーマンスレベルが最適である場合に,最小限の最適化を行う一様サンプリングアルゴリズムを解析する。
論文 参考訳(メタデータ) (2024-01-08T12:39:25Z) - RLIF: Interactive Imitation Learning as Reinforcement Learning [56.997263135104504]
我々は,対話型模倣学習と類似するが,さらに実践的な仮定の下で,非政治強化学習によってパフォーマンスが向上できることを実証する。
提案手法は,ユーザ介入信号を用いた強化学習を報奨として利用する。
このことは、インタラクティブな模倣学習において介入する専門家がほぼ最適であるべきだという仮定を緩和し、アルゴリズムが潜在的に最適でない人間の専門家よりも改善される行動を学ぶことを可能にする。
論文 参考訳(メタデータ) (2023-11-21T21:05:21Z) - How To Guide Your Learner: Imitation Learning with Active Adaptive
Expert Involvement [20.91491585498749]
本稿では,教師と学生のインタラクションモデルに基づく,新しいアクティブな模倣学習フレームワークを提案する。
本稿では,AdapMenによるエラー境界の改善と,軽度条件下での複合的エラーの回避について述べる。
論文 参考訳(メタデータ) (2023-03-03T16:44:33Z) - Multi-trainer Interactive Reinforcement Learning System [7.3072544716528345]
複数のトレーナーを導入することにより,より効果的な対話型強化学習システムを提案する。
特に,トレーナーフィードバックアグリゲーション実験の結果,アグリゲーション法が最も正確であることがわかった。
最後に, MTIRLが評価モデルで訓練した政策が, レビューモデルなしでの政策よりも, 最適ポリシーに近いことを示すために, グリッドワールド実験を行った。
論文 参考訳(メタデータ) (2022-10-14T18:32:59Z) - Reward-Conditioned Policies [100.64167842905069]
模倣学習には、ほぼ最適の専門家データが必要である。
実演なしで指導的学習を通じて効果的な政策を学べるか?
政策探索の原則的手法として,このようなアプローチを導出する方法を示す。
論文 参考訳(メタデータ) (2019-12-31T18:07:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。