論文の概要: When Does On-Policy Interaction Help? Representational Tradeoffs in Value-Based Imitation Learning
- arxiv url: http://arxiv.org/abs/2607.29617v1
- Date: Fri, 31 Jul 2026 16:52:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.817442
- Title: When Does On-Policy Interaction Help? Representational Tradeoffs in Value-Based Imitation Learning
- Title(参考訳): オンラインインタラクションはいつ役に立つか : 価値に基づく模倣学習における表現的トレードオフ
- Abstract要約: イミテーション学習(Imitation Learning, IL)は、エージェントがデモンストレーションから専門家の行動を再現するように訓練する。
我々は,学習者が専門家の値関数を表現できる場合,統計的に効率的である,インタラクティブなオンラインILアルゴリズムであるOVIを紹介する。
OVIは、オフラインポリシーベース(BC)、インタラクティブポリシーベース(DAgger)、オフライン価値ベースのILメソッドよりも優れており、学習者ネットワークが専門家よりも表現力に乏しい場合に最大である。
- 参考スコア(独自算出の注目度): 70.72643569128316
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Imitation learning (IL)---training an agent to replicate expert behavior from demonstrations---underpins applications from robotics to language model training. Standard approaches such as Behavior Cloning (BC) are known to suffer from compounding errors and performance plateaus, particularly when the learner cannot perfectly represent the expert's policy (as is typical, e.g., in distillation). Two interventions are widely understood empirically to improve performance: querying the expert interactively along the learner's own trajectories, and using value function estimation en route to generating a policy rather than directly fitting the expert's full action distribution. We investigate the nature of these improvements and their potentially surprising interplay. Our main finding is that expert interaction relaxes the representational demands on the learner: one only needs a model capable of realizing the expert's value function, bypassing the (often stricter) requirement of realizing the expert's policy itself. Concretely, we introduce OVI, an interactive on-policy IL algorithm that is statistically efficient whenever the learner can represent the expert's value function and computationally efficient given access to a linear maximization oracle. We complement this with a negative result showing that interaction is necessary. Namely, without stronger assumptions beyond expert-value realizability alone, any offline IL algorithm must scale with the complexity of the expert policy class. Our findings bear out empirically. OVI outperforms offline policy-based (BC), interactive policy-based (DAgger), and offline value-based IL methods, with the largest gains when the learner network is substantially less expressive than the expert's.
- Abstract(参考訳): イミテーションラーニング(IL) - ロボット工学から言語モデルトレーニングへの応用を基盤として、エージェントを訓練して、デモンストレーションから専門家の行動を再現する。
行動クローニング(BC)のような標準的なアプローチは、特に学習者が専門家の方針を完全に表現できない場合(例えば蒸留において)、複雑なエラーやパフォーマンスの台帳に悩まされることが知られている。
2つの介入は、学習者自身の軌道に沿って対話的に専門家に問い合わせることと、専門家の完全な行動分布を直接適合させるのではなく、方針を生成するための経路における値関数の推定である。
これらの改善の性質と、その潜在的に驚くべき相互作用について検討する。
我々の主な発見は、専門家の相互作用が学習者の表現的要求を緩和することである。
具体的には、学習者が専門家の値関数を表現でき、線形最大化オラクルへのアクセスを計算的に効率的に行えるような、統計的に効率的な対話型オンラインILアルゴリズムであるOVIを紹介する。
相互作用が不可欠であることを示す否定的な結果でこれを補完する。
すなわち、専門家価値実現可能性以外の強い仮定がなければ、オフラインのILアルゴリズムはエキスパートポリシークラスの複雑さとともにスケールしなければならない。
私たちの発見は経験的だ。
OVIは、オフラインポリシーベース(BC)、インタラクティブポリシーベース(DAgger)、オフライン価値ベースのILメソッドよりも優れており、学習者ネットワークが専門家よりも表現力に乏しい場合に最大である。
関連論文リスト
- AIPO: Learning to Reason from Active Interaction [54.10819421625103]
AIPOは、ポリシーモデルが、推論ボトルネックに遭遇するときに、3つの機能的協調エージェントを積極的に相談することを可能にする。
AIPOは推論性能を継続的に改善し、異なるポリシーモデルとRLVRアルゴリズムをまたいで堅牢に一般化し、ポリシーモデルの推論能力境界を効果的に拡張する。
論文 参考訳(メタデータ) (2026-05-08T19:06:55Z) - Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization [35.515246456075054]
逆強化学習(IRL)は、専門家のデモンストレーションデータに最も合う報酬関数と対応するポリシーを学習する。
現在のIRL設定では、学習者は専門家から隔離され、専門家のデモンストレーションのみを受動的に観察することができる。
本稿では,学習者が専門家の報酬関数と専門家と対話する方針を学習することを目的とした対話型IRL(IIRL)について検討する。
論文 参考訳(メタデータ) (2026-05-01T05:01:10Z) - Going Beyond Expert Performance via Deep Implicit Imitation Reinforcement Learning [3.691573844585973]
本研究では、深層強化学習と観測専用データセットからの暗黙的模倣学習を組み合わせた暗黙的模倣強化学習フレームワークを提案する。
我々の主要なアルゴリズムであるDeep Implicit Q-Network (DIIQN)は、オンライン探索を通じて専門家の行動を再構築するアクション推論機構を採用している。
我々はさらに、専門家とエージェントが異なるアクションセットを持つシナリオに取り組むために、不均一なアクションDIIQN(HA-DIIQN)アルゴリズムでフレームワークを拡張した。
論文 参考訳(メタデータ) (2025-11-05T16:33:39Z) - Efficient Imitation under Misspecification [17.706710359787056]
誤特定下での模倣学習の問題点を考察する。
本稿では,計算効率のよい局所探索手順のみを実行する逆強化学習アルゴリズムを提案する。
我々は,不特定条件下では,学習者が実際に行うことができる良い政策によって到達可能な状態を含むために,局所的な探索を行う一連の状態を拡張することが有益であることを示す。
論文 参考訳(メタデータ) (2025-03-17T13:35:55Z) - From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning [62.54484062185869]
本稿では,エージェントの強化学習プロセスの最適化にステップワイド報酬を利用するStepAgentを紹介する。
エージェント反射とポリシー調整を容易にする暗黙の逆・逆の強化学習手法を提案する。
論文 参考訳(メタデータ) (2024-11-06T10:35:11Z) - Is Inverse Reinforcement Learning Harder than Standard Reinforcement
Learning? A Theoretical Perspective [55.36819597141271]
逆強化学習(IRL: Inverse Reinforcement Learning)は、インテリジェントシステム開発において重要な役割を担う。
本稿では、サンプルとランタイムを用いて、バニラのオフラインおよびオンライン設定における効率的なIRLの最初のラインを提供する。
応用として、学習した報酬は適切な保証で他のターゲットMDPに転送可能であることを示す。
論文 参考訳(メタデータ) (2023-11-29T00:09:01Z) - RLIF: Interactive Imitation Learning as Reinforcement Learning [56.997263135104504]
我々は,対話型模倣学習と類似するが,さらに実践的な仮定の下で,非政治強化学習によってパフォーマンスが向上できることを実証する。
提案手法は,ユーザ介入信号を用いた強化学習を報奨として利用する。
このことは、インタラクティブな模倣学習において介入する専門家がほぼ最適であるべきだという仮定を緩和し、アルゴリズムが潜在的に最適でない人間の専門家よりも改善される行動を学ぶことを可能にする。
論文 参考訳(メタデータ) (2023-11-21T21:05:21Z) - Data-Driven Inverse Reinforcement Learning for Expert-Learner Zero-Sum
Games [30.720112378448285]
逆強化学習をエキスパート-ラーナーインタラクションとして定式化する。
学習者エージェントに対して、専門家や対象エージェントの最適性能意図が不明である。
我々は、専門家や学習者エージェントのダイナミクスの知識を必要としない、政治以外のIRLアルゴリズムを開発した。
論文 参考訳(メタデータ) (2023-01-05T10:35:08Z) - Data augmentation for efficient learning from parametric experts [88.33380893179697]
我々は、学生の政策の行動を伝えるために、専門家のオンラインまたはオフラインのクエリを使用する、ポリシーのクローン設定と呼ばれるものに焦点を当てる。
提案手法は,APC(Adgressed Policy Cloning)を用いて,サンプル軌道周辺領域のフィードバック感度を誘導する。
我々は,高次自由度制御問題に対して,専門家から学生政策への行動の高度にデータ効率のよい移行を実現する。
論文 参考訳(メタデータ) (2022-05-23T16:37:16Z) - IQ-Learn: Inverse soft-Q Learning for Imitation [95.06031307730245]
少数の専門家データからの模倣学習は、複雑な力学を持つ高次元環境では困難である。
行動クローニングは、実装の単純さと安定した収束性のために広く使われている単純な方法である。
本稿では,1つのQ-関数を学習することで,対向学習を回避する動的適応型ILを提案する。
論文 参考訳(メタデータ) (2021-06-23T03:43:10Z) - Learning without Knowing: Unobserved Context in Continuous Transfer
Reinforcement Learning [16.814772057210366]
連続状態と行動空間における伝達強化学習問題を、観測不能な文脈情報の下で検討する。
我々のゴールは、コンテキスト認識の専門家データを使用して、学習者に最適なコンテキスト認識ポリシーを学習することである。
論文 参考訳(メタデータ) (2021-06-07T17:49:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。