論文の概要: Provable Benefits of Regularization: Fast Rates for Adversarial Imitation Learning
- arxiv url: http://arxiv.org/abs/2609.35698v3
- Date: Fri, 02 Oct 2026 06:35:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:29.933381
- Title: Provable Benefits of Regularization: Fast Rates for Adversarial Imitation Learning
- Title(参考訳): 正則化の確率的メリット:―対人的模倣学習の高速化―
- Abstract要約: 本研究では,専門家と学習者の行動を識別する対人報酬に対する政策を最適化することにより,エージェントが専門家のデモンストレーションを模倣することを学習する対人模倣学習(AIL)について研究する。
我々のアルゴリズムであるDually Regularized AILは、KLポリシーの正規化と、専門家と学習者による重み付けされた2次報酬報酬を組み合わせる。
- 参考スコア(独自算出の注目度): 55.04472833034441
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We study adversarial imitation learning (AIL), in which an agent learns to imitate expert demonstrations by optimizing a policy against an adversarial reward that distinguishes expert and learner behavior. Historically, reward regularization and entropy-based policy regularization are key components of empirically successful methods such as GAIL and LS-IQ, yet their finite-sample benefits remain underexplored. We establish fast rates for jointly regularized AIL in finite-horizon Markov decision processes with general function approximation. Our model-free algorithm, Dually Regularized AIL, combines KL policy regularization with a quadratic reward penalty weighted by expert and learner occupancies. With K online episodes and N expert trajectories, we prove a $\widetilde{O}\left(\frac{1}{K}+\frac{1}{N}\right)$ bound on the regularized imitation gap for fixed regularization parameters. Our analysis combines an online mirror descent construction for general convex reward classes to control estimation error from finite expert data and stochastic learner feedback, with a sharp analysis of optimistic KL-regularized policy learning. To the best of our knowledge, Dually Regularized AIL is the first algorithm to simultaneously achieve $\widetilde{O}\left(\frac{1}ε\right)$ sample complexity in both expert demonstrations and online interactions for this regularized AIL objective, even with stochastic experts. These results provide a rigorous characterization of the complementary statistical benefits of reward and policy regularization in AIL.
- Abstract(参考訳): 本研究では,専門家と学習者の行動を識別する対人報酬に対する政策を最適化することにより,エージェントが専門家のデモンストレーションを模倣することを学習する対人模倣学習(AIL)について研究する。
歴史的に、報酬正則化とエントロピーベースのポリシー正則化は、GAILやLS-IQのような経験的に成功した手法の鍵となる要素であるが、その有限サンプルの利点は未定のままである。
一般関数近似を用いた有限水平マルコフ決定過程における共同正規化 AIL の高速速度を確立する。
我々のモデルフリーアルゴリズムであるDual Regularized AILは、KLポリシーの正規化と、専門家と学習者による重み付けされた2次報酬報酬を組み合わせている。
K のオンラインエピソードと N の専門家軌道を用いて、固定正則化パラメータの正規化模倣ギャップ上の$\widetilde{O}\left(\frac{1}{K}+\frac{1}{N}\right)$を証明した。
本分析では,一般凸報酬クラスに対するオンラインミラー降下構造を用いて,有限専門家データと確率的学習者フィードバックから推定誤差を制御し,楽観的なKL正規化政策学習を鋭く分析する。
我々の知る限り、Dually Regularized AILは、確率的専門家であっても、専門家のデモンストレーションとこの正規化されたAILの目的に対するオンラインインタラクションの両方において、$\widetilde{O}\left(\frac{1}ε\right)$サンプル複雑さを同時に達成した最初のアルゴリズムです。
これらの結果は、AILにおける報酬と政策正則化の相補的な統計的利益の厳密な評価を与える。
関連論文リスト
- Post-Training at the Edge of Detectability: A Game-Theoretic Approach to Fine-Tuning [58.088509347353465]
強化学習(Reinforcement Learning, RL)は、言語モデルトレーニングにおいて広く使われている。
我々は,このトレードオフに明確な統計的解釈を与えるゲーム理論の枠組みを提案する。
論文 参考訳(メタデータ) (2026-07-29T00:19:09Z) - $f$-Divergence Regularized RLHF: Two Tales of Sampling and Unified Analyses [19.590316589389577]
Reinforcement Learning from Human Feedbackは、大規模言語モデルの訓練後において基礎となるテクニックである。
近年の実験的研究は、RLHFの正則化剤として代替の発散の研究を始めている。
本研究は、一般の$f$-divergence正規化目的を持つオンラインRLHFの包括的な理論的枠組みを開発する。
論文 参考訳(メタデータ) (2026-05-07T21:48:26Z) - Matching Multiple Experts: On the Exploitability of Multi-Agent Imitation Learning [51.77462571479799]
マルチエージェント模倣学習(MA-IL)は、マルチエージェント対話ドメインにおけるインタラクションのエキスパートによる実証から最適なポリシーを学ぶことを目的としている。
学習したポリシのパフォーマンスに関する保証は存在するが、オフラインMA-ILでは、学習した警察がナッシュ均衡からどこまで離れているかの特徴が欠落している。
論文 参考訳(メタデータ) (2026-02-24T15:38:11Z) - Statistical analysis of Inverse Entropy-regularized Reinforcement Learning [15.054399128586232]
逆強化学習は、状態-作用対の軌跡を通して観察される専門家の行動を説明する報酬関数を推論することを目的としている。
多くの報酬関数は同じ最適ポリシーを導き出すことができ、逆問題に悪影響を及ぼす。
Inverse Entropy-regularized Reinforcement Learningのための統計フレームワークを開発する。
論文 参考訳(メタデータ) (2025-12-07T18:26:19Z) - Online Policy Learning via a Self-Normalized Maximal Inequality [4.906641452356241]
マルティンゲール経験過程における自己正規化最大不等式を開発した。
逐次更新と標準複雑性とマージン条件で組み合わせると、推定器は高速収束率が得られることを示す。
論文 参考訳(メタデータ) (2025-10-17T09:53:42Z) - Near-Optimal Second-Order Guarantees for Model-Based Adversarial Imitation Learning [35.41154497688405]
エージェントがオフラインの専門家によるデモンストレーションから学び、報酬と対話するオンライン対人模倣学習(AIL)について研究する。
モデルベースAILアルゴリズム(MBAIL)を提案する。
MB-AILは,オンラインインタラクション(対数的要因まで)において,限られた専門家によるデモンストレーションにより,最小限のサンプル複雑性が得られることを示す。
論文 参考訳(メタデータ) (2025-10-10T15:51:14Z) - Sharp Analysis for KL-Regularized Contextual Bandits and RLHF [52.519416266840814]
Reverse-Kullback-Leibler (KL) 正則化は、強化学習におけるポリシー最適化を強化する主要な手法である。
単純な2段階混合サンプリング戦略は, カバー係数に付加的な依存しか持たずに, サンプルの複雑さを達成できることが示される。
この結果は,より効率的なRLHFアルゴリズムの設計に光を当て,KL正規化とRLHFにおけるデータカバレッジの役割を包括的に理解するものである。
論文 参考訳(メタデータ) (2024-11-07T11:22:46Z) - On Computation and Generalization of Generative Adversarial Imitation
Learning [134.17122587138897]
GAIL(Generative Adversarial Learning)は、シーケンシャルな意思決定ポリシーを学習するための強力で実践的なアプローチである。
本稿ではGAILの理論的性質について考察する。
論文 参考訳(メタデータ) (2020-01-09T00:40:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。