論文の概要: Efficient Hypergradient Descent for Inverse Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2608.11052v1
- Date: Tue, 11 Aug 2026 15:22:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:46.102936
- Title: Efficient Hypergradient Descent for Inverse Reinforcement Learning
- Title(参考訳): 逆強化学習のための高次老化
- Authors: Nikita Sevriukov, Anna Barabanova, Uliana Gagarina, Karina Ivanova, Sofiia Kasaeva, Ilya Levin, Marina Sheshukova,
- Abstract要約: 逆強化学習(IRL)は、専門家によるデモンストレーションで観察された振る舞いを再現する報酬関数を復元することを目的としている。
我々は、IRLを二段階最適化問題として定式化し、内部レベルが学習された報酬の下でのポリシー最適化に対応し、外部レベルが誘導されたポリシーと専門家データとの差を測定する。
この課題に対処するために、内的最適において、内的目的のヘシアンがポリシーのフィッシャー情報行列に比例し、構造化されたフィッシャーに基づく過次性をもたらすことを示す。
- 参考スコア(独自算出の注目度): 1.2005928414453964
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Inverse reinforcement learning (IRL) aims to recover a reward function under which the resulting policy reproduces the behavior observed in expert demonstrations. A natural approach is to formulate IRL as a bilevel optimization problem, in which the inner level corresponds to policy optimization under the learned reward and the outer level measures the discrepancy between the induced policy and expert data. However, this formulation is computationally challenging in practice because the outer update requires a hypergradient involving an inverse-Hessian-vector product for the inner objective. We address this challenge by showing that, at the inner optimum, the Hessian of the inner objective is proportional to the Fisher information matrix of the policy, yielding a structured Fisher-based hypergradient closely related to Natural Hypergradient Descent. To address the resulting scalability bottleneck associated with large Fisher matrices, we approximate the required inverse-Fisher-vector product using a streaming spectral sketch, avoiding explicit construction of the Fisher matrix. We evaluate our approach against a first-order stochastic bilevel baseline across discrete- and continuous-control environments. The results demonstrate competitive policy performance and strong reward-ranking quality, while Fisher sketching reduces curvature-storage complexity and can improve computational efficiency relative to an explicit Fisher solver.
- Abstract(参考訳): 逆強化学習(IRL)は、専門家によるデモンストレーションで観察された振る舞いを再現する報酬関数を復元することを目的としている。
自然なアプローチは、内部レベルが学習された報酬の下でのポリシー最適化に対応し、外部レベルが誘導されたポリシーと専門家データとの差を測定する、二段階最適化問題としてIRLを定式化することである。
しかし、この定式化は実際は計算的に困難である、なぜなら外的更新は内的目的のために逆ヘッセンベクトル積を含む過次性を必要とするからである。
この課題に対処するために、内的目的のヘシアンは、内的目的のヘシアンがポリシーのフィッシャー情報行列に比例し、自然的過次Descentと密接に関連する構造的フィッシャーベースの過次性を与えることを示す。
大規模なフィッシャー行列に関連するスケーラビリティのボトルネックを解決するために,ストリーミングスペクトルスケッチを用いて必要な逆フィッシャーベクトル積を近似し,フィッシャー行列の明示的な構成を避ける。
離散および連続制御環境における一階確率的二レベルベースラインに対するアプローチを評価する。
また,フィッシャースケッチは曲率・記憶の複雑さを低減し,明示的なフィッシャー解法と比較して計算効率を向上させることができる。
関連論文リスト
- LambdaPO: A Lambda Style Policy Optimization for Reasoning Language Models [34.349722314481824]
グループ相対政策最適化は、明示的な価値批判を先導する効果で評価されている。
群平均のようなモノリシックな統計ベースラインへの依存は、軌道空間の相対トポロジーを1つのスカラーに分解する。
我々は、この情報理論のボトルネックに対処する新しいフレームワークLambda Policy Optimization(LambdaPO)を紹介します。
論文 参考訳(メタデータ) (2026-05-19T06:10:24Z) - Rank-1 Approximation of Inverse Fisher for Natural Policy Gradients in Deep Reinforcement Learning [17.531852538779372]
逆FIMに対するランク1近似は、ポリシー勾配よりも早く収束することを示す。
提案手法を多様な環境上でベンチマークし,標準的なアクタ批判的・信頼領域ベースラインよりも優れた性能を示す。
論文 参考訳(メタデータ) (2026-01-26T16:02:18Z) - Inverse Reinforcement Learning Using Just Classification and a Few Regressions [38.71913609455455]
逆強化学習は、基礎となる報酬を明らかにすることによって観察された振る舞いを説明することを目的としている。
集団最大化解は, 行動方針を含む線形不動点方程式によって特徴づけられることを示す。
最適解法,一般オラクルアルゴリズム,有限サンプル誤差境界,およびMaxEnt IRLに対する競合的あるいは優れた性能を示す実験結果の正確な評価を行う。
論文 参考訳(メタデータ) (2025-09-25T13:53:43Z) - Stable Inverse Reinforcement Learning: Policies from Control Lyapunov Landscapes [4.229902091180109]
実験データからリアプノフ関数を学習するための新しい安定度認証IRL手法を提案する。
関連する制御ポリシーのクローズドフォーム表現を利用することで、CLFの空間を効率的に探索することができる。
我々は,CLFが提供する最適性に関する理論的解析を行い,シミュレーションデータと実世界データの両方を用いて我々のアプローチを評価する。
論文 参考訳(メタデータ) (2024-05-14T16:40:45Z) - When Demonstrations Meet Generative World Models: A Maximum Likelihood
Framework for Offline Inverse Reinforcement Learning [62.00672284480755]
本稿では, 専門家エージェントから, 一定の有限個の実演において観測された動作を過小評価する報酬と環境力学の構造を復元することを目的とする。
タスクを実行するための正確な専門知識モデルは、臨床的意思決定や自律運転のような安全に敏感な応用に応用できる。
論文 参考訳(メタデータ) (2023-02-15T04:14:20Z) - Variance-Aware Off-Policy Evaluation with Linear Function Approximation [85.75516599931632]
線形関数近似を用いた強化学習における非政治的評価問題について検討する。
本稿では,値関数の分散を推定し,フィルタQ-Iterationにおけるベルマン残差を再重み付けするアルゴリズムVA-OPEを提案する。
論文 参考訳(メタデータ) (2021-06-22T17:58:46Z) - Risk-Sensitive Deep RL: Variance-Constrained Actor-Critic Provably Finds
Globally Optimal Policy [95.98698822755227]
本研究は,リスクに敏感な深層強化学習を,分散リスク基準による平均報酬条件下で研究する試みである。
本稿では,ポリシー,ラグランジュ乗算器,フェンシェル双対変数を反復的かつ効率的に更新するアクタ批判アルゴリズムを提案する。
論文 参考訳(メタデータ) (2020-12-28T05:02:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。