論文の概要: Adapting to Changes in Agent Behavior via Finite-Depth Policy Sensitivity
- arxiv url: http://arxiv.org/abs/2610.07475v1
- Date: Mon, 05 Oct 2026 22:40:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.695698
- Title: Adapting to Changes in Agent Behavior via Finite-Depth Policy Sensitivity
- Title(参考訳): 有限深度政策感度によるエージェントの挙動変化への適応
- Abstract要約: ポリシー感度は、行動パラメータで局所的に最適なポリシーがどのように変化するかを、一階述語で予測する。
我々は、ポリシーヘッセンと混合微分を近似することにより、この感度を推定するための有限深度フレームワークを開発する。
有限深度伝播によって省略される導関数の寄与と、近似された導関数に対するトランケーション・エラー境界の導出を特徴付ける。
- 参考スコア(独自算出の注目度): 7.66464237417627
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Adapting a reinforcement learning policy to changes in another agent's behavior typically requires a large amount of new interaction data. Policy sensitivity provides a first-order prediction of how a locally optimal policy changes with a behavioral parameter, but its computation requires second-order derivatives whose effects propagate across future interactions. We develop a finite-depth framework to estimate this sensitivity by approximating the policy Hessian and mixed derivative using information from a reference environment. The method features an adjustable propagation depth which determines where derivative propagation along the trajectory is truncated. We characterize the derivative contributions omitted by finite-depth propagation and derive truncation-error bounds for the approximated derivatives and resulting policy sensitivity. The bounds are nonincreasing with propagation depth and vanish at full-horizon propagation. Using a belief-driven pursuit-evasion game as a validation scenario, the proposed method generally achieves lower derivative-estimation errors as the propagation depth increases and outperforms the baseline methods in both estimation accuracy and policy adaptation. The sensitivity-based initialization improves zero-shot return over direct transfer, and also shows advantages for the subsequent fine-tuning in the target environment.
- Abstract(参考訳): 強化学習ポリシーを他のエージェントの行動の変化に適用するには、通常、大量の新しいインタラクションデータが必要である。
政策感度は、局所最適政策が行動パラメータとどのように変化するかの1次予測を提供するが、その計算には、将来の相互作用を伝播する2次微分が必要である。
我々は、参照環境の情報を用いて、ポリシーヘッセンと混合微分を近似することにより、この感度を推定する有限深度フレームワークを開発する。
本発明の方法は、軌道に沿った導関数伝播の場所を決定する調整可能な伝播深さを特徴とする。
有限深度伝播によって省略される導関数の寄与と、近似された導関数に対するトランケーション・エラー境界の導出と、その結果の政策感度を特徴付ける。
境界は伝播深度とともに増加せず、全水平伝播時に消滅する。
仮説駆動型追従回避ゲームを検証シナリオとして,提案手法は一般に,伝播深度が増大するにつれて導関数推定誤差を低くし,推定精度とポリシー適応性の両方においてベースライン法より優れる。
感度に基づく初期化は、直接転送によるゼロショットリターンを改善するとともに、ターゲット環境におけるその後の微調整の利点を示す。
関連論文リスト
- Schrödinger--Föllmer Actor--Critic: Diffusion Policy Improvement with Finite-Sample Analysis [16.115903198836694]
拡散ポリシは、マルチモーダルなアクション分布を表すが、アドバンテージ重み付けされた更新では、結果のターゲット分布からサンプルする方法を規定していない。
我々は,KL(Kulback--Leibler)のオフライン-オンライン強化学習(RL)手法であるSchrdinger-Fllmer Actor-Critic (SFAC)を提案する。
適切な条件下では、評価評価、神経ドリフト回帰、有限サンプルSNIS、拡散離散化、およびアクターエラーが期待される平均的政策最適性に与える影響を分離する有限サンプル境界を導出する。
論文 参考訳(メタデータ) (2026-09-27T05:27:34Z) - Transfer Learning Through Conditional Quantile Matching [3.86972243789112]
我々は、異種ソースドメインを利用した回帰学習フレームワークを導入し、データスカースターゲットドメインにおける予測性能を改善する。
提案手法は,各ソース領域に対して個別に条件生成モデルを学習し,条件量子マッチングにより対象ドメインに対する応答を校正する。
論文 参考訳(メタデータ) (2026-02-02T17:19:55Z) - Differential Information Distribution: A Bayesian Perspective on Direct Preference Optimization [35.335072390336855]
対象ポリシーに参照ポリシーを更新するために必要な差分情報を学習する際の選好最適化の目標について検討する。
まず、DPOの対数比の報酬は、ターゲットポリシーに参照ポリシーを更新するために必要な差分情報をエンコードする場合に一意に正当化される。
第2に、DPOにおけるトレーニングのダイナミクスが、ログライクな状態の変化や政策探索の変化など、どの程度の頻度で観察されているかについて論じる。
論文 参考訳(メタデータ) (2025-05-29T17:59:50Z) - Unifying Perplexing Behaviors in Modified BP Attributions through Alignment Perspective [61.5509267439999]
GBP, RectGrad, LRP, DTD などの手法の統一理論フレームワークを提案する。
活性化ニューロンの重みを結合して入力アライメントを実現することを実証した。
このアライメントにより、可視化品質が向上し、重量ランダム化に対する感度が低下する。
論文 参考訳(メタデータ) (2025-03-14T07:58:26Z) - Data Augmentation through Expert-guided Symmetry Detection to Improve
Performance in Offline Reinforcement Learning [0.0]
マルコフ決定過程(MDP)の動的モデルのオフライン推定は非自明な作業である。
近年の研究では、密度推定法に依存する専門家誘導パイプラインが、決定論的環境において、この構造を効果的に検出できることが示されている。
学習したMDPを解き、実際の環境に最適化されたポリシーを適用すると、前者の結果が性能改善につながることを示す。
論文 参考訳(メタデータ) (2021-12-18T14:32:32Z) - Which Invariance Should We Transfer? A Causal Minimax Learning Approach [18.71316951734806]
本稿では、因果的観点からの包括的ミニマックス分析について述べる。
最小の最悪のリスクを持つサブセットを探索する効率的なアルゴリズムを提案する。
本手法の有効性と有効性は, 合成データとアルツハイマー病の診断で実証された。
論文 参考訳(メタデータ) (2021-07-05T09:07:29Z) - Variance-Aware Off-Policy Evaluation with Linear Function Approximation [85.75516599931632]
線形関数近似を用いた強化学習における非政治的評価問題について検討する。
本稿では,値関数の分散を推定し,フィルタQ-Iterationにおけるベルマン残差を再重み付けするアルゴリズムVA-OPEを提案する。
論文 参考訳(メタデータ) (2021-06-22T17:58:46Z) - Risk-Sensitive Deep RL: Variance-Constrained Actor-Critic Provably Finds
Globally Optimal Policy [95.98698822755227]
本研究は,リスクに敏感な深層強化学習を,分散リスク基準による平均報酬条件下で研究する試みである。
本稿では,ポリシー,ラグランジュ乗算器,フェンシェル双対変数を反復的かつ効率的に更新するアクタ批判アルゴリズムを提案する。
論文 参考訳(メタデータ) (2020-12-28T05:02:26Z) - A Random Matrix Theory Approach to Damping in Deep Learning [0.7614628596146599]
深層学習における適応的勾配法と非適応的勾配法との違いは推定ノイズの増加に起因すると推測する。
線形縮退推定にインスパイアされた2次オプティマイザのためのランダム行列理論に基づくダンピング学習器を開発した。
論文 参考訳(メタデータ) (2020-11-15T18:19:42Z) - Iterative Amortized Policy Optimization [147.63129234446197]
政策ネットワークは、継続的制御のための深層強化学習(RL)アルゴリズムの中心的な特徴である。
変分推論の観点からは、ポリシーネットワークは、ポリシー分布を直接ではなく、ネットワークパラメータを最適化する、テキスト化最適化の一形態である。
我々は,反復的アモート化ポリシ最適化により,ベンチマーク連続制御タスクの直接アモート化よりも性能が向上することが実証された。
論文 参考訳(メタデータ) (2020-10-20T23:25:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。