論文の概要: Bayesian Experimental Design via Score Matching
- arxiv url: http://arxiv.org/abs/2607.08335v1
- Date: Thu, 09 Jul 2026 10:21:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.501136
- Title: Bayesian Experimental Design via Score Matching
- Title(参考訳): スコアマッチングによるベイズ実験設計
- Abstract要約: 予測情報ゲインの二重誘引性は政策学習から分離可能であることを示す。
これにより、鍵乗法コストが加算コストとなり、ポリシートレーニング自体の計算負担が軽減される。
本実験では,確率評価において乗算コストを発生させることなく,複数の競争政策を訓練する。
- 参考スコア(独自算出の注目度): 15.998867609597545
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Policy-based approaches to Bayesian experimental design (BED) allow the learning of deep policy networks that adaptively make intelligent design decisions based on previously collected data. However, the training of such policies is often held back by a fundamental challenge: the double intractability of the expected information gain (EIG). This necessitates expensive or complex approximations that restrict the effort one can invest in optimising the policy itself. To address this, we show that the double intractability of the EIG can be isolated from the policy learning by first solving a score matching problem that is independent of the policy used, then using the learned score approximation to train the policy in a singly intractable manner. This turns the key multiplicative cost into an additive one and reduces the computational burden on the policy training itself, making it far cheaper to train the policy multiple times when needed, e.g. for architecture search, hyperparameter tuning, or avoiding local optima. In our experiments we train multiple competitive policies without inducing a multiplicative cost in likelihood evaluations, which can increase performance by allowing us to select the best policy even without performing hyperparameter or architecture searches.
- Abstract(参考訳): ベイズの実験設計(BED)に対するポリシーベースのアプローチは、以前に収集されたデータに基づいてインテリジェントな設計決定を適応的に行うディープポリシーネットワークの学習を可能にする。
しかし、このような政策の訓練は、期待される情報ゲイン(EIG)の二重誘引可能性(英語版)という根本的な課題によってしばしば後退する。
これは、ポリシー自体の最適化に投資できる労力を制限する、高価なあるいは複雑な近似を必要とする。
そこで本研究では、EIGの二重抽出可能性について、まず、使用するポリシーに依存しないスコアマッチング問題を解き、次に学習したスコア近似を用いて、個別に抽出可能な方法でポリシーを訓練することにより、ポリシー学習から分離できることを示す。
これにより、重要な乗算コストが加算コストに変換され、ポリシートレーニング自体の計算負担が軽減され、アーキテクチャ探索やハイパーパラメータチューニング、あるいはローカルオプティマの回避など、必要な時にポリシーを複数回トレーニングするコストが大幅に削減される。
提案実験では,ハイパーパラメータやアーキテクチャ検索を行なわずとも,最適なポリシを選択することで,性能を向上させることができるため,乗算コストを発生させることなく,複数の競合ポリシを訓練する。
関連論文リスト
- Intrinsic Reward Policy Optimization for Sparse-Reward Environments [1.9336815376402718]
固有の報酬は、探索のための原則化されたガイダンスを提供することができる。
本稿では、複数の本質的な報酬を利用してポリシーを直接最適化する政策最適化フレームワークを提案する。
提案アルゴリズムは,代用ポリシー勾配を用いて,本態性報酬ポリシー最適化(IRPO)によって実現されている。
論文 参考訳(メタデータ) (2026-01-29T08:25:14Z) - Behaviour Policy Optimization: Provably Lower Variance Return Estimates for Off-Policy Reinforcement Learning [52.97053840476386]
我々は、よく設計された行動ポリシーを用いて、分散リターン推定を確実に低くするために、政治外のデータを収集できることを示します。
我々は、この重要な洞察を、政策評価と改善の両方がインターリーブされるオンライン強化学習環境に拡張する。
論文 参考訳(メタデータ) (2025-11-13T23:06:40Z) - EXPO: Stable Reinforcement Learning with Expressive Policies [74.30151915786233]
2つのパラメータ化ポリシーで値の最大化を実現するために,サンプル効率のよいオンライン強化学習アルゴリズムを提案する。
提案手法は, 従来手法に比べて試料効率を最大2~3倍向上させる。
論文 参考訳(メタデータ) (2025-07-10T17:57:46Z) - Quantile-Optimal Policy Learning under Unmeasured Confounding [55.72891849926314]
ここでは,報酬分布が (0, 1) で最大$alpha$-quantileを持つポリシーを見つけることを目標とする量子最適政策学習について検討する。
このような問題は、(i)報酬分布の関数としての量子目標の非線形性、(ii)未観測の共起問題、(iii)オフラインデータセットのカバー不足という3つの大きな課題に悩まされている。
論文 参考訳(メタデータ) (2025-06-08T13:37:38Z) - TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint [11.347808936693152]
モデルベースの強化学習アルゴリズムは、モデルベースの計画と学習された価値/政治を組み合わせる。
バリューラーニングに標準のSACスタイルのポリシーイテレーションに依存する既存の手法は、しばしばエンハンピスタントな価値過大評価をもたらす。
本稿では,ODAクエリを削減し,価値学習を改善する政策正規化項を提案する。
論文 参考訳(メタデータ) (2025-02-05T19:08:42Z) - $Δ\text{-}{\rm OPE}$: Off-Policy Estimation with Pairs of Policies [13.528097424046823]
Inverse Propensity Scoring estimator に基づいた$Deltatext-rm OPE$メソッドを提案する。
シミュレーション,オフライン,オンライン実験により,本手法は評価タスクと学習タスクの両方のパフォーマンスを著しく向上させることが示された。
論文 参考訳(メタデータ) (2024-05-16T12:04:55Z) - IOB: Integrating Optimization Transfer and Behavior Transfer for
Multi-Policy Reuse [50.90781542323258]
強化学習(RL)エージェントは、ソースポリシーからの知識を関連する目標タスクに転送することができる。
従来手法では,階層的なポリシやソースポリシの値関数の見積など,新たなコンポーネントが導入されていた。
本稿では,余分なコンポーネントを訓練せずにソースポリシーを選択する新しい転送RL法を提案する。
論文 参考訳(メタデータ) (2023-08-14T09:22:35Z) - CUP: Critic-Guided Policy Reuse [37.12379523150601]
Critic-gUided Policy reuse (CUP)は、任意の余分なコンポーネントのトレーニングを回避し、ソースポリシーを効率的に再利用するポリシー再利用アルゴリズムである。
CUPは、現在の目標ポリシーよりも最大の1段階の改善を持つソースポリシーを選択し、ガイダンスポリシーを形成する。
実験により、CUPは効率的な転送を実現し、ベースラインアルゴリズムを大幅に上回ることを示す。
論文 参考訳(メタデータ) (2022-10-15T00:53:03Z) - Efficient Deep Reinforcement Learning via Adaptive Policy Transfer [50.51637231309424]
強化学習(RL)を促進するための政策伝達フレームワーク(PTF)の提案
我々のフレームワークは、いつ、いつ、どのソースポリシーがターゲットポリシーの再利用に最適なのか、いつそれを終了するかを学習する。
実験結果から,学習過程を著しく加速し,最先端の政策伝達手法を超越していることが判明した。
論文 参考訳(メタデータ) (2020-02-19T07:30:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。