論文の概要: Nonparametric Bayesian Inverse Reinforcement Learning with Data-Parallel Gibbs Sampling
- arxiv url: http://arxiv.org/abs/2607.09886v1
- Date: Fri, 10 Jul 2026 18:20:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.237444
- Title: Nonparametric Bayesian Inverse Reinforcement Learning with Data-Parallel Gibbs Sampling
- Title(参考訳): データパラレルギブスサンプリングによる非パラメトリックベイズ逆強化学習
- Authors: Sai Anirudh Katupilla, Shreeya Dasa Lakshminath,
- Abstract要約: 逆強化学習(Inverse Reinforcement Learning)は、専門家によるデモンストレーションから報酬関数を回復するが、標準では、すべてのデモンストレーションは一人のエキスパートから来ていると仮定する。
報酬関数の前にディリクレプロセスを用いて非パラメトリックベイズ逆強化学習を実装した。
我々は,10×10のObjectWorldグリッドに対して,2と3のグラウンドトルース報酬型を用いて評価を行った。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Inverse Reinforcement Learning recovers reward functions from expert demonstrations, but standard formulations assume that all demonstrations come from a single expert. When demonstrations are pooled from multiple experts with distinct preferences, parametric methods recover an averaged reward that fits no individual expert well. We implement Nonparametric Bayesian Inverse Reinforcement Learning with a Dirichlet Process prior over reward functions, allowing the number of latent reward types to be inferred jointly with the rewards themselves. Inference uses a collapsed Gibbs sampler combining a Chinese Restaurant Process update for cluster assignments with a Metropolis-Hastings update for reward weights, and soft value iteration as the inner planning routine. We evaluate on a 10x10 ObjectWorld grid with two and three ground-truth reward types. The serial sampler recovers K=2 with Adjusted Rand Index of 1.000, substantially outperforming a Maximum Entropy IRL baseline (ARI=0.000). Extension to K=3 shows that the sampler correctly identifies the number of clusters in all runs; assignment ARI of 0.48-0.58 reflects behavioral overlap between expert types that persists across grid instantiations, revealing that reliable K=3 evaluation on ObjectWorld requires controlled object placement rather than random seeding. We further parallelize the sampler across CPU cores using Ray on HPC hardware, achieving a peak speedup of 4.79x at 8 workers, and characterize a throughput-versus-accuracy tradeoff arising from the consensus merge heuristic used during state aggregation. Code and a containerized environment are available at https://github.com/dasashreeya/np_bayes_irl.
- Abstract(参考訳): 逆強化学習(Inverse Reinforcement Learning)は、専門家によるデモンストレーションから報酬関数を回復するが、標準的な定式化では、すべてのデモンストレーションは一人のエキスパートから来ていると仮定する。
異なる好みを持つ複数の専門家からデモがプールされると、パラメトリックメソッドは、個々の専門家に適さない平均的な報酬を回収する。
非パラメトリックベイズ逆強化学習(Nonparametric Bayesian Inverse Reinforcement Learning)をディリクレ法(Dirichlet Process)で実装し、報酬関数に先立って報酬型を推論する。
推論では、クラスタ割り当てのための中国レストランプロセスのアップデートと、報酬重み付けのためのメトロポリス・ハスティングのアップデートと、内部計画ルーチンとしてのソフトバリューイテレーションを組み合わせた、崩壊したギブスサンプルを使用する。
我々は,10×10のObjectWorldグリッドに対して,2と3のグラウンドトルース報酬型を用いて評価を行った。
シリアルサンプリング器は、調整ランダム指数1.000でK=2を回復し、最大エントロピーIRLベースライン(ARI=0.000)を大幅に上回る。
0.48-0.58の代入 ARI は、グリッドインスタンス化全体にわたって持続するエキスパートタイプ間の振る舞いの重なりを反映しており、ObjectWorldでの信頼性の高いK=3評価はランダムなシードではなく、制御されたオブジェクト配置を必要とすることを示している。
さらに、HPCハードウェア上でRayを用いてCPUコア間でサンプルを並列化し、8人の作業者に対して4.79倍のピーク高速化を実現し、状態アグリゲーション時に使用されるコンセンサスマージヒューリスティックによるスループット逆精度トレードオフを特徴付ける。
コードとコンテナ環境はhttps://github.com/dasashreeya/np_bayes_irlで公開されている。
関連論文リスト
- Optimizing Visual Generative Models via Distribution-wise Rewards [57.46109819595665]
本稿では,実世界のデータ分布との整合性を確保するために,分布ワイド報酬を用いた生成モデルを微調整する新しいフレームワークを提案する。
提案手法は,SiTでは5.77,EDM2では3.74から3.52まで,様々なベースモデルでFID-50Kを大幅に改善する。
論文 参考訳(メタデータ) (2026-07-02T15:08:56Z) - Representation-Aware Advantage Estimation: Your Reward Model Provides More Than A Scalar Output [31.83856936482982]
本稿では,RM隠れ状態を利用した表現認識の利点推定手法を提案する。
AlpacaEval 2.0ではArena-Hard-v0.1で最大6.3、AlpacaEval 2.0では8.27、MT-Benchでは0.22である。
論文 参考訳(メタデータ) (2026-06-09T07:57:50Z) - Synthesize and Reward -- Reinforcement Learning for Multi-Step Tool Use in Live Environments [12.645050883623982]
本稿では,3つのコントリビューションを持つPROVE(Programmatic Rewards On Verified Environments)を提案する。
20のステートフルMPPサーバからなるライブラリは343のツールを公開し、セッションスコープによるステートアイソレーションによるライブ実行RLトレーニングを可能にする。
状態マシンデータ合成パイプラインは、ライブサンプリングされたサーバ状態にグラウンドされたマルチターンツールコールトラジェクトリを生成し、実際に存在するクエリ参照エンティティを生成する。
BFCLのMulti-Turn、tau2-bench、T-Evalでは、PROVEは最大+10.2、+6.8、+6.5ポイントの改善をもたらす。
論文 参考訳(メタデータ) (2026-06-02T16:52:31Z) - MARBLE: Multi-Aspect Reward Balance for Diffusion RL [71.6241143519038]
強化学習は、拡散モデルと人間の嗜好を整合させる主要なアプローチとなっている。
既存のプラクティスは、報酬ごとに1つのスペシャリストモデルをトレーニングすることで、複数の報酬を処理します。
我々は,各報酬に対する独立な優位推定器を維持する勾配空間最適化フレームワークMARBLEを提案する。
論文 参考訳(メタデータ) (2026-05-07T16:20:42Z) - VeRPO: Verifiable Dense Reward Policy Optimization for Code Generation [43.206705536310245]
textbfVeRPO (textbf Verifiable Dtextbfense textbfReward textbfPolicy textbfOptimization) は,テキストイトラバストと高密度報酬を合成し,検証された実行フィードバックに完全に根ざしたコード生成のための新しいRLフレームワークである。
VeRPOは結果駆動のベースラインとRMベースのベースラインを一貫して上回り、許容しない時間コスト(0.02%)とゼロのパス@1で+8.83%のゲインを達成している。
論文 参考訳(メタデータ) (2026-01-07T02:29:49Z) - Distributional Reinforcement Learning with Dual Expectile-Quantile Regression [51.87411935256015]
分布RLに対する量子レグレッションアプローチは、任意の戻り分布を柔軟かつ効果的に学習する方法を提供する。
我々は,分布推定が消失することを示し,推定分布が急速に平均に崩壊することを実証的に観察した。
我々は,$L$の学習効率に感化され,効率のよい学習方法として,返却分布の期待値と量子値を共同で学習することを提案する。
論文 参考訳(メタデータ) (2023-05-26T12:30:05Z) - Flag Aggregator: Scalable Distributed Training under Failures and
Augmented Losses using Convex Optimization [14.732408788010313]
MLアプリケーションはますます、複雑なディープラーニングモデルと大規模なデータセットに依存している。
計算とデータをスケールするために、これらのモデルはノードのクラスタ内で分散的にトレーニングされ、それらの更新はモデルに適用される前に集約される。
これらの設定にデータ拡張を加えることで、堅牢で効率的なアグリゲーションシステムが必要である。
この手法は,最先端のビザンツ系レジリエントアグリゲータのロバスト性を大幅に向上させることを示す。
論文 参考訳(メタデータ) (2023-02-12T06:38:30Z) - Generalized Differentiable RANSAC [95.95627475224231]
$nabla$-RANSACは、ランダム化された堅牢な推定パイプライン全体を学ぶことができる、微分可能なRANSACである。
$nabla$-RANSACは、精度という点では最先端のシステムよりも優れているが、精度は低い。
論文 参考訳(メタデータ) (2022-12-26T15:13:13Z) - Provably Efficient Offline Reinforcement Learning with Trajectory-Wise
Reward [66.81579829897392]
我々はPessimistic vAlue iteRaTionとrEward Decomposition (PARTED)という新しいオフライン強化学習アルゴリズムを提案する。
PartEDは、最小2乗ベースの報酬再分配を通じて、ステップごとのプロキシ報酬に軌道を分解し、学習したプロキシ報酬に基づいて悲観的な値を実行する。
私たちの知る限りでは、PartEDは、トラジェクティブな報酬を持つ一般のMDPにおいて、証明可能な効率のよい最初のオフラインRLアルゴリズムである。
論文 参考訳(メタデータ) (2022-06-13T19:11:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。