論文の概要: Robust Successor Features
- arxiv url: http://arxiv.org/abs/2609.31016v1
- Date: Fri, 25 Sep 2026 09:12:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.320969
- Title: Robust Successor Features
- Title(参考訳): ロバスト継承機能
- Abstract要約: 強化学習の一般化(Reinforcement Learning, RL)とは、目に見えないタスクにおいて、最適に近いポリシーを実行する能力である。
我々の研究は、報酬関数と遷移カーネルの両方にまたがるロバストな後継機能を通じて、これらの2つのパラダイムを統一する。
我々は、遷移カーネル間のミスマッチによるパフォーマンスの劣化を明示的に定量化する、一般化政策改善(GPI)のバウンダリを導出する。
- 参考スコア(独自算出の注目度): 6.095369179273732
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Generalization in Reinforcement Learning (RL) refers to the ability to execute close-to-optimal policies in unseen tasks after the agent has been trained on a different set of tasks. Building on the seminal work of the successor representation and further adaptations with function approximation, Transfer in RL has traditionally focused on generalizing to tasks that only differ in the reward function. A decade after the introduction of the successor representation, Robust RL emerged simultaneously from several articles in the field of operations research. In Robust RL, the transition kernel is unknown, and the goal is to maximize the expected reward under this uncertainty. Our work unifies these two paradigms through robust successor features, which generalize across both the reward function and the transition kernel, under the assumption that tasks are linear Markov Decision Processes. We derive a bound on Generalized Policy Improvement (GPI) that explicitly quantifies how performance degrades with the mismatch between transition kernels, recovering existing successor-feature guarantees when dynamics are shared. Finally, the generalization capabilities of robust successor features are validated on several grid-based benchmarks and compared to previous alternatives that focus solely on either the reward or the transition kernel.
- Abstract(参考訳): 強化学習の一般化(Reinforcement Learning, RL)とは、エージェントが異なるタスクのセットで訓練された後に、見えないタスクで最適に近いポリシーを実行する能力である。
後続表現のセミナルな作業と関数近似によるさらなる適応に基づいて、RLにおけるTransferは伝統的に、報酬関数にのみ異なるタスクへの一般化に焦点を合わせてきた。
後継表現の導入から10年後、ロバスト・RLはオペレーション研究の分野におけるいくつかの論文から同時に登場した。
ロバスト RL では、遷移カーネルは未知であり、この不確実性の下で期待される報酬を最大化する。
我々の研究は、タスクが線形マルコフ決定過程であると仮定して、報酬関数と遷移カーネルの両方にまたがる頑健な後継機能を通じてこれらの2つのパラダイムを統一する。
我々は、遷移カーネル間のミスマッチによるパフォーマンスの劣化を明示的に定量化し、動的に共有された場合の既存の後継保証を回復する一般政策改善(GPI)のバウンダリを導出する。
最後に、堅牢な後継機能の一般化能力は、いくつかのグリッドベースのベンチマークで検証され、報酬または遷移カーネルにのみフォーカスする以前の代替技術と比較される。
関連論文リスト
- ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning [74.19730275669227]
ARISE-RLは、オープンエンドエージェントをトレーニングするための新しいフルサイクルの自己進化フレームワークである。
Reward-Gated Self-Evolution Distillation (RG-SED)を提案する。
ECR-Benchは,シングルツールディープリサーチとマルチツールトラベルプランニングを対象とする,専門家校正型ルーリックベンチマークスイートである。
論文 参考訳(メタデータ) (2026-09-01T10:54:13Z) - Trust Region Inverse Reinforcement Learning: Explicit Dual Ascent using Local Policy Updates [25.957276792858085]
逆強化学習(IRL)は通常、専門家軌道の分布に一致するエントロピーの最大化として定式化される。
本研究では,各イテレーションでRL問題を解くことなく,報酬関数とポリシーの単調な改善を可能にすることにより,ギャップを埋める。
提案アルゴリズムであるTrust Region Inverse Reinforcement Learning (TRIRL) は,複数の課題にまたがる最先端の模倣学習手法を,クラスタリング間平均で2.4倍の性能で上回る。
論文 参考訳(メタデータ) (2026-05-10T15:32:24Z) - Agentic Reinforcement Learning with Implicit Step Rewards [92.26560379363492]
大規模言語モデル (LLMs) は強化学習 (agentic RL) を用いた自律的エージェントとして発展している。
我々は,標準RLアルゴリズムとシームレスに統合された一般的なクレジット割り当て戦略であるエージェントRL(iStar)について,暗黙的なステップ報酬を導入する。
我々は,WebShopとVisualSokobanを含む3つのエージェントベンチマークと,SOTOPIAにおける検証不可能な報酬とのオープンなソーシャルインタラクションについて評価した。
論文 参考訳(メタデータ) (2025-09-23T16:15:42Z) - Q-value Regularized Transformer for Offline Reinforcement Learning [70.13643741130899]
オフライン強化学習(RL)における最先端化のためのQ値正規化変換器(QT)を提案する。
QTはアクション値関数を学習し、条件付きシーケンスモデリング(CSM)のトレーニング損失にアクション値を最大化する用語を統合する
D4RLベンチマークデータセットの実証評価は、従来のDP法やCSM法よりもQTの方が優れていることを示す。
論文 参考訳(メタデータ) (2024-05-27T12:12:39Z) - SF-DQN: Provable Knowledge Transfer using Successor Feature for Deep Reinforcement Learning [89.04776523010409]
本稿では、複数のRL問題が異なる報酬関数を持つが、基礎となる遷移力学を共有する転写強化学習(RL)問題を考察する。
この設定では、各RL問題(タスク)のQ-関数を後継特徴(SF)と報酬マッピングに分解することができる。
GPIを用いたSF-DQNの証明可能な一般化保証を用いた最初の収束解析を確立する。
論文 参考訳(メタデータ) (2024-05-24T20:30:14Z) - Scrutinize What We Ignore: Reining In Task Representation Shift Of Context-Based Offline Meta Reinforcement Learning [10.792687309720169]
オフラインメタ強化学習(OMRL)は、相互作用回避と強力な一般化性能のための有望なアプローチとして登場した。
従来のコンテキストベースのアプローチは、コンテキストエンコーダとポリシーの最適化がパフォーマンス改善につながるという直感に依存しています。
我々はこの問題をタスク表現シフトと呼び、適切なコンテキストエンコーダ更新によってモノトニック性能の改善が保証できることを理論的に証明する。
論文 参考訳(メタデータ) (2024-05-20T13:14:26Z) - Conjugated Discrete Distributions for Distributional Reinforcement
Learning [0.0]
最も成功した方法の1つは、非決定論的プロセスがある場合、最適なポリシーを得られないことを示します。
我々は、分散強化学習が、この状況を完全に改善するのに役立つと論じている。
論文 参考訳(メタデータ) (2021-12-14T14:14:49Z) - Successor Feature Representations [20.91847255769988]
強化学習における伝達は、経験豊富なソースタスクからの知識を用いて、目標タスクにおける学習パフォーマンスを改善することを目的としている。
継承表現(SR)とその拡張継承特徴(SF)は、タスク間で報酬関数が変化する領域において顕著な伝達機構である。
本稿では,後継特徴量の累積割引確率を学習したSRの新たな定式化を提案する。
論文 参考訳(メタデータ) (2021-10-29T12:01:48Z) - A New Representation of Successor Features for Transfer across
Dissimilar Environments [60.813074750879615]
多くの実世界のRL問題は、異なるダイナミクスを持つ環境間での移動を必要とする。
ガウス過程を用いて後継特徴関数をモデル化する手法を提案する。
我々の理論的解析は、この手法の収束と、後続特徴関数のモデル化における有界誤差を証明している。
論文 参考訳(メタデータ) (2021-07-18T12:37:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。