論文の概要: Arithmetic Actor Heads and Training Stabilization for Out-of-Distribution Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2610.05143v1
- Date: Sun, 04 Oct 2026 11:44:41 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:17:04.106524
- Title: Arithmetic Actor Heads and Training Stabilization for Out-of-Distribution Reinforcement Learning
- Title(参考訳): アウト・オブ・ディストリビューション強化学習のための算術的アクターヘッドとトレーニング安定化
- Abstract要約: 強化学習政策の因果的シンボリックBAPR(CS-BAPR)ファミリーについて検討した。
実際の方法は6つのトレーニング安定化設定と代替アクターヘッドを組み合わせることである。
- 参考スコア(独自算出の注目度): 19.34848029403215
- License:
- Abstract: Reinforcement learning (RL) policies can deteriorate under out-of-distribution (OOD) magnitude shifts. Starting from soft actor-critic (SAC) and its Bayesian Amnesic Piecewise-Robust (BAPR) predecessor, we study the causal-symbolic BAPR (CS-BAPR) family. The practical method combines six training-stabilization settings with alternative actor heads: a Neural Addition Unit (NAU) with a Neural Multiplication Unit (NMU)-inspired quadratic correction, a Kolmogorov-Arnold Network (KAN), or a multilayer perceptron (MLP) with rectified linear unit (ReLU) or hyperbolic-tangent activations.
- Abstract(参考訳): 強化学習(RL)政策は、アウト・オブ・ディストリビューション(OOD)スケールシフトによって悪化する可能性がある。
柔らかいアクター・クリティカル (SAC) とベイジアン・アンセリック・パイス・ロバスト (BAPR) を出発点として, 因果シンボリック・BAPR (CS-BAPR) ファミリーについて検討した。
実際の方法は6つのトレーニング安定化設定と代替アクターヘッドを組み合わせる: ニューラル加算ユニット(NAU)とニューラル乗法ユニット(NMU)にインスパイアされた二次補正、コルモゴロフ・アルノルドネットワーク(KAN)、または多層パーセプトロン(MLP)と整列線形ユニット(ReLU)または双曲タングルトアクティベーションである。
関連論文リスト
- Post-Hoc Robustness for Model-Based Reinforcement Learning [1.4072254177584387]
本研究は, 深部RL剤の加熱後強固化を推察時に導入する。
目標は、ニューラルネットワークのさらなるトレーニングを必要とせずに、堅牢性を改善することだ。
論文 参考訳(メタデータ) (2026-06-02T11:43:13Z) - Self-Distilled Agentic Reinforcement Learning [65.24201057390938]
自己蒸留型エージェント強化学習は、トークンレベルの信号をシグモノイドゲートにマップする。
SDARはモデルスケール全体のハイブリッドRL--OPSDベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-14T17:51:26Z) - ARLArena: A Unified Framework for Stable Agentic Reinforcement Learning [75.73135757250806]
エージェント強化学習(ARL)は、複雑で多段階の対話的なタスクを解決するためのトレーニングエージェントにとって有望なパラダイムとして急速に注目を集めている。
初期の成果を奨励しているにもかかわらず、ARLは非常に不安定であり、しばしばトレーニングの崩壊につながる。
本稿では,制御された再現可能な環境下でのトレーニング安定性を検証した,安定したトレーニングレシピと系統的分析フレームワークであるARLArenaを提案する。
論文 参考訳(メタデータ) (2026-02-25T03:43:34Z) - GB-DQN: Gradient Boosted DQN Models for Non-stationary Reinforcement Learning [0.0]
逐次残差学習によるモデルドリフトに対応する適応型アンサンブル法であるemphGradient-Boosted Deep Q-Networks (GB-DQN)を提案する。
GB-DQNは、単一のQ-ネットワークを再訓練する代わりに、新たな学習者がドリフト後の現在のアンサンブルのベルマン残差を近似するように訓練された付加的なアンサンブルを構築する。
論文 参考訳(メタデータ) (2025-12-18T19:53:50Z) - Bridging Supervised Learning and Reinforcement Learning in Math Reasoning [55.889740979706815]
強化学習(Reinforcement Learning, RL)は、二分検証信号による自己改善を可能にすることで、近年の数学能力の急上昇において中心的な役割を担っている。
本研究は,LLMが障害を反映し,外部教師なしで自律的に改善できる教師型アプローチである負認識ファインチューニング(NFT)を提案する。
論文 参考訳(メタデータ) (2025-05-23T17:17:40Z) - On the Relation between Internal Language Model and Sequence Discriminative Training for Neural Transducers [52.88268942796418]
内部言語モデル(ILM)のサブトラクションは、RNN-Transducerの性能向上に広く応用されている。
列識別訓練は, 理論的, 経験的両面からILMサブトラクションと強く相関していることを示す。
論文 参考訳(メタデータ) (2023-09-25T13:35:28Z) - Robust Reinforcement Learning as a Stackelberg Game via
Adaptively-Regularized Adversarial Training [43.97565851415018]
ロバスト強化学習(RL)は、モデルエラーや敵攻撃によるパフォーマンス向上に重点を置いている。
既存の文献の多くは、解の概念としてナッシュ平衡を伴うゼロサム同時ゲームとして RARL をモデル化している。
RRL-Stackと呼ばれる一般のStackelbergゲームモデルである、ロバストなRLの階層的な新しい定式化を導入する。
論文 参考訳(メタデータ) (2022-02-19T03:44:05Z) - Self-Organized Operational Neural Networks for Severe Image Restoration
Problems [25.838282412957675]
畳み込みニューラルネットワーク(CNN)に基づく離散学習は、ノイズとクリーンのイメージペアのトレーニング例から学習することで、画像復元を行うことを目的としている。
これは畳み込みに基づく変換の本質的な線形性によるものであり、深刻な復元問題に対処するには不十分である。
画像復元のための自己組織型ONN(Self-ONN)を提案する。
論文 参考訳(メタデータ) (2020-08-29T02:19:41Z) - SUNRISE: A Simple Unified Framework for Ensemble Learning in Deep
Reinforcement Learning [102.78958681141577]
SUNRISEは単純な統一アンサンブル法であり、様々な非政治的な深層強化学習アルゴリズムと互換性がある。
SUNRISEは, (a) アンサンブルに基づく重み付きベルマンバックアップと, (b) 最上位の自信境界を用いて行動を選択する推論手法を統合し, 効率的な探索を行う。
論文 参考訳(メタデータ) (2020-07-09T17:08:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。