論文の概要: Adaptive Multi-Horizon Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.20656v2
- Date: Sat, 25 Jul 2026 01:24:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 12:52:43.727762
- Title: Adaptive Multi-Horizon Reinforcement Learning
- Title(参考訳): 適応型マルチ水平強化学習
- Authors: Manoosh Samiei, Doina Precup, Paul Masset,
- Abstract要約: 時間的地平線を適応的に選択・結合するマルチ水平アプローチを提案する。
これにより、手動の割引係数チューニングなしで報酬構造の変更を堅牢に適応できる。
その結果,適応的時間的割引はパラメータ効率を向上し,人工学習システムと生物学的学習システムの両方において適応性を向上させることが示唆された。
- 参考スコア(独自算出の注目度): 30.564973207845327
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Effective decision-making in complex and changing environments requires balancing short-term and long-term consequences. In reinforcement learning (RL), this trade-off is typically controlled through a fixed discount factor, which imposes a single exponentially discounted temporal horizon. However, biological agents exhibit flexible and adaptive temporal discounting, suggesting that effective planning requires multiple timescales. Here, we propose a multi-horizon approach that adaptively selects and combines temporal horizons, enabling robust adaptation to changes in reward structure without manual discount-factor tuning. This flexibility makes the method particularly suitable for continual learning scenarios involving task switches and varying environmental configurations. Empirically, we demonstrate that our approach identifies effective discount factors across a range of MiniGrid environments, including continual settings composed of three sequentially changing tasks. These results suggest that adaptive temporal discounting can improve parameter efficiency and enhance adaptability in both artificial and biologically inspired learning systems.
- Abstract(参考訳): 複雑で変化する環境における効果的な意思決定には、短期的および長期的な結果のバランスが必要である。
強化学習(RL)では、このトレードオフは通常、固定された割引係数によって制御される。
しかしながら、生物学的エージェントは柔軟で適応的な時間的割引を示し、効果的な計画には複数の時間スケールが必要であることを示唆している。
本稿では,時間的地平線を適応的に選択・結合し,手動の割引要素調整なしで報酬構造の変化に頑健な適応を可能にするマルチホライゾン手法を提案する。
この柔軟性により、タスクスイッチと様々な環境構成を含む連続的な学習シナリオに特に適している。
提案手法は,3つの連続的に変化するタスクからなる連続的な設定を含む,MiniGrid環境における有効割引係数を実証的に同定する。
これらの結果から,適応的時間的割引はパラメータ効率を向上し,人工学習システムと生物学的学習システムの両方において適応性を向上させることが示唆された。
関連論文リスト
- On the Use of Evolutionary Optimization for the Dynamic Chance Constrained Open-Pit Mine Scheduling Problem [3.6439154309310013]
我々は、ブロック経済価値が不確実であり、採掘能力と処理能力が時間とともに変化する、機会制約のある露天掘り鉱山スケジューリング問題について検討する。
本稿では,実現不可能なソリューションのサブセットを修復し,変更が検出されるたびに追加可能なソリューションを導入する,多様性に基づく変化応答機構を提案する。
論文 参考訳(メタデータ) (2026-04-15T01:16:01Z) - Adaptive Double-Booking Strategy for Outpatient Scheduling Using Multi-Objective Reinforcement Learning [0.3437656066916039]
本稿では,個別化されたno-show予測と強化学習を統合した適応型外来二重予約フレームワークを提案する。
提案するフレームワークは、単一書籍、ダブルブック、あるいは予約要求の拒否をいつ行うかを決定する。
論文 参考訳(メタデータ) (2026-03-07T15:58:38Z) - Adaptive Linear Path Model-Based Diffusion [52.84663832658799]
リニアパスモデルベース拡散(LP-MBD)を導入し、分散保存スケジュールをフローマッチング線形確率パスに置き換える。
また,適応型LP-MBD(ALP-MBD)を提案し,タスクの複雑さや環境条件に応じて拡散ステップやノイズレベルを調整する。
論文 参考訳(メタデータ) (2026-02-02T21:33:03Z) - GateRA: Token-Aware Modulation for Parameter-Efficient Fine-Tuning [51.79350934271497]
GateRAは、PEFT更新の強度を動的に調整するトークン対応変調を導入する統一フレームワークである。
適応ゲーティングを標準のPEFTブランチに組み込むことで、Gateraは選択的でトークンレベルの適応を可能にする。
複数のコモンセンス推論ベンチマークの実験により、GateRAはPEFT法よりも一貫して優れ、一致していることが示された。
論文 参考訳(メタデータ) (2025-11-15T17:55:47Z) - Multi-Agent Path Finding via Offline RL and LLM Collaboration [0.0]
Multi-Agent Path Finding (MAPF) は、ロボティクスやロジスティクスの応用において重要な課題となる。
決定変換器(DT)に基づく効率的な分散化計画フレームワークを提案する。
提案手法は,長期信用割当を効果的に処理し,疎度と遅延報酬を伴うシナリオの性能を著しく向上させる。
論文 参考訳(メタデータ) (2025-09-26T09:53:40Z) - FADAS: Towards Federated Adaptive Asynchronous Optimization [56.09666452175333]
フェデレートラーニング(FL)は、プライバシ保護機械学習のトレーニングパラダイムとして広く採用されている。
本稿では、非同期更新を適応的フェデレーション最適化と証明可能な保証に組み込む新しい手法であるFADASについて紹介する。
提案アルゴリズムの収束率を厳格に確立し,FADASが他の非同期FLベースラインよりも優れていることを示す実験結果を得た。
論文 参考訳(メタデータ) (2024-07-25T20:02:57Z) - Revisiting GANs by Best-Response Constraint: Perspective, Methodology,
and Application [49.66088514485446]
ベストレスポンス制約(Best-Response Constraint、BRC)は、ジェネレータのディスクリミネータへの依存性を明示的に定式化する一般的な学習フレームワークである。
モチベーションや定式化の相違があっても, フレキシブルBRC法により, 様々なGANが一様に改善できることが示される。
論文 参考訳(メタデータ) (2022-05-20T12:42:41Z) - Hyper-Learning for Gradient-Based Batch Size Adaptation [2.944323057176686]
バッチサイズをスケジューリングして拡大することは、ディープニューラルネットワークをトレーニングする際のノイズを制御する効果的な戦略である。
学習可能なスケジューリングのためのバッチサイズ適応を行うためのアルゴリズムとしてArbiterを導入する。
いくつかの実験でArbiterの有効性を実証した。
論文 参考訳(メタデータ) (2022-05-17T11:01:14Z) - Deep Learning for Effective and Efficient Reduction of Large Adaptation
Spaces in Self-Adaptive Systems [12.341380735802568]
本稿では、DLASeR+を略して「適応空間削減のための深層学習」を提案する。
DLASeR+は、オンライン適応スペース削減のための拡張可能な学習フレームワークを提供する。
3種類の適応目標(しきい値、最適化、セットポイント目標)をサポートする。
その結果, DLASeR+は適応目標の実現に無視できる効果を有することがわかった。
論文 参考訳(メタデータ) (2022-04-13T08:51:06Z) - Efficient Feature Transformations for Discriminative and Generative
Continual Learning [98.10425163678082]
継続的学習のための簡易タスク特化機能マップ変換戦略を提案する。
これらは新しいタスクを学習するための強力な柔軟性を提供し、ベースアーキテクチャに最小パラメータを追加することで実現される。
本手法の有効性と効率を,判別(cifar-100およびimagenet-1k)および生成的タスクの一連の実験を用いて実証する。
論文 参考訳(メタデータ) (2021-03-25T01:48:14Z) - Adaptive Gradient Method with Resilience and Momentum [120.83046824742455]
レジリエンスとモメンタム(AdaRem)を用いた適応勾配法を提案する。
AdaRemは、過去の1つのパラメータの変化方向が現在の勾配の方向と一致しているかどうかに応じてパラメータワイズ学習率を調整する。
本手法は,学習速度とテスト誤差の観点から,従来の適応学習率に基づくアルゴリズムよりも優れていた。
論文 参考訳(メタデータ) (2020-10-21T14:49:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。