論文の概要: On the Importance of Multistability for Horizon Generalization in Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2605.12206v1
- Date: Tue, 12 May 2026 14:45:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 21:48:56.935446
- Title: On the Importance of Multistability for Horizon Generalization in Reinforcement Learning
- Title(参考訳): 強化学習における水平一般化のためのマルチスタビリティの重要性について
- Authors: Asad Bakija, Florent De Geeter, Julien Brandoit, Pierre Sacré, Guillaume Drion,
- Abstract要約: 長距離マルコフ決定プロセス(POMDP)は特に困難である。
訓練は、一般化の貧弱さ、サンプルの不効率さ、探索の禁止に苦しむ。
我々は時間的地平面一般化を定式化し、非線形かつ並列化可能なRNN変種が実現可能であることを実験的に評価した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: In reinforcement learning (RL), agents acting in partially observable Markov decision processes (POMDPs) must rely on memory, typically encoded in a recurrent neural network (RNN), to integrate information from past observations. Long-horizon POMDPs, in which the relevant observation and the optimal action are separated by many time steps (called the horizon), are particularly challenging: training suffers from poor generalization, severe sample inefficiency, and prohibitive exploration costs. Ideally, an agent trained on short horizons would retain optimal behavior at arbitrarily longer ones, but no formal framework currently characterizes when this is achievable. To fill this gap, we formalized temporal horizon generalization, the property that a policy remains optimal for all horizons, derived a necessary and sufficient condition for it, and experimentally evaluated the ability of nonlinear and parallelizable RNN variants to achieve it. This paper presents the resulting theoretical framework, the empirical evaluation, and the dynamical interpretation linking RNN behavior to temporal horizon generalization. Our analyses reveal that multistability is necessary for temporal horizon generalization and, in simple tasks, sufficient; more complex tasks further require transient dynamics. In contrast, modern parallelizable architectures, namely state space models and gated linear RNNs, are monostable by construction and consequently fail to generalize across temporal horizons. We conclude that multistability and transient dynamics are two essential and complementary dynamical regimes for horizon generalization, and that no current parallelizable RNN exhibits both. Designing parallelizable architectures that combine these regimes thus emerges as a key direction for scalable long-horizon RL.
- Abstract(参考訳): 強化学習(RL)では、部分的に観測可能なマルコフ決定プロセス(POMDP)に作用するエージェントは、過去の観測からの情報を統合するために、通常、リカレントニューラルネットワーク(RNN)に符号化されたメモリに依存する必要がある。
関連する観測と最適な行動が多くの時間ステップ(地平線と呼ばれる)で区切られるロングホライゾンPOMDPは、特に困難である。
理想的には、短い地平線で訓練されたエージェントは、任意に長いものでも最適な振舞いを維持するだろうが、これが達成可能なときに現在形式的な枠組みが特徴付けられることはない。
このギャップを埋めるために、我々は時間的地平線一般化を定式化し、すべての地平線に対してポリシーが最適であり続ける性質を定式化し、それを実現するための非線形かつ並列化可能なRNN変種の性能を実験的に評価した。
本稿では,RNNの挙動と時間的地平線一般化を関連づけた理論的枠組み,経験的評価,動的解釈について述べる。
解析の結果、時間的地平線一般化には乗算可能性が必要であり、単純なタスクでは十分であり、さらに複雑なタスクは過渡的ダイナミクスを必要とすることがわかった。
対照的に、現代の並列化可能なアーキテクチャ、すなわち状態空間モデルとゲート線形RNNは、構成によって単安定であり、したがって時間的地平線をまたいで一般化することができない。
我々は、多重安定性と過渡ダイナミクスが地平線一般化に必須かつ相補的な2つの力学系であり、現在の並列化可能なRNNはどちらも存在しないと結論づける。
これらのレシエーションを組み合わせた並列化可能なアーキテクチャの設計は、スケーラブルな長距離RLの鍵となる方向として現れる。
関連論文リスト
- On the Generalization Behavior of Deep Residual Networks From a Dynamical System Perspective [1.0388986221727612]
ディープニューラルネットワーク(DNN)は非常に高度な機械学習を持ち、モデル深度は彼らの成功に中心的な役割を果たす。
本研究では,Rademacher複雑性,動的システムのフローマップ,ResNetsの深層限界における収束挙動を組み合わせることで,離散的および連続的残差ネットワーク(ResNets)の一般化誤差境界を確立する。
Findingsは、離散時間と連続時間の両方のResNet間の一般化の統一的な理解を提供し、サンプルの複雑さの順序と離散時間と連続時間設定の間の仮定のギャップを埋めるのに役立ちます。
論文 参考訳(メタデータ) (2026-02-24T13:59:06Z) - OSDEnhancer: Taming Real-World Space-Time Video Super-Resolution with One-Step Diffusion [64.10689934231165]
ビデオスーパーレゾリューションモデル(DM)は、ビデオスーパーレゾリューション(VSR)において極めて成功している。
時空ビデオスーパーレゾリューション(STVSR)の可能性は、低解像度から高解像度までのリアルな視覚コンテンツを回復する必要があるが、コヒーレントなダイナミックスでフレームレートを改善する必要がある。
提案するOSDEnhancerは,効率的なワンステップ拡散プロセスにより,実世界のSTVSRを初期化するための最初の手法である。
実験により,提案手法は実世界のシナリオにおいて優れた性能を維持しつつ,最先端の性能を実現することを示す。
論文 参考訳(メタデータ) (2026-01-28T06:59:55Z) - Sample-Efficient Neurosymbolic Deep Reinforcement Learning [49.60927398960061]
本稿では,背景記号知識を統合し,サンプル効率を向上させるニューロシンボリックディープRL手法を提案する。
オンライン推論は2つのメカニズムを通じてトレーニングプロセスのガイドを行う。
我々は、最先端の報奨機ベースラインよりも優れた性能を示す。
論文 参考訳(メタデータ) (2026-01-06T09:28:53Z) - Nemotron-Cascade: Scaling Cascaded Reinforcement Learning for General-Purpose Reasoning Models [71.9060068259379]
汎用推論モデルを構築するために,ケースド・ドメインワイド強化学習を提案する。
私たちの14Bモデルは、RLの後、LiveCodeBench v5/v6 ProでSFTの教師であるDeepSeek-R1-0528を上回り、インフォマティクスにおける2025 International Olympiad in Informatics (IOI)における銀の医療性能を上回りました。
論文 参考訳(メタデータ) (2025-12-15T18:02:35Z) - Transformer with Koopman-Enhanced Graph Convolutional Network for Spatiotemporal Dynamics Forecasting [12.301897782320967]
TK-GCNは、幾何学的空間符号化と長距離時間モデリングを統合した2段階のフレームワークである。
我々は,TK-GCNが予測地平線全体にわたって優れた予測精度を提供することを示す。
論文 参考訳(メタデータ) (2025-07-05T01:26:03Z) - Universal In-Context Approximation By Prompting Fully Recurrent Models [86.61942787684272]
RNN,LSTM,GRU,Linear RNN,Linear RNN,Line gated Architecturesは,汎用のインコンテキスト近似器として機能することを示す。
完全反復アーキテクチャにコンパイルするLSRLというプログラミング言語を導入する。
論文 参考訳(メタデータ) (2024-06-03T15:25:13Z) - Tractable Dendritic RNNs for Reconstructing Nonlinear Dynamical Systems [7.045072177165241]
線形スプラインベース展開により、片方向線形リカレントニューラルネットワーク(RNN)を増強する。
このアプローチは単純な PLRNN の理論的に魅力的な性質を全て保持するが、相対的に低次元の任意の非線形力学系を近似する能力は向上する。
論文 参考訳(メタデータ) (2022-07-06T09:43:03Z) - Provable Hierarchy-Based Meta-Reinforcement Learning [50.17896588738377]
HRLをメタRL設定で解析し、下流タスクで使用するメタトレーニング中に学習者が潜在階層構造を学習する。
我々は、この自然階層の標本効率の回復を保証し、抽出可能な楽観主義に基づくアルゴリズムとともに「多様性条件」を提供する。
我々の境界は、時間的・状態的・行動的抽象化などのHRL文献に共通する概念を取り入れており、我々の設定と分析が実際にHRLの重要な特徴を捉えていることを示唆している。
論文 参考訳(メタデータ) (2021-10-18T17:56:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。