論文の概要: Anticipatory Reinforcement Learning: From Generative Path-Laws to Distributional Value Functions
- arxiv url: http://arxiv.org/abs/2604.04662v1
- Date: Mon, 06 Apr 2026 13:15:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-07 15:49:19.199199
- Title: Anticipatory Reinforcement Learning: From Generative Path-Laws to Distributional Value Functions
- Title(参考訳): 予測強化学習:生成経路から分布値関数へ
- Authors: Daniel Bloch,
- Abstract要約: 本稿では,非マルコフ決定プロセスと古典的強化学習アーキテクチャのギャップを埋める新しいフレームワークである予測強化学習(ARL)を紹介する。
ジャンプ拡散と構造破壊によって特徴づけられる環境では、伝統的な状態に基づく手法は、正確なフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホ
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper introduces Anticipatory Reinforcement Learning (ARL), a novel framework designed to bridge the gap between non-Markovian decision processes and classical reinforcement learning architectures, specifically under the constraint of a single observed trajectory. In environments characterised by jump-diffusions and structural breaks, traditional state-based methods often fail to capture the essential path-dependent geometry required for accurate foresight. We resolve this by lifting the state space into a signature-augmented manifold, where the history of the process is embedded as a dynamical coordinate. By utilising a self-consistent field approach, the agent maintains an anticipated proxy of the future path-law, allowing for a deterministic evaluation of expected returns. This transition from stochastic branching to a single-pass linear evaluation significantly reduces computational complexity and variance. We prove that this framework preserves fundamental contraction properties and ensures stable generalisation even in the presence of heavy-tailed noise. Our results demonstrate that by grounding reinforcement learning in the topological features of path-space, agents can achieve proactive risk management and superior policy stability in highly volatile, continuous-time environments.
- Abstract(参考訳): 本稿では,非マルコフ決定過程と古典的強化学習アーキテクチャのギャップを埋める新しいフレームワークである予測強化学習(ARL)を紹介する。
ジャンプ拡散と構造破壊によって特徴づけられる環境では、伝統的な状態に基づく手法は、正確なフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアロジ)。
状態空間をシグネチャ拡張多様体に上げ、プロセスの歴史を動的座標として埋め込むことでこれを解決する。
自己一貫性のあるフィールドアプローチを利用することで、エージェントは将来のパスローの予測プロキシを保持し、期待されるリターンの決定論的評価を可能にする。
この確率分岐から単一パス線形評価への遷移は、計算複雑性と分散を著しく減少させる。
この枠組みは基本収縮特性を保ち、重み付き雑音の存在下でも安定な一般化を保証する。
筆者らは,経路空間のトポロジカルな特徴に強化学習を基礎として,高揮発性連続環境において,エージェントが積極的なリスク管理と優れた政策安定を達成できることを実証した。
関連論文リスト
- CURVE: Learning Causality-Inspired Invariant Representations for Robust Scene Understanding via Uncertainty-Guided Regularization [30.613712415224473]
CURVEは、変動不確実性モデリングと不確実性誘導構造正規化を統合し、高分散関係を抑制するフレームワークである。
具体的には,環境依存的変動から不変な相互作用力学を解離させ,スパースかつ領域安定なトポロジを促進させる。
実験により,CURVEをゼロショット転送と低データのsim-to-real適応で評価し,領域安定なスパーストポロジの学習能力を検証するとともに,分布シフト下でのリスク予測を支援するための信頼性の高い不確実性推定を行う。
論文 参考訳(メタデータ) (2026-01-28T08:15:56Z) - Stochastic Path Planning in Correlated Obstacle Fields [1.8184089804625951]
本研究では,不確実な状態の空間的相関障害を有するナビゲーション環境であるSCOS(Correlated Obstacle Scene)問題を紹介する。
我々は,ブロック確率を洗練させるベイズ的信念更新を開発し,その後部を用いて探索空間を効率よく削減する。
このフレームワークは、敵の割り込みやクラスタ化された自然災害のある環境でのナビゲーション上の課題に対処する。
論文 参考訳(メタデータ) (2025-09-23T20:30:35Z) - On the System Theoretic Offline Learning of Continuous-Time LQR with Exogenous Disturbances [3.701656361145375]
線形二次規制 (LQR) 戦略のオフライン設計を不確実な乱れを伴う解析を行う。
我々のアプローチは、適応動的プログラミングの基本的な学習ベースのフレームワークの上に構築されている。
論文 参考訳(メタデータ) (2025-09-20T17:14:27Z) - TrajBooster: Boosting Humanoid Whole-Body Manipulation via Trajectory-Centric Learning [79.59753528758361]
両足のVLAを促進するために、豊富な車輪付きヒューマノイドデータを活用するクロス・エボディメント・フレームワークであるTrajBoosterを提案する。
私たちのキーとなる考え方は、形態素に依存しないインターフェースとして、エンドエフェクタ・トラジェクトリを使用することです。
以上の結果から,TrajBoosterは既存の車輪付きヒューマノイドデータにより,二足歩行ヒューマノイドVLAの性能を効率的に向上させることができることがわかった。
論文 参考訳(メタデータ) (2025-09-15T12:25:39Z) - ERIS: An Energy-Guided Feature Disentanglement Framework for Out-of-Distribution Time Series Classification [51.07970070817353]
理想的な時系列分類(TSC)は不変表現をキャプチャできるべきである。
現在の手法は、真に普遍的な特徴を分離するために必要な意味的な方向性を欠いている。
本稿では,シフト・ロバストネス・フレームワークのためのエンドツーエンドのエネルギー規則化情報を提案する。
論文 参考訳(メタデータ) (2025-08-19T12:13:41Z) - Provable Guarantees for Generative Behavior Cloning: Bridging Low-Level
Stability and High-Level Behavior [51.60683890503293]
生成モデルを用いた複雑な専門家による実演の行動クローニングに関する理論的枠組みを提案する。
任意の専門的軌跡の時間ごとのステップ分布に一致するトラジェクトリを生成することができることを示す。
論文 参考訳(メタデータ) (2023-07-27T04:27:26Z) - On the Sample Complexity and Metastability of Heavy-tailed Policy Search
in Continuous Control [47.71156648737803]
強化学習(Reinforcement learning)は、システムダイナミクスモデルなしで、時間をかけてインセンティブを順次明らかにする、インタラクティブな意思決定のためのフレームワークである。
定義された連鎖を特徴付け、テールインデックスのレヴィプロセスに関連するポリシーがより広いピークに収まることを識別する。
論文 参考訳(メタデータ) (2021-06-15T20:12:44Z) - Supporting Optimal Phase Space Reconstructions Using Neural Network
Architecture for Time Series Modeling [68.8204255655161]
位相空間特性を暗黙的に学習する機構を持つ人工ニューラルネットワークを提案する。
私たちのアプローチは、ほとんどの最先端戦略と同じくらいの競争力があるか、あるいは優れているかのどちらかです。
論文 参考訳(メタデータ) (2020-06-19T21:04:47Z) - Distributional Robustness and Regularization in Reinforcement Learning [62.23012916708608]
経験値関数の新しい正規化器を導入し、ワッサーシュタイン分布のロバストな値関数を下限とすることを示す。
強化学習における$textitexternalな不確実性に対処するための実用的なツールとして正規化を使用することを提案する。
論文 参考訳(メタデータ) (2020-03-05T19:56:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。