論文の概要: CIG-RL: Curiosity-Driven Information-Guided Reinforcement Learning for Source Term Estimation in Uncertain Environments
- arxiv url: http://arxiv.org/abs/2608.30673v1
- Date: Mon, 31 Aug 2026 12:13:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.383166
- Title: CIG-RL: Curiosity-Driven Information-Guided Reinforcement Learning for Source Term Estimation in Uncertain Environments
- Title(参考訳): CIG-RL:不確実環境における情報源推定のための好奇心駆動型情報誘導強化学習
- Abstract要約: ソース項推定(STE)は、ガス源の重要な特性を推定することを目的としている。
深層強化学習(DRL)はその高速な意思決定能力で有望な代替手段を提供する。
我々は,好奇心駆動型情報誘導型強化学習を,堅牢で効率的なSTEのために提案する。
- 参考スコア(独自算出の注目度): 8.148054889623957
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Source term estimation (STE), which aims to estimate key properties of the gas source, is essential for identifying hazardous gas releases. Information-theoretic approaches have been adopted for autonomous STE using mobile sensors due to robustness in noisy environments, yet their online action selection incurs substantial computational cost. Deep reinforcement learning (DRL) provides a promising alternative with its fast decision-making capability. In DRL-based STE, the agent selects actions based on belief states of the source term updated from noisy measurement sequences. However, existing methods rely on random exploration or solely on belief uncertainty reduction without an effective exploration strategy in DRL, which can limit policy robustness in noisy environments. To address this, we propose a curiosity-driven information-guided reinforcement learning for robust and efficient STE. The proposed method promotes active exploration of novel belief state transitions that have not been sufficiently explored during training. We further introduce an uncertainty-adaptive active perception reward to guide efficient source search under uncertainty. Simulations under high-noise conditions and real-world experiments demonstrate the robustness and feasibility of the proposed framework, highlighting its potential for practical STE problems.
- Abstract(参考訳): ガス源の重要な特性を推定することを目的としたソース項推定(STE)は、有害ガス放出の特定に不可欠である。
ノイズの多い環境におけるロバスト性による移動体センサを用いた自律型STEには,情報理論のアプローチが採用されているが,オンライン行動選択は相当な計算コストを伴っている。
深層強化学習(DRL)はその高速な意思決定能力で有望な代替手段を提供する。
DRLベースのSTEでは、ノイズ測定シーケンスから更新されたソース項の信念状態に基づいてアクションを選択する。
しかし、既存の手法は、ノイズの多い環境における政策の堅牢性を制限することができるDRLの効果的な探索戦略を使わずに、ランダムな探索や信念の不確実性低減にのみ依存している。
そこで我々は,好奇心駆動型情報誘導型強化学習を,堅牢で効率的なSTEのために提案する。
提案手法は,訓練中に十分に探索されていない新しい信念状態遷移の活発な探索を促進する。
さらに、不確実性の下で効率的なソース探索を導くために、不確実性適応能動的認識報酬を導入する。
高雑音条件下でのシミュレーションと実世界の実験は、提案手法の堅牢性と実現可能性を示し、実用的なSTE問題の可能性を強調している。
関連論文リスト
- Data-dependent Exploration for Online Reinforcement Learning from Human Feedback [50.34161049551627]
人的フィードバックからのオンライン強化学習(RLHF)は、トレーニング中に新たな嗜好フィードバックを継続的に収集することにより、大規模言語モデル(LLM)を整合させるための有望なパラダイムとして登場した。
既存の調査戦略は、しばしば政治上の期待を通じてボーナスを導き出すが、これは訓練中に利用できる限られた歴史的嗜好データから確実に見積もることが難しい。
高不確実性領域に対する余分な不確実性ボーナスを構築するために、履歴データを活用するシンプルでスケーラブルなデータ依存型選好最適化法(DEPO)を提案する。
論文 参考訳(メタデータ) (2026-05-06T03:56:45Z) - Autonomous Goal Detection and Cessation in Reinforcement Learning: A Case Study on Source Term Estimation [24.984938229619075]
強化学習は動的環境における意思決定プロセスに革命をもたらした。
正確な環境情報がないため、明確なフィードバック信号の提供は困難である。
本研究では,タスク完了時の自律目標検出と停止のための自己フィードバック機構を開発する。
論文 参考訳(メタデータ) (2024-09-14T21:42:17Z) - AI-Based Energy Transportation Safety: Pipeline Radial Threat Estimation
Using Intelligent Sensing System [52.93806509364342]
本稿では,分散光ファイバーセンシング技術に基づくエネルギーパイプラインの放射状脅威推定手法を提案する。
本稿では,包括的信号特徴抽出のための連続的マルチビュー・マルチドメイン機能融合手法を提案する。
本研究では,事前学習モデルによる伝達学習の概念を取り入れ,認識精度と学習効率の両立を図る。
論文 参考訳(メタデータ) (2023-12-18T12:37:35Z) - Wasserstein Actor-Critic: Directed Exploration via Optimism for
Continuous-Actions Control [41.7453231409493]
Wasserstein Actor-Critic (WAC) は、Wasserstein Q-Learning (WQL) citepwqlにインスパイアされたアクター批判アーキテクチャである。
WACは、Q値の推定値の上限を最適化してポリシー学習プロセスを導くことによって、原則的な方法で探索を実施する。
論文 参考訳(メタデータ) (2023-03-04T10:52:20Z) - STEERING: Stein Information Directed Exploration for Model-Based
Reinforcement Learning [111.75423966239092]
遷移モデルの現在の推定値と未知の最適値との間の積分確率距離(IPM)の観点から探索インセンティブを提案する。
KSDに基づく新しいアルゴリズムを開発した。 textbfSTEin information dirtextbfEcted Explor for model-based textbfReinforcement Learntextbfing。
論文 参考訳(メタデータ) (2023-01-28T00:49:28Z) - Benchmarking Safe Deep Reinforcement Learning in Aquatic Navigation [78.17108227614928]
本研究では,水文ナビゲーションに着目した安全強化学習のためのベンチマーク環境を提案する。
価値に基づく政策段階の深層強化学習(DRL)について考察する。
また,学習したモデルの振る舞いを所望の特性の集合上で検証する検証戦略を提案する。
論文 参考訳(メタデータ) (2021-12-16T16:53:56Z) - Lyapunov-based uncertainty-aware safe reinforcement learning [0.0]
InReinforcement Learning (RL)は、様々なシーケンシャルな意思決定タスクに対して最適なポリシーを学ぶ上で、有望なパフォーマンスを示している。
多くの現実世界のRL問題において、主な目的を最適化する以外に、エージェントは一定のレベルの安全性を満たすことが期待されている。
これらの制約に対処するために,リャプノフに基づく不確実性を考慮した安全なRLモデルを提案する。
論文 参考訳(メタデータ) (2021-07-29T13:08:15Z) - Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning [63.53407136812255]
オフライン強化学習は、探索を必要とせずに、事前に収集された静的データセットから効果的なポリシーを学ぶことを約束する。
既存のQラーニングとアクター批判に基づくオフポリティクスRLアルゴリズムは、アウト・オブ・ディストリビューション(OOD)アクションや状態からのブートストラップ時に失敗する。
我々は,OOD状態-動作ペアを検出し,トレーニング目標への貢献度を下げるアルゴリズムであるUncertainty Weighted Actor-Critic (UWAC)を提案する。
論文 参考訳(メタデータ) (2021-05-17T20:16:46Z) - Deep Learning based Uncertainty Decomposition for Real-time Control [9.067368638784355]
本稿では,ディープラーニングを用いたトレーニングデータの欠如を検出する新しい手法を提案する。
合成および実世界のデータセットに対する既存のアプローチに対する利点を示す。
さらに、シミュレーションされたクアッドコプターにオンラインデータ効率制御を展開させる上で、この不確実性推定の実用性を実証する。
論文 参考訳(メタデータ) (2020-10-06T10:46:27Z) - Temporal Difference Uncertainties as a Signal for Exploration [76.6341354269013]
強化学習における探索の効果的なアプローチは、最適な政策に対するエージェントの不確実性に依存することである。
本稿では,評価値のバイアスや時間的に矛盾する点を強調した。
本稿では,時間差誤差の分布の導出に依存する値関数の不確かさを推定する手法を提案する。
論文 参考訳(メタデータ) (2020-10-05T18:11:22Z) - Provably Safe PAC-MDP Exploration Using Analogies [87.41775218021044]
安全クリティカルドメインに強化学習を適用する上での課題は、探索と安全性のバランスをとる方法を理解することだ。
我々は,未知のダイナミックスを持つMDPにおいて,確実に安全な探索を行うアルゴリズムであるAnalogous Safe-State Exploration (ASE)を提案する。
提案手法は, PAC-MDP 感覚の準最適政策を安全に学習するために, 状態-作用対間の類似性を利用する。
論文 参考訳(メタデータ) (2020-07-07T15:50:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。