論文の概要: Diffusion-Guided Uncertainty-Aware Delayed Policy Optimization
- arxiv url: http://arxiv.org/abs/2607.05064v1
- Date: Mon, 06 Jul 2026 13:33:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.1628
- Title: Diffusion-Guided Uncertainty-Aware Delayed Policy Optimization
- Title(参考訳): 拡散誘導不確実性を考慮した遅延ポリシ最適化
- Abstract要約: 実世界の環境における強化学習は、しばしば遅延したフィードバックによる厳しいパフォーマンス劣化に悩まされる。
拡散誘導不確実性認識遅延ポリシー最適化(DUPO)を提案する。
本手法は拡散モデルを用いて遅延状態メッセージと現在の状態の関係を明示的にモデル化する。
- 参考スコア(独自算出の注目度): 12.110304176149148
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Reinforcement learning in real world environments often suffers from severe performance degradation due to delayed feedback. Existing approaches typically mitigate performance degradation caused by observation delays by constructing augmented states or predicting the true states. However, these methods often overlook the inherent discrepancy between delayed state and true states induced by stochastic MDP. We theoretically prove the existence of such a discrepancy and show that it leads to the degradation of the optimal policy. To address this challenge, we propose Diffusion Guided Uncertainty Aware Delayed Policy Optimization (DUPO). Our method explicitly models the relationship between delayed state message and the current state using a diffusion model, and leverages the resulting discrepancy estimates to weight delayed policies. Extensive experiments on continuous robotic control tasks with multiple stochastic delays demonstrate that DUPO consistently outperforms existing methods and remains effective even under long and random delay scenarios.
- Abstract(参考訳): 実世界の環境における強化学習は、しばしば遅延したフィードバックによる厳しいパフォーマンス劣化に悩まされる。
既存のアプローチは一般的に、拡張状態の構築や真の状態の予測によって観測遅延に起因する性能劣化を緩和する。
しかし、これらの手法は確率的MDPによって引き起こされる遅延状態と真の状態との固有の相違をしばしば見落としている。
このような矛盾の存在を理論的に証明し、最適政策の劣化につながることを示す。
そこで我々は,Diffusion Guided Uncertainty Aware Delayed Policy Optimization (DUPO)を提案する。
提案手法は,拡散モデルを用いて遅延状態メッセージと現在の状態の関係を明示的にモデル化し,その結果の差分推定を重み付け遅延ポリシに活用する。
複数の確率的遅延を伴う連続ロボット制御タスクに関する大規模な実験は、DUPOが既存の手法より一貫して優れており、長い、ランダムな遅延シナリオの下でも有効であることを示した。
関連論文リスト
- FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking [51.97839311685636]
FutureRTCは、実行時の観察と非同期VLA制御の状態を予測するためのプラグイン・アンド・プレイ適応フレームワークである。
FutureRTCは推論遅延に対する堅牢性を実現し,よりスムーズな軌道,高速な実行,一貫したタスク成功率を実現している。
論文 参考訳(メタデータ) (2026-07-27T05:10:16Z) - SegDiff: Segmented Trajectory Diffusion for Consistent and Adaptive Robot Manipulation [65.81476183180527]
両パラダイムの長所を統合するクローズドループビズモータポリシであるSegDiffを紹介する。
SegDiffはデモをキーセグメンテーション間で動作セグメントに分解し、現在の状態から次のキーセグメンテーションまでの連続的な軌跡を予測することを学習する。
SegDiffは、さまざまなシミュレートされた実世界のシナリオにおいて、既存のアプローチよりも大きなパフォーマンス向上を示している。
論文 参考訳(メタデータ) (2026-07-13T02:48:03Z) - Delay-Empowered Causal Hierarchical Reinforcement Learning [24.381499367239858]
Delay-Empowered Causal Hierarchical Reinforcement Learning (DECHRL)を提案する。
DECHRLは状態遷移の因果構造と関連する遅延分布の両方を明示的にモデル化する。
遅延を考慮した2DMinecraftおよびMiniGrid環境におけるDECHRLの評価を行った。
論文 参考訳(メタデータ) (2026-05-12T15:28:32Z) - Delayed Homomorphic Reinforcement Learning for Environments with Delayed Feedback [11.866061471514582]
遅延したフィードバックはマルコフの仮定を破り、学習と制御を妨げる。
本稿では,MDP準同型に基づく枠組みを提案する。
MuJoCoベンチマークにおける連続制御タスクの実験は、我々のアルゴリズムが強化ベースのベースラインよりも優れていることを確認した。
論文 参考訳(メタデータ) (2026-04-04T08:38:52Z) - When Sensors Fail: Temporal Sequence Models for Robust PPO under Sensor Drift [64.37959940809633]
時間的持続的なセンサ故障下でのPPOのロバスト性について検討する。
トランスフォーマーを用いたシーケンスポリシーは, センサ数が少ない場合でも高いリターンを保ちながら, 堅牢性, RNN, SSMよりも大幅に優れていた。
論文 参考訳(メタデータ) (2026-03-04T22:21:54Z) - STEP: Warm-Started Visuomotor Policies with Spatiotemporal Consistency Prediction [16.465783114087223]
反復デノゲーションは、リアルタイム閉ループシステムにおける制御周波数を制限し、相当な推論遅延をもたらす。
高品質なウォームスタート動作を構築するための軽量時整合予測機構STEPを提案する。
2段階のSTEPは、RoboMimicベンチマークや実世界のタスクでBRIDGERやDDIMよりも平均21.6%、27.5%高い成功率を達成することができる。
論文 参考訳(メタデータ) (2026-02-09T03:50:40Z) - From Observations to States: Latent Time Series Forecasting [65.98504021691666]
本稿では,TSFを観測回帰から潜時予測に移行する新しいパラダイムであるLatent Time Series Forecasting(LatentTSF)を提案する。
具体的には、LatentTSFはAutoEncoderを使用して、各段階での観測結果を高次元の潜在状態空間に投影する。
提案する潜伏目標は,予測潜伏状態と地道状態と観測値との相互情報を暗黙的に最大化する。
論文 参考訳(メタデータ) (2026-01-30T20:39:44Z) - Exploring Semantic-constrained Adversarial Example with Instruction Uncertainty Reduction [51.50282796099369]
本稿では,多次元命令の不確実性低減フレームワークを開発し,意味論的に制約された逆の例を生成する。
言語誘導サンプリングプロセスの予測により、設計したResAdv-DDIMサンプルにより最適化プロセスが安定化される。
セマンティック制約付き3次元逆数例の参照フリー生成を初めて実現した。
論文 参考訳(メタデータ) (2025-10-27T04:02:52Z) - SynCast: Synergizing Contradictions in Precipitation Nowcasting via Diffusion Sequential Preference Optimization [62.958457694151384]
本研究では,大規模な言語モデルにおける人的フィードバックからの強化学習の成功を動機として,降水量の最適化を初めて導入する。
第一段階では、フレームワークはFARを減らすことに焦点を当て、誤報を効果的に抑えるためにモデルを訓練する。
論文 参考訳(メタデータ) (2025-10-22T16:11:22Z) - Model-Based Reinforcement Learning under Random Observation Delays [9.860349466867193]
我々は,POMDPにおけるランダムなセンサ遅延について検討した。
本稿では,入ってくる観測ストリームに基づいて,信頼状態を逐次更新するモデルに基づくフィルタリングプロセスを提案する。
次に、モデルベースのRLにこのアイデアを組み込んだ、シンプルな遅延認識フレームワークを紹介します。
論文 参考訳(メタデータ) (2025-09-25T08:01:13Z) - Reinforcement Learning via Conservative Agent for Environments with Random Delays [2.115993069505241]
本稿では,ランダム遅延下での意思決定のための単純かつ堅牢なエージェントを保守的エージェントと呼び,ランダム遅延環境を定遅延等価に再構成する。
これにより、アルゴリズム構造を変更したり性能を犠牲にすることなく、最先端の定数遅延法を直接ランダム遅延環境に拡張することができる。
論文 参考訳(メタデータ) (2025-07-25T06:41:06Z) - On the Identification of Temporally Causal Representation with Instantaneous Dependence [50.14432597910128]
時間的因果表現学習は時系列観測から潜在因果過程を特定することを目的としている。
ほとんどの方法は、潜在因果過程が即時関係を持たないという仮定を必要とする。
我々は,インスタントtextbfOus textbfLatent dynamics のための textbfIDentification フレームワークを提案する。
論文 参考訳(メタデータ) (2024-05-24T08:08:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。