論文の概要: Cross-Domain Energy-Guided Diffusion Generation for Off-Dynamics Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2605.24810v1
- Date: Sun, 24 May 2026 01:44:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 19:50:18.458726
- Title: Cross-Domain Energy-Guided Diffusion Generation for Off-Dynamics Reinforcement Learning
- Title(参考訳): オフダイナミックス強化学習のためのクロスドメインエネルギー誘導拡散生成
- Authors: Yu Yang, Yihong Guo, Anqi Liu, Pan Xu,
- Abstract要約: オフラインのオフライン強化学習は、大規模なソースデータセットと限られたターゲットデータセットからターゲットドメインポリシーを学ぶことを目指している。
我々は,クロスドメインエネルギー誘導拡散ゲネレーションフレームワークであるCEDGEを提案する。
CEDGEは、ソースドメイントラジェクトリ上で軌道拡散モデルを訓練し、エネルギー誘導により生成されたサンプルをターゲットドメインに適応させる。
- 参考スコア(独自算出の注目度): 25.497449531415125
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Off-dynamics offline reinforcement learning seeks to learn a target-domain policy from a large source dataset and a limited target dataset under mismatched transition dynamics. Existing approaches such as reward augmentation and data filtering are constrained to the source dataset and cannot synthesize new target behavior to improve coverage beyond the collected source trajectories. While recent model-based methods attempt to address this by learning target-aware dynamics, the generated experience is constructed only at the transition level, which leads to accumulated errors over long horizons. These limitations necessitate a shift toward trajectory-level generation for off-dynamics offline RL. We propose CEDGE, a Cross-domain Energy-guided Diffusion GEneration framework. CEDGE trains a trajectory diffusion model on source-domain trajectories and adapts the generated samples to the target domain through energy guidance. This guidance is derived by minimizing the distribution mismatch between the source and desired target-domain trajectories and is decomposed into return, domain, and behavior energy components. The resulting energy-guided trajectories are useful both for direct planning and as synthetic data for policy learning. Since target adaptation is achieved via energy guidance rather than retraining the diffusion model, CEDGE can be efficiently adapted to new target dynamics compared to previous methods. Experiments on the ODRL benchmark demonstrate that trajectory-level energy-guided generation improves diffusion planning under dynamics shifts and produces synthetic data that improves downstream target policy learning.
- Abstract(参考訳): オフラインのオフライン強化学習は、ミスマッチしたトランジションダイナミクスの下で、大規模なソースデータセットと限られたターゲットデータセットからターゲットドメインポリシーを学習することを目指している。
報酬増強やデータフィルタリングといった既存のアプローチは、ソースデータセットに制約されており、収集されたソーストラジェクトリを超えてカバレッジを改善するために、新たなターゲット動作を合成することはできない。
最近のモデルベース手法では、ターゲット認識のダイナミクスを学習することでこの問題に対処しようとするが、生成したエクスペリエンスは遷移レベルでのみ構築され、長い水平線上のエラーが蓄積される。
これらの制限は、オフダイナミックスオフラインRLの軌跡レベル生成への移行を必要とする。
我々は,クロスドメインエネルギー誘導拡散ゲネレーションフレームワークであるCEDGEを提案する。
CEDGEは、ソースドメインのトラジェクトリ上で軌道拡散モデルを訓練し、エネルギー誘導により生成されたサンプルをターゲットドメインに適応させる。
このガイダンスは、ソースと所望のターゲットドメインの軌跡間の分布ミスマッチを最小化し、戻り、ドメイン、行動エネルギーの構成要素に分解することで導かれる。
結果として得られるエネルギー誘導軌道は、直接計画と政策学習のための合成データの両方に有用である。
拡散モデルの再学習ではなく,エネルギー誘導により目標適応が達成されるので,CEDGEは従来の手法と比較して,新しい目標ダイナミクスに効率的に適応することができる。
ODRLベンチマークの実験は、軌道レベルのエネルギー誘導生成が動的シフトの下で拡散計画を改善し、下流の目標政策学習を改善する合成データを生成することを示した。
関連論文リスト
- Model-Based Diffusion Sampling for Predictive Control in Offline Decision Making [48.998030470623384]
オフラインの意思決定は、さらなるインタラクションを伴わずに、固定データセットからの信頼性の高い振る舞いを必要とする。
i)タスク整列軌道を多様に生成するプランナー,(ii)システム力学との整合性を強制するダイナミクスモデル,(iii)タスク目標に整合した動作を選択するランサーモジュールからなる構成モデルに基づく拡散フレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-09T06:26:02Z) - ASTRO: Adaptive Stitching via Dynamics-Guided Trajectory Rollouts [22.46606397400043]
本稿では,データ拡張フレームワークASTROを提案する。
ASTROはまず時間距離の表現を学習し、区別され、到達可能な縫合ターゲットを特定する。
次に、動的誘導型縫合プランナを用い、ロールアウト偏差フィードバックを介して接続動作シーケンスを適応的に生成する。
論文 参考訳(メタデータ) (2025-11-28T18:35:37Z) - TD-JEPA: Latent-predictive Representations for Zero-Shot Reinforcement Learning [63.73629127832652]
本稿では,TDに基づく潜在予測表現を教師なしRLに活用するTD-JEPAを紹介する。
TD-JEPAは、明示的な状態とタスクエンコーダ、ポリシー条件付きマルチステップ予測器、パラメータ化されたポリシーのセットを潜時空間で直接訓練する。
実証的には、TD-JEPAは13のデータセットにわたる移動、ナビゲーション、操作のタスクにおいて、最先端のベースラインをマッチまたは上回る。
論文 参考訳(メタデータ) (2025-10-01T10:21:18Z) - MOBODY: Model Based Off-Dynamics Offline Reinforcement Learning [25.497449531415125]
オフラインソースと限られたターゲットデータセットからポリシーを学習することを目的として、オフライン強化学習をオフラインで研究する。
学習対象の動的遷移を用いたポリシーを最適化するモデルベースオフダイナミックスオフラインRLアルゴリズムMOBODYを提案する。
我々はMOBODYを幅広い MuJoCo および Adroit ベンチマークで評価し、最先端のオフダイナミックス RL ベースラインよりも優れていることを示した。
論文 参考訳(メタデータ) (2025-06-10T05:36:54Z) - Composite Flow Matching for Reinforcement Learning with Shifted-Dynamics Data [43.61074482938135]
CompFlowは、フローマッチングと最適輸送の間の理論的接続を基礎とする手法である。
我々は、ソース・ドメインフローの出力分布に基づいて構築された条件フローとして、ターゲットダイナミクスをモデル化する。
CompFlowは、動的に変化する複数のRLベンチマークにおいて、強いベースラインを上回ります。
論文 参考訳(メタデータ) (2025-05-29T04:09:19Z) - Learning from Reward-Free Offline Data: A Case for Planning with Latent Dynamics Models [79.2162092822111]
我々は,一連のナビゲーションタスクにおいて,強化学習(RL)と制御に基づく手法を体系的に評価する。
我々は、JEPA(Joint Embedding Predictive Architecture)を使用して、潜在ダイナミクスモデルを使用し、それを計画に使用します。
その結果,モデルベースプランニングではレイアウトが不明瞭になるのに対して,モデルフリーのRLは高品質なデータから恩恵を受けることがわかった。
論文 参考訳(メタデータ) (2025-02-20T18:39:41Z) - Progressive Conservative Adaptation for Evolving Target Domains [76.9274842289221]
従来のドメイン適応は、典型的には、ソースドメインから定常ターゲットドメインに知識を転送する。
このような対象データに対する復元と適応は、時間とともに計算とリソース消費をエスカレートする。
我々は、進歩的保守的適応(PCAda)と呼ばれる、単純で効果的なアプローチを提案する。
論文 参考訳(メタデータ) (2024-02-07T04:11:25Z) - Learning to Continuously Optimize Wireless Resource in a Dynamic
Environment: A Bilevel Optimization Perspective [52.497514255040514]
この研究は、データ駆動メソッドが動的環境でリソース割り当て戦略を継続的に学び、最適化することを可能にする新しいアプローチを開発しています。
学習モデルが新たなエピソードに段階的に適応できるように、連続学習の概念を無線システム設計に組み込むことを提案する。
我々の設計は、異なるデータサンプルにまたがる公平性を保証する、新しい二段階最適化定式化に基づいている。
論文 参考訳(メタデータ) (2021-05-03T07:23:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。