論文の概要: CoDrift: Compositional Drifting for Offline Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2608.23939v1
- Date: Tue, 25 Aug 2026 00:54:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.708017
- Title: CoDrift: Compositional Drifting for Offline Reinforcement Learning
- Title(参考訳): CoDrift: オフライン強化学習のための構成的ドリフト
- Authors: Xiewei Ni, Ruofeng Mei, Xiangyu Xu,
- Abstract要約: CoDriftは、一段階の生成ポリシー学習のための構成フレームワークである。
我々は,OGBenchとD4RLの73タスクに対するCoDriftの評価を行った。
- 参考スコア(独自算出の注目度): 5.284273813980071
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Offline reinforcement learning is intrinsically multi-objective: a policy must remain compatible with the behavioral support of a fixed dataset while preferentially selecting high-value actions. We recast these objectives in a common form by viewing each as an action-space motion field that specifies how generated actions should move. This perspective enables heterogeneous learning objectives to be combined directly through field composition. Inspired by drifting models, we propose CoDrift, a compositional framework for one-step generative policy learning. CoDrift combines three objective-level fields into a unified policy field. The conditional field preserves state-dependent behavioral structure, while the marginal field pools actions across states to provide a more stable generative signal in the single-positive-sample regime of continuous-control offline RL. The value field moves generated actions toward higher-value regions. The composed field is absorbed into a stochastic generator that produces an action with a single forward pass at deployment. We evaluate CoDrift on 73 tasks from OGBench and D4RL in both offline and offline-to-online settings. CoDrift compares favorably with state-of-the-art methods and achieves the best average rank in both settings.
- Abstract(参考訳): オフライン強化学習は本質的に多目的である: ポリシーは、高い値のアクションを優先的に選択しながら、固定されたデータセットの行動サポートと互換性を保たなければならない。
我々は、これらの目的を、生成したアクションがどのように動くかを指定するアクション空間運動場として見ることによって、共通の形式で再キャストする。
この視点は、フィールド合成を通して、異種学習の目的を直接組み合わせることを可能にする。
ドリフトモデルに着想を得て,一段階生成政策学習のための構成的枠組みであるCoDriftを提案する。
CoDriftは、3つの目標レベルフィールドを統一ポリシーフィールドに結合する。
条件場は状態依存的な挙動構造を保ち、境界場は状態間の作用をプールし、連続的に制御されるオフラインRLの単一陽性サンプル状態においてより安定した生成信号を提供する。
値フィールドは生成されたアクションを高値領域に移動させる。
合成されたフィールドは確率的ジェネレータに吸収され、デプロイ時に単一のフォワードパスでアクションを生成する。
我々は,OGBenchとD4RLの73タスクに対するCoDriftの評価を行った。
CoDriftは最先端の手法を好適に比較し、両方の設定で最高の平均ランクを達成する。
関連論文リスト
- Dual Advantage Fields [49.37343159001842]
本稿では,双線形二重値モデルを局所的有利信号に変換するポリシ抽出法であるDual Advantage Fieldsを提案する。
OGBenchのロコモーション、操作、パズルタスクでは、DAFは総合的なRLiableメトリクスを改善し、局所的に正しいアクションが最終目標に向かっての直接の動きと異なる設定で強く機能する。
論文 参考訳(メタデータ) (2026-06-02T20:15:14Z) - Guided Flow Policy: Learning from High-Value Actions in Offline Reinforcement Learning [10.037416068775853]
本稿では,多段階フローマッチングポリシと蒸留ワンステップアクタを結合したガイドフローポリシーを提案する。
アクターは、重み付けされた振る舞いのクローンを通じてフローポリシーを指示し、データセットから高価値なアクションのクローンに集中する。
この相互誘導により、GFPは144の状態およびピクセルベースのタスクで最先端のパフォーマンスを達成することができる。
論文 参考訳(メタデータ) (2025-12-03T17:05:58Z) - Scaling Up Occupancy-centric Driving Scene Generation: Dataset and Method [54.461213497603154]
作業中心の手法は、最近、フレームとモダリティをまたいだ一貫した条件付けを提供することで、最先端の結果を得た。
Nuplan-Occは、広く使われているNuplanベンチマークから構築された、これまでで最大の占有率データセットである。
高品質な占有、多視点ビデオ、LiDAR点雲を共同で合成する統合フレームワークを開発した。
論文 参考訳(メタデータ) (2025-10-27T03:52:45Z) - Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient [61.440209025381016]
ポリシー強化学習は、ディープニューラルネットワーク(DNN)を使用して、アクション選択層における可能性を計算するために使用される特徴表現の共有バックボーンを学習する。
特定の制約下では、我々はAction Collapse (AC)と呼ばれる神経崩壊に似た構造が出現する。
本稿では,動作選択層として合成ETFを付加した行動崩壊ポリシー勾配(ACPG)法を提案する。
論文 参考訳(メタデータ) (2025-09-02T18:33:11Z) - QuadKAN: KAN-Enhanced Quadruped Motion Control via End-to-End Reinforcement Learning [2.26464274357758]
我々は、強化学習(RL)による視覚誘導四足歩行制御に対処する。
Kolmogorov-Arnold Networks (KAN) でインスタンス化されたクロスモーダルポリシーである QuadKAN を提案する。
以上の結果から,QuadKANは最新技術(SOTA)ベースラインよりも一貫して高いリターン,より大きな距離,衝突の少ないことが分かる。
論文 参考訳(メタデータ) (2025-08-26T16:05:32Z) - MOBODY: Model Based Off-Dynamics Offline Reinforcement Learning [25.497449531415125]
オフラインソースと限られたターゲットデータセットからポリシーを学習することを目的として、オフライン強化学習をオフラインで研究する。
学習対象の動的遷移を用いたポリシーを最適化するモデルベースオフダイナミックスオフラインRLアルゴリズムMOBODYを提案する。
我々はMOBODYを幅広い MuJoCo および Adroit ベンチマークで評価し、最先端のオフダイナミックス RL ベースラインよりも優れていることを示した。
論文 参考訳(メタデータ) (2025-06-10T05:36:54Z) - TD3 with Reverse KL Regularizer for Offline Reinforcement Learning from
Mixed Datasets [118.22975463000928]
エージェントが複数の行動ポリシーをロールアウトすることで収集したデータセットから学習する必要があるオフライン強化学習(RL)について考察する。
1) RL信号の最適化と行動クローニング(BC)信号の最適なトレードオフは、異なる行動ポリシーによって引き起こされる行動カバレッジの変化によって異なる状態に変化する。
本稿では,TD3アルゴリズムに基づくBC正規化器として,適応重み付き逆KL(Kulback-Leibler)分散を用いることにより,両課題に対処する。
論文 参考訳(メタデータ) (2022-12-05T09:36:23Z) - Let Offline RL Flow: Training Conservative Agents in the Latent Space of
Normalizing Flows [58.762959061522736]
オフライン強化学習は、追加の環境相互作用なしに、事前に記録された、固定されたデータセット上でポリシーをトレーニングすることを目的としている。
我々は、最近、潜在行動空間における学習ポリシーを基礎として、生成モデルの構築に正規化フローの特別な形式を用いる。
提案手法が最近提案したアルゴリズムより優れていることを示すため,様々な移動タスクとナビゲーションタスクについて評価を行った。
論文 参考訳(メタデータ) (2022-11-20T21:57:10Z) - A Regularized Implicit Policy for Offline Reinforcement Learning [54.7427227775581]
オフラインの強化学習は、環境とのさらなるインタラクションなしに、固定データセットから学習を可能にする。
フレキシブルだが十分に調整された完全実装ポリシーの学習を支援するフレームワークを提案する。
D4RLデータセットの実験とアブレーション研究により、我々のフレームワークとアルゴリズム設計の有効性が検証された。
論文 参考訳(メタデータ) (2022-02-19T20:22:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。