論文の概要: DIA: Denoising Intermediate Advantage for Diffusion Policy Optimization
- arxiv url: http://arxiv.org/abs/2609.12245v2
- Date: Mon, 14 Sep 2026 01:41:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:05.045734
- Title: DIA: Denoising Intermediate Advantage for Diffusion Policy Optimization
- Title(参考訳): DIA:拡散政策最適化のための中間的アドバンテージを論じる
- Abstract要約: 本稿では,政策段階の手法であるDenoising Intermediate Advantage (DIA)を紹介する。
Robomimic、FurnitureBench、Franka Kitchen、D3ILの他、DIAは既存の拡散ポリティクスの微調整方法よりも最終的なパフォーマンスを一貫して改善している。
- 参考スコア(独自算出の注目度): 0.359986669039879
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion-based robot policies have become widely used in robotic manipulation, where they are typically trained with behavior cloning. However, policies trained purely from demonstrations are limited by the quality and coverage of the available data. Reinforcement learning can further improve the performance of these pretrained policies through interaction. A common approach is to use policy-gradient methods that formulate diffusion-policy fine-tuning as an outer environment MDP together with an inner denoising MDP. However, existing methods typically assign the same environment-level credit to all denoising steps used to construct an action chunk, without distinguishing which intermediate decisions contributed most to the final return. We introduce Denoising Intermediate Advantage (DIA), a policy-gradient method that learns a value function over partially denoised actions and uses it to construct a denoising level advantage for each step of the generative process. DIA combines this inner credit signal with the standard environment-level PPO advantage, providing state-dependent credit throughout the denoising chain. Across Robomimic, FurnitureBench, Franka Kitchen, and D3IL, DIA consistently improves final performance over existing diffusion-policy fine-tuning methods. Beyond final reward, DIA reaches successful states more efficiently and can shift farther from the pretrained behavior distribution, enabling it to discover more effective and efficient task-level strategies and subtask sequences that baseline methods fail to reach.
- Abstract(参考訳): 拡散に基づくロボットポリシーは、ロボット操作において広く使われており、通常は行動クローニングで訓練されている。
しかし、デモから純粋に訓練されたポリシーは、利用可能なデータの品質とカバレッジによって制限される。
強化学習は、相互作用を通じてこれらの事前訓練されたポリシーのパフォーマンスをさらに向上させることができる。
一般的なアプローチとして、拡散政治の微調整を外部環境のMDPと内環境のMDPとして定式化する政策段階の手法を用いる方法がある。
しかしながら、既存のメソッドは、通常、どの中間決定が最終的なリターンに最も寄与したかを区別することなく、アクションチャンクを構築するために使用されるすべてのデノイングステップに、同じ環境レベルクレジットを割り当てる。
政策段階の手法であるDenoising Intermediate Advantage (DIA)を導入し,そを用いて生成過程の各ステップに有利なデノナイジングレベルを構築する。
DIAは、この内部クレジット信号と標準環境レベルのPPOの利点を組み合わせることで、デノナイジングチェーン全体を通して状態依存の信用を提供する。
Robomimic、FurnitureBench、Franka Kitchen、D3ILの他、DIAは既存の拡散ポリティクスの微調整方法よりも最終的なパフォーマンスを一貫して改善している。
最終的な報酬を超えて、DIAは成功した状態にもっと効率的に到達し、事前訓練された行動分布から遠く離れて、ベースラインメソッドが到達できないより効率的で効率的なタスクレベルの戦略やサブタスクシーケンスを発見することができる。
関連論文リスト
- QPILOTS: Efficient Test-Time Q-Steering for Flow Policies [20.217020870532686]
QPILOTSは、元のポリシーを変更せずに、推論時にデノナイジングプロセスを操る方法である。
標準のオフライン-オンラインRLベンチマークでは、QPILOTSが最高の集計性能を達成し、50タスクで平均90%の成功率に達する。
論文 参考訳(メタデータ) (2026-06-11T18:22:03Z) - Set-Supervised Diffusion Policy: Learning Action-Chunking Diffusion through Corrections [25.961145214027255]
拡散ポリシーは、ロボットの望ましくない行動と人間の教師の矯正行動の形でペア化された監督を提供する。
提案するSDP(Set-Supervised Diffusion Policy)は,コントラッシブなアクションチャンクデータを用いて,人間の修正から拡散ポリシーを訓練する新しい学習フレームワークである。
SDPは、特にノイズの多いデータに対するロバスト性において、ポリシーパフォーマンスを継続的に改善する。
論文 参考訳(メタデータ) (2026-06-01T08:14:38Z) - V-GRPO: Online Reinforcement Learning for Denoising Generative Models Is Easier than You Think [90.69263509098948]
本稿では,ELBOをベースとしたサロゲートとグループ相対ポリシー最適化アルゴリズムを統合した変分GRPOを提案する。
V-GRPOはテキストと画像の合成において最先端のパフォーマンスを実現し、MixGRPOよりも2倍のスピードアップ、DiffusionNFTより3倍のスピードアップを実現している。
論文 参考訳(メタデータ) (2026-04-25T17:03:21Z) - FASTER: Value-Guided Sampling for Fast RL [103.55398181003262]
FASTERは、計算コストを伴わずに拡散ベースのポリシーのサンプリングベースのテストタイムスケーリングの利点を得る方法である。
FASTERは、トレーニングと推論の計算要求を大幅に削減しながら、同じパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-04-21T17:52:17Z) - Value-Guidance MeanFlow for Offline Multi-Agent Reinforcement Learning [42.476656442284835]
オフラインマルチエージェント強化学習(MARL)は、事前コンパイルされたデータセットから最適なジョイントポリシーを学ぶことを目的としている。
本稿では,シンプルなフローベースのポリシー学習フレームワークであるValue Guidance Multi-agent MeanFlow Policy (VGM$2$P)を提案する。
VGM$2$Pは、グローバルなアドバンテージ値を使用してエージェントの協調をガイドし、最適なポリシー学習を条件付き行動クローンとして扱う。
論文 参考訳(メタデータ) (2026-04-09T12:31:43Z) - Denoising as Adaptation: Noise-Space Domain Adaptation for Image Restoration [64.84134880709625]
拡散モデルを用いて,雑音空間を介して領域適応を行うことが可能であることを示す。
特に、補助的な条件入力が多段階の復調過程にどのように影響するかというユニークな性質を活用することにより、有意義な拡散損失を導出する。
拡散モデルにおけるチャネルシャッフル層や残留スワッピング型コントラスト学習などの重要な戦略を提案する。
論文 参考訳(メタデータ) (2024-06-26T17:40:30Z) - CDSA: Conservative Denoising Score-based Algorithm for Offline Reinforcement Learning [25.071018803326254]
オフラインの強化学習において、分散シフトは大きな障害である。
以前の保守的なオフラインRLアルゴリズムは、目に見えないアクションに一般化するのに苦労した。
本稿では、事前学習したオフラインRLアルゴリズムから生成されたデータセット密度の勾配場を用いて、元の動作を調整することを提案する。
論文 参考訳(メタデータ) (2024-06-11T17:59:29Z) - Diffusion Policies as an Expressive Policy Class for Offline
Reinforcement Learning [70.20191211010847]
オフライン強化学習(RL)は、以前に収集した静的データセットを使って最適なポリシーを学ぶことを目的としている。
本稿では,条件付き拡散モデルを用いたディフュージョンQ-ラーニング(Diffusion-QL)を提案する。
本手法はD4RLベンチマークタスクの大部分において最先端の性能を実現することができることを示す。
論文 参考訳(メタデータ) (2022-08-12T09:54:11Z) - Provable Benefits of Actor-Critic Methods for Offline Reinforcement
Learning [85.50033812217254]
アクター批判法はオフラインの強化学習に広く用いられているが、理論的にはそれほどよく理解されていない。
ペシミズムの原理を自然に取り入れた新しいオフラインアクター批判アルゴリズムを提案する。
論文 参考訳(メタデータ) (2021-08-19T17:27:29Z) - DEALIO: Data-Efficient Adversarial Learning for Imitation from
Observation [57.358212277226315]
観察ifoからの模倣学習において、学習エージェントは、実演者の生成した制御信号にアクセスせずに、実演行動の観察のみを用いて実演エージェントを模倣しようとする。
近年、逆模倣学習に基づく手法は、ifO問題に対する最先端のパフォーマンスをもたらすが、データ非効率でモデルなしの強化学習アルゴリズムに依存するため、サンプルの複雑さに悩まされることが多い。
この問題は、サンプルの収集が時間、エネルギー、およびリスクの面で高いコストを被る可能性がある現実世界の設定に展開することは非現実的です。
よりデータ効率の高いifOアルゴリズムを提案する。
論文 参考訳(メタデータ) (2021-03-31T23:46:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。