論文の概要: Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control
- arxiv url: http://arxiv.org/abs/2608.05084v1
- Date: Wed, 05 Aug 2026 17:24:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:44.044007
- Title: Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control
- Title(参考訳): いつ停止するかを学ぶ: 継続的制御のための最適化された動的拡散法
- Authors: Rohit Kumar Salla, Manoj Saravanan, Simon Stepputtis,
- Abstract要約: 本稿では,デノナイジングチェーン上のベルマン型再帰を通じて,各中間デノナイジングステップでプレフィックス関数を学習するフレームワークを提案する。
POGPは、ほぼ完全なタスク性能を維持しながら、必要なデノジングイテレーション数を約2.7倍に削減する。
最先端の動的拡散ベースラインと比較して、プレフィックストレーニングは最終タスクのパフォーマンスを約3.5%改善する。
- 参考スコア(独自算出の注目度): 6.449639089043406
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion policies are a powerful policy class for continuous control, but their iterative denoising process creates a substantial computational bottleneck. Reducing this cost requires adapting the number of denoising steps to the difficulty of each action while preserving task performance. We introduce Prefix-Optimal Generative Policies (POGP), a framework that learns a prefix value function at every intermediate denoising step through a Bellman-style recursion over the denoising chain. The prefix value function serves two purposes: it provides an auxiliary training objective that encourages intermediate outputs to become high-quality actions, and it enables a test-time stopping rule that terminates denoising when additional steps are unlikely to produce meaningful improvement. Across four MuJoCo environments and comparisons with 12 baselines, POGP reduces the required number of denoising iterations by approximately 2.7-fold while retaining near-full task performance. Compared with state-of-the-art dynamic diffusion baselines, prefix training also improves final task performance by approximately 3.5%. These results indicate that supervising intermediate denoising steps is useful not only for adaptive early stopping, but also as an auxiliary objective that improves the learned policy.
- Abstract(参考訳): 拡散ポリシーは、継続的な制御のための強力なポリシークラスであるが、反復的なデノゲーションプロセスは、かなりの計算ボトルネックを生み出す。
このコストを削減するには、タスクのパフォーマンスを保ちながら、各アクションの難易度にデノナイジングステップの数を適用する必要がある。
本稿では,プレフィックス最適生成ポリシー(POGP)を紹介する。このフレームワークは,デノナイジングチェーン上のベルマン型再帰を通じて,各中間デノナイジングステップでプレフィックス値関数を学習するフレームワークである。
プレフィックス値関数は2つの目的を果たす: 中間出力が高品質なアクションになるように促す補助的な訓練目標を提供する。
4つのMuJoCo環境と12のベースラインを比較して、POGPは、ほぼフルに近いタスク性能を維持しながら、必要なデノナイズイテレーション数を約2.7倍に削減する。
最先端の動的拡散ベースラインと比較して、プレフィックストレーニングは最終タスクのパフォーマンスを約3.5%改善する。
これらの結果から,適応的な早期停止だけでなく,学習方針を改善する補助的目的として,中間段階の監視が有用であることが示唆された。
関連論文リスト
- QPILOTS: Efficient Test-Time Q-Steering for Flow Policies [20.217020870532686]
QPILOTSは、元のポリシーを変更せずに、推論時にデノナイジングプロセスを操る方法である。
標準のオフライン-オンラインRLベンチマークでは、QPILOTSが最高の集計性能を達成し、50タスクで平均90%の成功率に達する。
論文 参考訳(メタデータ) (2026-06-11T18:22:03Z) - Q-learning with Adjoint Matching [58.78551025170267]
本稿では,新しいTD-based reinforcement learning (RL)アルゴリズムであるAdjoint Matching (QAM) を用いたQ-learningを提案する。
QAMは、最近提案された生成モデリング手法であるadjoint matchingを活用することで、2つの課題を回避している。
オフラインとオフラインの両方のRLにおいて、ハードでスパースな報酬タスクに対する従来のアプローチよりも一貫して優れています。
論文 参考訳(メタデータ) (2026-01-20T18:45:34Z) - Mixture of Noise for Pre-Trained Model-Based Class-Incremental Learning [59.635264288605946]
クラスインクリメンタルラーニング(CIL)は,旧来の知識を維持しつつ,新たなカテゴリを継続的に学習することを目的としている。
バックボーンに軽量な微調整を適用する既存のアプローチは、依然としてドリフトを誘発する。
バックボーン一般化の劣化を軽減し,新しいタスクを適応させることを目的として,Mixture of Noise (Min)を提案する。
論文 参考訳(メタデータ) (2025-09-20T16:07:20Z) - Fewer Denoising Steps or Cheaper Per-Step Inference: Towards Compute-Optimal Diffusion Model Deployment [14.097906894386066]
PostDiffは、トレーニング済みの拡散モデルを加速するためのトレーニング不要のフレームワークである。
我々はPostDiffが最先端拡散モデルの忠実性と効率のトレードオフを大幅に改善できることを示す。
論文 参考訳(メタデータ) (2025-08-08T09:29:37Z) - Reinforcement Learning via Implicit Imitation Guidance [49.88208134736617]
自然なアプローチは、訓練中の正規化や参照ポリシーの取得など、模倣学習の目的を取り入れることである。
提案手法では,条件に付加されたノイズによる探索を導出するための先行データのみを用いて,明示的な行動クローニング制約の必要性を回避することを提案する。
提案手法は、7つの模擬連続制御タスクにまたがるオフライン手法による事前強化学習よりも最大2~3倍向上する。
論文 参考訳(メタデータ) (2025-06-09T07:32:52Z) - TapWeight: Reweighting Pretraining Objectives for Task-Adaptive Pretraining [34.93043212352875]
TapWeightはタスク適応型事前学習フレームワークで、各事前学習対象の最適な重要性を自動的に決定する。
我々はTapWeightを分子特性予測と自然言語理解タスクの両方に適用し,ベースライン法をはるかに上回った。
論文 参考訳(メタデータ) (2024-10-13T20:56:13Z) - Denoising Pre-Training and Customized Prompt Learning for Efficient Multi-Behavior Sequential Recommendation [69.60321475454843]
マルチビヘイビアシークエンシャルレコメンデーションに適した,最初の事前学習および迅速な学習パラダイムであるDPCPLを提案する。
事前学習段階において,複数の時間スケールでノイズを除去する新しい行動マイナ (EBM) を提案する。
次に,提案するCustomized Prompt Learning (CPL)モジュールを用いて,事前学習したモデルを高効率にチューニングすることを提案する。
論文 参考訳(メタデータ) (2024-08-21T06:48:38Z) - DNA: Proximal Policy Optimization with a Dual Network Architecture [0.0]
本稿では,深いアクター・批判的強化学習モデルにおいて,価値関数とポリシーを同時に学習する問題について考察する。
これら2つのタスク間の雑音の次数-次数差により,これらの関数を協調的に学習する一般的な実践は準最適であることがわかった。
我々はこれらの課題を個別に学習するが、制限された蒸留フェーズでは性能が著しく向上することを示した。
論文 参考訳(メタデータ) (2022-06-20T22:24:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。