論文の概要: ART for Diffusion Sampling: Continuous-Time Control and Actor-Critic Learning
- arxiv url: http://arxiv.org/abs/2607.02137v2
- Date: Fri, 03 Jul 2026 02:14:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 13:04:58.541298
- Title: ART for Diffusion Sampling: Continuous-Time Control and Actor-Critic Learning
- Title(参考訳): 拡散サンプリングのためのART:連続時間制御とアクタクリティカルラーニング
- Authors: Yilie Huang, Wenpin Tang, Xun Yu Zhou,
- Abstract要約: 本研究では,学習した逆時間ダイナミクスを有限格子上で離散化するスコアベース拡散サンプリングの時間ステップアロケーションについて検討する。
本稿では、サンプリングクロックの速度を制御として扱い、時間変化を学習する連続時間制御定式化を提案する。
本稿では、スケジュール学習を連続時間強化学習問題に変換するガウスポリシー付き補助ランダム化定式化ART-RLを提案する。
- 参考スコア(独自算出の注目度): 8.67719968902777
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study timestep allocation for score-based diffusion sampling, where a learned reverse-time dynamics is discretized on a finite grid. Uniform and hand-crafted schedules are standard choices, but they rely on fixed prescriptions and can therefore be suboptimal. To address this limitation, we propose Adaptive Reparameterized Time (ART), a continuous-time control formulation that learns a time change by treating the speed of the sampling clock as the control, so that a uniform grid on the learned clock induces adaptive timesteps in the original diffusion time. Based on a leading-order Euler error surrogate, ART provides a principled objective for allocating timesteps along the sampling trajectory. To solve this deterministic control problem, we introduce ART-RL, an auxiliary randomized formulation with Gaussian policies that turns schedule learning into a continuous-time reinforcement learning problem. We prove that the randomized ART-RL formulation is equivalent to ART at the optimizer level, in the sense that its optimal Gaussian policy recovers the optimal ART time-warping rate through its mean. We further establish policy evaluation and policy improvement characterizations and derive trajectory-based moment identities that yield implementable actor--critic updates for learning the schedule. Across experiments ranging from controlled low-dimensional settings to image generation, ART-RL can be plugged into existing diffusion samplers by changing only the timestep grid, consistently improving sample quality over strong baseline schedules at matched budgets while leaving the rest of the sampling pipeline unchanged. The learned schedules also exhibit broad generalization, transferring without retraining across sampling budgets, datasets, solvers, pipelines, and representation spaces.
- Abstract(参考訳): 本研究では,学習した逆時間ダイナミクスを有限格子上で離散化するスコアベース拡散サンプリングの時間ステップアロケーションについて検討する。
統一されたスケジュールと手作りのスケジュールは標準的な選択であるが、それらは固定された処方薬に依存しており、従って準最適である。
この制限に対処するために、サンプリングクロックの速度を制御として扱い、時間変化を学習する連続時間制御式であるAdaptive Reparameterized Time (ART)を提案する。
ARTは、上位のオイラー誤差サロゲートに基づいて、サンプリング軌道に沿ってタイムステップを割り当てるための原則的な目的を提供する。
この決定論的制御問題を解決するために、スケジュール学習を連続時間強化学習問題に変換するガウスポリシー付き補助ランダム化定式化であるART-RLを導入する。
本研究では,ART-RLのランダム化は,最適ガウスポリシーが平均値から最適なART時間を回復するという意味で,最適化レベルにおけるARTと等価であることを示す。
さらに、政策評価と政策改善の特質を確立し、実行可能なアクターを付与する軌跡に基づくモーメントアイデンティティーを導出し、スケジュールを学習するための批判的更新を行う。
制御された低次元設定から画像生成に至るまで、ART-RLは、タイムステップグリッドだけを変更して既存の拡散サンプリングに接続することができ、サンプリングパイプラインの残りの部分をそのまま残しながら、一致した予算での強いベースラインスケジュールよりも、サンプル品質を継続的に改善することができる。
学習したスケジュールはまた広範な一般化を示し、サンプリング予算、データセット、ソルバ、パイプライン、表現空間をまたいで再トレーニングすることなく転送する。
関連論文リスト
- Precise: SDE-Consistent Stochastic Sampling for RL Post-Training of Flow-Matching Models [56.67321805551389]
Reinforcement Learning (RL) は, 拡散・流れマッチングジェネレータにおいて, 迅速なアライメントと知覚品質の向上に有効な方法となっている。
探索行動の制御と力学のデノベーションを行うサンプルは、この方針の一部である。
有効探査と安定性のバランスをとる新しいサンプリング器を提案する。
論文 参考訳(メタデータ) (2026-05-22T11:37:22Z) - RAVEN: Real-time Autoregressive Video Extrapolation with Consistency-model GRPO [53.38929612273108]
因果自己回帰ビデオ拡散モデルは、以前生成されたコンテンツから将来のチャンクを外挿することでリアルタイムストリーミング生成をサポートする。
本稿では,リアルタイム自動回帰ビデオ補間ネットワーク(RAVEN)を紹介した。これは,各自己ロールアウトを,クリーンな歴史的エンドポイントのインターリーブシーケンスに再パッケージするトレーニングタイムテストフレームワークである。
論文 参考訳(メタデータ) (2026-05-14T17:59:30Z) - Inference-Time Attribute Distribution Alignment for Unconditional Diffusion [54.28942858023809]
我々は、事前訓練された非条件拡散モデルに対する推論時属性分布アライメント問題を定式化する。
そこで本研究では,逆拡散過程に対する最適制御問題として,推定時属性分布アライメントを適用した。
最適制御に基づくアルゴリズムを用いて分散マッチングの最適化を行う。
論文 参考訳(メタデータ) (2026-05-08T09:02:47Z) - ART for Diffusion Sampling: A Reinforcement Learning Approach to Timestep Schedule [8.67719968902777]
スコアベース拡散モデルに対する時間離散化を考察する。
我々は、ランダム化制御コンパニオンART-RLを導出し、連続時間強化学習問題として時間変化を定式化する。
ART-RLは、公式のEDMパイプラインに基づいて、CIFAR-10のフレシェ・インセプション・ディスタンスを改善し、AFHQv2、FFHQ、ImageNetに再訓練することなく移行した。
論文 参考訳(メタデータ) (2026-01-26T16:56:40Z) - Inference-Time Scaling of Diffusion Language Models with Particle Gibbs Sampling [70.8832906871441]
我々は、モデルを再訓練することなく、所望の報酬に向けて世代を操る方法を研究する。
従来の手法では、通常は1つの認知軌道内でサンプリングやフィルタを行い、軌道レベルの改善なしに報酬をステップバイステップで最適化する。
本稿では,拡散言語モデル(PG-DLM)の粒子ギブスサンプリングについて紹介する。
論文 参考訳(メタデータ) (2025-07-11T08:00:47Z) - Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems [6.859965454961918]
本研究では,LQ制御問題に対する強化学習について検討する。
本稿では, モデルフリーでデータ駆動型探索機構を提案し, 批判者によるエントロピー正規化を適応的に調整する。
本手法は,LQ問題のクラスにおいて,最もよく知られたモデルフリーな結果と一致するサブ線形後悔境界を実現する。
論文 参考訳(メタデータ) (2025-07-01T01:09:06Z) - Score-Optimal Diffusion Schedules [29.062842062257918]
高品質なサンプルを得るためには、適切な離散化スケジュールが不可欠である。
本稿では,最適な離散化スケジュールを適応的に選択するための新しいアルゴリズムを提案する。
学習したスケジュールは、これまで手動検索でのみ発見されていたパフォーマンススケジュールを復元する。
論文 参考訳(メタデータ) (2024-12-10T19:26:51Z) - Truncating Trajectories in Monte Carlo Policy Evaluation: an Adaptive Approach [51.76826149868971]
モンテカルロシミュレーションによる政策評価は多くのMC強化学習(RL)アルゴリズムの中核にある。
本研究では,異なる長さの軌跡を用いた回帰推定器の平均二乗誤差のサロゲートとして品質指標を提案する。
本稿では,Robust and Iterative Data Collection Strategy Optimization (RIDO) という適応アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-10-17T11:47:56Z) - When to Sense and Control? A Time-adaptive Approach for Continuous-Time RL [37.58940726230092]
離散時間マルコフ決定過程(MDP)の最適化における強化学習(RL)の特長
この課題に対処するRLフレームワークであるTime-Adaptive Control & Sensing(TaCoS)を形式化する。
我々は、TaCoSで訓練された最先端のRLアルゴリズムが、その離散時間に対する相互作用量を劇的に削減できることを実証した。
論文 参考訳(メタデータ) (2024-06-03T09:57:18Z) - Time-series Generation by Contrastive Imitation [87.51882102248395]
モーメントマッチングの目的によってモチベーションされ、複合的エラーを軽減し、局所的(しかし前方的な)遷移ポリシーを最適化する。
推論において、学習されたポリシーは反復的なサンプリングのジェネレータとして機能し、学習されたエネルギーはサンプルの品質を評価するための軌道レベル尺度として機能する。
論文 参考訳(メタデータ) (2023-11-02T16:45:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。