論文の概要: Learning Sampling Parameters for Diffusion Models
- arxiv url: http://arxiv.org/abs/2607.23488v1
- Date: Sun, 26 Jul 2026 06:29:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.129163
- Title: Learning Sampling Parameters for Diffusion Models
- Title(参考訳): 拡散モデルの学習サンプリングパラメータ
- Abstract要約: 本稿では,プロンプト条件付き時間変化サンプリングパラメータを学習するためのフレームワークであるLeSAMPを紹介する。
人間の嗜好モデルとVLM-as-a-judgeから得られる報酬を用いてモデルを最適化する。
- 参考スコア(独自算出の注目度): 17.65407773911596
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Text-to-image diffusion models expose many inference-time sampling parameters, including prompts, negative prompts, classifier-free guidance scales, and noise schedules. These parameters are typically manually chosen once and then held fixed across prompts and denoising timesteps, even though different prompts and stages of generation can benefit from different parameter values. We introduce LeSAMP, a framework for learning prompt-conditioned, timestep-varying sampling parameters. We formulate parameter selection as a reinforcement learning problem: Given a user prompt, a large language model is trained to emit schedules for the chosen sampling parameters. We optimize our model using rewards from human preference models and VLM-as-a-judge. We evaluate our model on Flux.1 [dev] and Stable Diffusion 3.5, and find that compared to baselines, LeSAMP has a win rate of up to 68.12% using human preference scores and 73.37% using VLM-as-a-judge. These gains are validated in a user study where we achieve win rates of up to 59.46% over previous baselines. Our results suggest that learned sampling-parameter policies provide a complementary approach to existing post-training methods for improving diffusion model outputs.
- Abstract(参考訳): テキストから画像への拡散モデルは、プロンプト、負のプロンプト、分類器なし誘導尺度、ノイズスケジュールなど、多くの推論時サンプリングパラメータを公開している。
これらのパラメータは通常、手動で一度選択され、異なるプロンプトと生成段階が異なるパラメータ値の恩恵を受けるにもかかわらず、プロンプトをまたいで固定された時間ステップで保持される。
本稿では,プロンプト条件付き時間変化サンプリングパラメータを学習するためのフレームワークであるLeSAMPを紹介する。
我々は,パラメータ選択を強化学習問題として定式化する: ユーザプロンプトが与えられた場合,選択したサンプリングパラメータのスケジュールを生成するために,大規模言語モデルを訓練する。
人間の嗜好モデルとVLM-as-a-judgeから得られる報酬を用いてモデルを最適化する。
本稿では,Flux.1[dev]とStable Diffusion 3.5のモデルについて検討し,ベースラインと比較すると,人間の嗜好スコアで最大68.12%,VLM-as-a-judgeで73.37%の勝利率を示した。
これらの利得は、以前のベースラインよりも59.46%の勝利率を達成したユーザスタディで検証されている。
この結果から,学習したサンプリングパラメータポリシーは,拡散モデル出力を改善するための既存のポストトレーニング手法に相補的なアプローチをもたらすことが示唆された。
関連論文リスト
- Free Lunch for Pass@$k$? Low Cost Diverse Sampling for Diffusion Language Models [17.37935640125399]
本稿では,拡散言語モデルにおける生成多様性を高めるための,無償で低コストな介入手法を提案する。
提案手法は, 各サンプルが前回のサンプルの特徴空間から反発されるような, バッチ内の中間サンプルを逐次修正する。
リトレーニングやビームサーチを必要とする従来の方法とは異なり、我々の戦略は無視できる計算オーバーヘッドを発生させる。
論文 参考訳(メタデータ) (2026-03-05T07:35:07Z) - Learning To Sample From Diffusion Models Via Inverse Reinforcement Learning [43.678382510171986]
拡散モデルは、ニューラルネットワークによってガイドされる反復的復調プロセスを通じてサンプルを生成する。
本稿では,サンプリング戦略の学習のための逆強化学習フレームワークを提案する。
提案手法は,事前学習した拡散モデルにより生成された試料の品質を向上させることができることを示す。
論文 参考訳(メタデータ) (2026-02-09T14:10:44Z) - On the Role of Preference Variance in Preference Optimization [55.364953481473286]
直接選好最適化(DPO)トレーニングの有効性に対する選好分散(PVar)の影響について検討する。
PVarより高いプロンプトは、ランダムに選択されたプロンプトまたは低いPVarより優れたプロンプトを示す。
論文 参考訳(メタデータ) (2025-10-14T22:34:52Z) - Temporal Score Rescaling for Temperature Sampling in Diffusion and Flow Models [30.36841165328262]
本稿では,フローマッチングモデルのサンプリング多様性を判断するメカニズムを提案する。
これらの再スケーリングにより、局所的なサンプリング温度を効果的に制御できることを示す。
論文 参考訳(メタデータ) (2025-10-01T17:59:51Z) - Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning [59.11519451499754]
直接選好最適化(DPO)は、言語モデルと人間の選好を整合させるデファクトアプローチとして登場した。
最近の研究によると、DPOの有効性はデータ品質のトレーニングに依存している。
基準モデル確率空間は,高品質なトレーニングサンプルを自然に検出する。
論文 参考訳(メタデータ) (2025-01-25T07:21:50Z) - Adaptive Inference-Time Compute: LLMs Can Predict if They Can Do Better, Even Mid-Generation [51.127054971591924]
本稿では,生成サンプル数を適応的に削減する新たな自己評価手法を提案する。
平均1.2サンプルだけで16サンプルの使用による改善の74%が達成できることを実証した。
論文 参考訳(メタデータ) (2024-10-03T17:47:29Z) - A Simple Early Exiting Framework for Accelerated Sampling in Diffusion Models [14.859580045688487]
拡散モデルの現実的なボトルネックはサンプリング速度である。
スコア推定に必要な計算を適応的に割り当てる新しいフレームワークを提案する。
本研究では,画像品質を損なうことなく,拡散モデルのサンプリングスループットを大幅に向上できることを示す。
論文 参考訳(メタデータ) (2024-08-12T05:33:45Z) - Towards Free Data Selection with General-Purpose Models [71.92151210413374]
望ましいデータ選択アルゴリズムは、限られたアノテーション予算の有用性を最大化するために、最も情報性の高いサンプルを効率的に選択することができる。
アクティブな学習手法で表現された現在のアプローチは、通常、時間を要するモデルのトレーニングとバッチデータ選択を繰り返し繰り返す、面倒なパイプラインに従う。
FreeSelは重いバッチ選択プロセスをバイパスし、効率を大幅に改善し、既存のアクティブラーニングメソッドよりも530倍高速である。
論文 参考訳(メタデータ) (2023-09-29T15:50:14Z) - Oops I Took A Gradient: Scalable Sampling for Discrete Distributions [53.3142984019796]
このアプローチは、多くの困難な設定において、ジェネリックサンプリングよりも優れていることを示す。
また,高次元離散データを用いた深部エネルギーモデルトレーニングのための改良型サンプリング器についても実演した。
論文 参考訳(メタデータ) (2021-02-08T20:08:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。