論文の概要: Fenchel Tilting: Weighted Correction for Efficient Finetuning of Generative Models
- arxiv url: http://arxiv.org/abs/2609.40030v1
- Date: Wed, 30 Sep 2026 16:02:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:27.997676
- Title: Fenchel Tilting: Weighted Correction for Efficient Finetuning of Generative Models
- Title(参考訳): Fenchel Tilting: 生成モデルの効率的な微調整のための重み付き補正
- Abstract要約: 本稿では,Fenchel Tilt Flow Control (FTFC)を紹介した。
メソッドはユーティリティの変動構造とフェンシェル双対性を組み合わせることで、$f$-divergenceのペナルティをサポートする。
FTFCは様々な好み関数のベースラインを改良し、最大20ドルもする。
- 参考スコア(独自算出の注目度): 2.8402080392117757
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Adapting a pretrained generative model to an arbitrary preference expressed as a utility function underlies reward alignment, guided design, and constraint satisfaction, enabling diverse applications. Existing fine-tuning methods trade off generality against computational cost: they either restrict the family class of supported preferences to keep optimization simple or preserve generality at the expense of efficiency. We introduce Fenchel Tilt Flow Control (FTFC), which decouples utility optimization from generative-model fitting. FTFC first optimizes for a target distribution by jointly fitting an effective reward and density-ratio weights on pretrained samples. Method combines the utility's variational structure with Fenchel duality, supporting general $f$-divergence penalties that determine how rewards are transformed into an distribution-correction weights. These weights are then frozen and used to modify a diffusion or flow model in a single stage of importance-weighted denoising or flow matching, without differentiating through sampling trajectories. We establish exact duality for concave utilities under suitable conditions and show that weighted fitting reproduces the optimal target distribution for a given utility. Across image and molecule generation benchmarks, FTFC improves over baselines on diverse preference functions, while also being up to $20\times$ more efficient. roposed method enables adaptation beyond expected-reward maximization without complex optimization, while preserving robustness for more general class of the utility functions compared to baselines.
- Abstract(参考訳): ユーティリティ関数として表現された任意の選好に事前訓練された生成モデルを適用すると、報酬アライメント、ガイドデザイン、制約満足度が下降し、多様な応用が可能になる。
既存の微調整手法では、最適化をシンプルに保つためにサポート対象の選好のファミリークラスを制限するか、効率を犠牲にして一般性を維持するかのどちらかである。
本稿では,Fenchel Tilt Flow Control (FTFC)を紹介した。
FTFCはまず、トレーニング済みサンプルに効果的な報酬と密度比重を併用することにより、目標分布を最適化する。
方法は、ユーティリティの変動構造とフェンシェル双対性を組み合わせることで、報酬が分布補正重みにどのように変換されるかを決定する一般的な$f$-divergenceペナルティをサポートする。
これらの重みは凍結され、サンプリング軌跡を微分することなく、重要重み付けまたはフローマッチングの単一段階において拡散またはフローモデルを変更するのに使用される。
適切な条件下で凹凸ユーティリティの正確な双対性を確立し、重み付けが与えられたユーティリティの最適目標分布を再現することを示す。
イメージと分子生成のベンチマーク全体で、FTFCはさまざまな選好関数のベースラインを改良し、最大20ドル以上の効率も向上する。
Roposedメソッドは、複雑な最適化を伴わずに、期待再帰の最大化を超えた適応を可能にすると同時に、ベースラインと比較して、ユーティリティ関数のより一般的なクラスに対してロバスト性を保持する。
関連論文リスト
- PG-MAP: Joint MAP Optimization for Inference-Time Alignment of Diffusion and Flow-Matching Models [0.8594140167290097]
事前訓練されたテキスト-画像モデルの推測時間アライメントは、通常、単一の制御軸に沿って実行される。
我々は、軌道レベルのギブスマップ/近位エネルギー最適化として推論時間アライメントを定式化する、トレーニング不要のフレームワークPG-MAPを提案する。
論文 参考訳(メタデータ) (2026-06-22T07:36:36Z) - Support-Proximity Augmented Diffusion Estimation for Offline Black-Box Optimization [17.43522044331905]
本研究では,SPADE(Support-Proximity Augmented Diffusion Estimation)を提案する。
本研究では,SPADE が Design-Bench タスクと LLM データ混合最適化ベンチマークを用いて,最先端の性能を実現することを示す。
論文 参考訳(メタデータ) (2026-05-11T21:09:28Z) - Reward Score Matching: Unifying Reward-based Fine-tuning for Flow and Diffusion Models [54.597200388738656]
Reward-based fine-tuningは、事前訓練された拡散またはフローベース生成モデルを、より高い逆サンプルに向けて操ることを目的としている。
報酬スコアマッチング (RSM) と呼ばれる共通フレームワークで記述できることが示される。
論文 参考訳(メタデータ) (2026-04-19T12:47:52Z) - DEFT: Distribution-guided Efficient Fine-Tuning for Human Alignment [21.889327846803095]
本稿では,データフィルタリングと分散誘導を組み合わせた効率的なアライメントフレームワークDEFTを提案する。
実験の結果, DEFTにより強化された手法はアライメント能力と一般化能力の両方において,元の手法よりも優れていた。
論文 参考訳(メタデータ) (2026-04-02T08:55:53Z) - Variational Entropic Optimal Transport [67.76725267984578]
本稿では,ドメイン翻訳問題に対する変分エントロピー最適輸送(VarEOT)を提案する。
VarEOTは、補助正の正規化子上のトラクタブルな一般化として、log-partition $log mathbbE[exp(cdot)$の正確な変分再構成に基づいている。
合成データと画像と画像の変換に関する実験は、競争力のあるか、あるいはより良い翻訳品質を示す。
論文 参考訳(メタデータ) (2026-02-02T15:48:44Z) - Divergence Minimization Preference Optimization for Diffusion Model Alignment [66.31417479052774]
Divergence Minimization Preference Optimization (DMPO) は、逆KL分散を最小化して拡散モデルを整列する原理的手法である。
DMPOは、異なるベースモデルとテストセットで既存のテクニックを一貫して上回り、適合させることができる。
論文 参考訳(メタデータ) (2025-07-10T07:57:30Z) - Calibrated Multi-Preference Optimization for Aligning Diffusion Models [90.15024547673785]
Calibrated Preference Optimization (CaPO) は、テキスト・ツー・イメージ(T2I)拡散モデルを調整する新しい手法である。
CaPOは、人間の注釈のない複数の報酬モデルからの一般的な好みを取り入れている。
実験結果から, CaPOは従来法よりも常に優れていたことが示唆された。
論文 参考訳(メタデータ) (2025-02-04T18:59:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。