論文の概要: FASTER: Fast Adjoint Stochastic Transport for Endpoint Refinement in Reward-Guided Image Editing
- arxiv url: http://arxiv.org/abs/2610.04538v1
- Date: Sat, 03 Oct 2026 14:09:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-11 19:05:22.575823
- Title: FASTER: Fast Adjoint Stochastic Transport for Endpoint Refinement in Reward-Guided Image Editing
- Title(参考訳): FASTER:Reward-Guided Image Editingにおけるエンドポイントリファインメントのための高速結合確率輸送
- Abstract要約: テスト時のリワード誘導画像編集は、ソースの内容と視覚的可視性を保ちながら、特定の報酬を改善することを目指している。
我々は、報酬、ソース保存、事前訓練された優先的嗜好を共同で説明する理論的枠組みを開発する。
FASTERを導入し、各ソースに対して小さなネットワークをトレーニングし、安価な編集を行う。
- 参考スコア(独自算出の注目度): 30.53858248466831
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reward-guided image editing at test time seeks to improve a specified reward while preserving source content and visual plausibility. Many existing approaches optimize candidates through pretrained generation processes, making repeated adjustment depend on costly large-model execution and, in some cases, backbone backpropagation. We develop a theoretical framework that jointly accounts for reward, source preservation, and pretrained-prior preferences, allowing the desired output distribution to be specified separately from the dynamics used to realize it. Based on this framework, we introduce FASTER, which trains a small network for each source and objective to perform inexpensive editing, while pretrained and reward models provide feedback on candidate outputs. By reusing each candidate and its feedback across multiple small-network updates, FASTER reduces repeated sampling and supervision queries without placing the pretrained generative backbone inside the inner optimization loop. On SD3, FASTER leads all four target metrics and several validation metrics among the evaluated methods. Compared with the evaluated baseline that optimizes controls along pretrained generation trajectories, FASTER achieves editing-time speedups of up to \({6.91\times}\) on Stable Diffusion 3 and \({24.14\times}\) on Stable Diffusion 1.5.
- Abstract(参考訳): テスト時のリワード誘導画像編集は、ソースの内容と視覚的可視性を保ちながら、特定の報酬を改善することを目指している。
既存の多くのアプローチは、事前訓練された生成プロセスを通じて候補を最適化し、繰り返し調整をコストの大きなモデルの実行に依存し、場合によってはバックボーンのバックプロパゲーションに依存する。
我々は、報酬、ソース保存、事前訓練された事前選好を共同で考慮し、所望の出力分布を、それを実現するために使用するダイナミクスとは別々に指定できる理論的枠組みを開発する。
この枠組みに基づいてFASTERを導入し、各ソースに対して小さなネットワークをトレーニングし、コストのかかる編集を行うとともに、事前学習および報酬モデルが候補出力に対するフィードバックを提供する。
FASTERは、各候補とそのフィードバックを複数の小さなネットワーク更新で再利用することにより、内部最適化ループ内に事前訓練された生成バックボーンを配置することなく、繰り返しサンプリングと監視クエリを削減する。
SD3では、FASTERは評価手法の中で4つの目標メトリクスといくつかの検証指標をリードする。
事前訓練された生成軌跡に沿って制御を最適化する評価ベースラインと比較すると、FASTERは安定拡散3で最大 \({6.91\times}\)、安定拡散1.5で最大 \({24.14\times}\) の編集時間を高速化する。
関連論文リスト
- Unlocking Few-Step Diffusion for Faithful Previews [8.595543707900433]
我々は、同じノイズから生成されたフルステップ出力との対応性を改善することを学び、プロンプトを行う。
再現率53-78%のMSEを含む基準忠実度は, LD3よりも有意に改善した。
論文 参考訳(メタデータ) (2026-09-28T06:19:23Z) - Optimizing Visual Generative Models via Distribution-wise Rewards [57.46109819595665]
本稿では,実世界のデータ分布との整合性を確保するために,分布ワイド報酬を用いた生成モデルを微調整する新しいフレームワークを提案する。
提案手法は,SiTでは5.77,EDM2では3.74から3.52まで,様々なベースモデルでFID-50Kを大幅に改善する。
論文 参考訳(メタデータ) (2026-07-02T15:08:56Z) - Beyond Pairwise Preferences: Listwise Reward-Aware Alignment for Diffusion Models [73.08789211016567]
Diffusion LAIRは、拡散モデルに対する報酬を考慮したリストワイズ選好最適化手法である。
実験により、テキスト・ツー・イメージ生成、合成生成、画像編集ベンチマークにおいて、強い優先最適化ベースラインを上回ります。
論文 参考訳(メタデータ) (2026-05-26T03:09:24Z) - MARBLE: Multi-Aspect Reward Balance for Diffusion RL [71.6241143519038]
強化学習は、拡散モデルと人間の嗜好を整合させる主要なアプローチとなっている。
既存のプラクティスは、報酬ごとに1つのスペシャリストモデルをトレーニングすることで、複数の報酬を処理します。
我々は,各報酬に対する独立な優位推定器を維持する勾配空間最適化フレームワークMARBLEを提案する。
論文 参考訳(メタデータ) (2026-05-07T16:20:42Z) - Threshold-Guided Optimization for Visual Generative Models [16.556017381410943]
視覚生成モデルと人間のフィードバックを整合させるためのしきい値誘導フレームワークを提案する。
提案手法は,従来手法よりも常に好みのアライメントを改善する。
これらの結果は、我々の閾値誘導フレームワークを、ペア比較なしで視覚的生成モデルを整列する単純な代替手段として位置づけている。
論文 参考訳(メタデータ) (2026-05-06T08:59:16Z) - Reward Score Matching: Unifying Reward-based Fine-tuning for Flow and Diffusion Models [54.597200388738656]
Reward-based fine-tuningは、事前訓練された拡散またはフローベース生成モデルを、より高い逆サンプルに向けて操ることを目的としている。
報酬スコアマッチング (RSM) と呼ばれる共通フレームワークで記述できることが示される。
論文 参考訳(メタデータ) (2026-04-19T12:47:52Z) - RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time [51.256131853751754]
本研究では,多次元的批判を明示的に生成するために報酬モデルを教えることで,受動的評価器から能動的最適化ツールへ変換することを示す。
提案手法では, 嗜好データから高品質な論理を復元する原理的フレームワークであるpreference-Anchored Rationalization (PARROT) を導入する。
その結果、RationalRewards (8B) は、オープンソース報酬モデル間の最先端の好み予測を実現する。
論文 参考訳(メタデータ) (2026-04-13T15:38:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。