論文の概要: ACPO: Anchor-Constrained Perceptual Optimization for Diffusion Models with No-Reference Quality Guidance
- arxiv url: http://arxiv.org/abs/2604.26348v1
- Date: Wed, 29 Apr 2026 07:00:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-30 15:59:36.281915
- Title: ACPO: Anchor-Constrained Perceptual Optimization for Diffusion Models with No-Reference Quality Guidance
- Title(参考訳): ACPO:非参照品質誘導拡散モデルに対するアンカー制約付き知覚最適化
- Abstract要約: 本研究では,非参照知覚品質を拡散訓練に取り入れることの問題点について検討する。
重要な課題は、非参照画像品質評価(NR-IQA)モデルで提供されるような知覚信号を直接最適化することが、元の拡散目標とのミスマッチを導入することである。
安定した知覚適応を可能にするアンカー制約最適化フレームワークを提案する。
- 参考スコア(独自算出の注目度): 36.4379549994663
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion models have achieved remarkable success in image generation, yet their training is predominantly driven by full-reference objectives that enforce pixel-wise similarity to ground-truth images.Such supervision, while effective for fidelity, may insufficient in terms of subjective visual perception quality and text-image semantic consistency. In this work, we investigate the problem of incorporating no-reference perceptual quality into diffusion training. A key challenge is that directly optimizing perceptual signals, such as those provided by no-reference image quality assessment (NR-IQA) models, introduces a mismatch with the original diffusion objective, leading to training instability and distributional drift during fine-tuning. To address this issue, we propose an anchor-constrained optimization framework that enables stable perceptual adaptation. Specifically, we leverage a learned NR-IQA model as a perceptual guidance signal, while introducing an anchor-based regularization that enforces consistency with the base diffusion model in terms of noise prediction. This design effectively balances perceptual quality improvement and generative fidelity, allowing controlled adaptation toward perceptually favorable outputs without compromising the original generative behavior. Extensive experiments demonstrate that our method consistently enhances perceptual quality while preserving generation diversity and training stability, highlighting the effectiveness of anchor-constrained perceptual optimization for diffusion models.
- Abstract(参考訳): 拡散モデルは画像生成において顕著な成功を収めてきたが、そのトレーニングは主に、地平線画像とピクセルワイドな類似性を強制するフルリフレクションの目的によって進められており、その監督は、忠実性に効果があるが、主観的視覚的品質とテキストイメージのセマンティック一貫性の観点からは不十分である。
本研究では,非参照知覚品質を拡散訓練に取り入れることの問題点について検討する。
重要な課題は、非参照画像品質評価(NR-IQA)モデルで提供されるような知覚信号を直接最適化することが、元の拡散目標とのミスマッチを導入し、微調整中のトレーニング不安定性と分布ドリフトをもたらすことである。
この問題に対処するために,安定した知覚適応を可能にするアンカー制約最適化フレームワークを提案する。
具体的には、学習したNR-IQAモデルを知覚誘導信号として利用し、ノイズ予測の観点からベース拡散モデルとの整合性を強制するアンカーベース正規化を導入する。
この設計は、知覚品質の向上と生成の忠実さを効果的にバランスさせ、本来の生成挙動を損なうことなく、知覚的に好適な出力への制御適応を可能にする。
広汎な実験により,本手法は世代多様性と訓練安定性を保ちながら知覚品質を継続的に向上し,拡散モデルに対するアンカー拘束型知覚最適化の有効性を強調した。
関連論文リスト
- Improving Visual Representation Alignment Generation with GRPO [51.071351994330605]
拡散変換器は強い画像合成能力を示したが、弱いアライメントのため、列車には非効率である。
本稿では,REPAの静的アライメント損失を生成的表現ポリシー最適化の目的に置き換える,強化に基づく最適化戦略であるVRPOを提案する。
当社のVRPO駆動トレーニングは拡散トランスフォーマーにシームレスに統合され、無視可能なコストを導入し、SiTとDiTアーキテクチャとの完全な互換性を維持します。
論文 参考訳(メタデータ) (2026-05-30T07:21:40Z) - A Systematic Post-Train Framework for Video Generation [76.26555417456773]
大規模ビデオ拡散モデルでは、高解像度でセマンティックにリッチなコンテンツを生成できることが顕著に示されている。
迅速な感度、時間的不整合、禁止的推論コストといった重要な問題のために、事前訓練されたパフォーマンスと実際のデプロイメント要件の間には、大きなギャップが残っている。
本研究では,事前学習されたモデルとユーザの意図を4つの相乗的段階を通して体系的に整合させる総合的なポストトレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-28T09:34:51Z) - Preference-Guided Debiasing for No-Reference Enhancement Image Quality Assessment [80.89893373505261]
我々は、非参照強調画像品質評価(EIQA)のための嗜好誘導型デバイアス化フレームワークを提案する。
提案手法は,アルゴリズムによる表現バイアスを効果的に緩和し,既存手法と比較して頑健性やアルゴリズム間の一般化に優れる。
論文 参考訳(メタデータ) (2026-03-20T16:07:34Z) - Adaptive Auxiliary Prompt Blending for Target-Faithful Diffusion Generation [6.826122099204317]
低密度領域における拡散過程を安定化させるために, 適応補助プロンプトブレンディング (AAPB) を導入する。
AAPBは、まれな概念生成におけるセマンティックサポートと、画像編集における構造的サポートを提供する。
RareBenchとFlowEditのデータセットに一貫した改善を実証的に示す。
論文 参考訳(メタデータ) (2026-03-19T17:12:03Z) - Q-Hawkeye: Reliable Visual Policy Optimization for Image Quality Assessment [25.916354359994624]
本稿では,RLに基づく信頼性の高い視覚ポリシー最適化フレームワークであるQ-Hawkeyeを提案する。
Q-Hawkeyeは、複数のロールアウトにまたがる予測スコアのばらつきを用いて予測の不確実性を推定する。
本稿では,実際の視覚的証拠に品質判断を根拠として,モデルに制約を与えるインプシット知覚損失を導入する。
論文 参考訳(メタデータ) (2026-01-30T12:42:32Z) - Toward the Frontiers of Reliable Diffusion Sampling via Adversarial Sinkhorn Attention Guidance [8.46069844016289]
Adversarial Sinkhorn Attention Guidance (ASAG) は、最適な輸送のレンズを通して拡散モデルの注意点を再解釈する新しい手法である。
注意機構を損なう代わりに、ASAGは、クエリとキー間のピクセル単位の類似性を減少させるために、自己注意層内に対向コストを注入する。
ASAGは、テキストと画像の拡散における一貫した改善を示し、IP-AdapterやControlNetといった下流アプリケーションにおける制御性と忠実性を高める。
論文 参考訳(メタデータ) (2025-11-10T15:52:53Z) - Solving Inverse Problems with FLAIR [68.87167940623318]
本稿では,フローベース生成モデルを逆問題に先立って活用する学習自由変分フレームワークFLAIRを提案する。
標準画像ベンチマークの結果、FLAIRは再現性やサンプルの多様性の観点から、既存の拡散法や流れ法よりも一貫して優れていることが示された。
論文 参考訳(メタデータ) (2025-06-03T09:29:47Z) - Enhancing Variational Autoencoders with Smooth Robust Latent Encoding [54.74721202894622]
変分オートエンコーダ(VAE)は拡散に基づく生成モデルをスケールアップする上で重要な役割を果たしている。
Smooth Robust Latent VAEは、世代品質とロバスト性の両方を向上する、新しい対向トレーニングフレームワークである。
実験により、SRL-VAEは、Nightshade攻撃や画像編集攻撃に対して、画像再構成とテキスト誘導画像編集において、生成品質とロバスト性の両方を改善することが示された。
論文 参考訳(メタデータ) (2025-04-24T03:17:57Z) - DP-IQA: Utilizing Diffusion Prior for Blind Image Quality Assessment in the Wild [73.6767681305851]
野生のブラインド画像品質評価(IQA)は重大な課題を呈している。
大規模なトレーニングデータの収集が困難であることを考えると、厳密な一般化モデルを開発するために限られたデータを活用することは、未解決の問題である。
事前訓練されたテキスト・ツー・イメージ(T2I)拡散モデルの堅牢な画像認識能力により,新しいIQA法,拡散先行に基づくIQAを提案する。
論文 参考訳(メタデータ) (2024-05-30T12:32:35Z) - JoReS-Diff: Joint Retinex and Semantic Priors in Diffusion Model for Low-light Image Enhancement [69.6035373784027]
低照度画像強調(LLIE)は条件付き拡散モデルを用いて有望な性能を実現している。
従来手法は、タスク固有の条件戦略の十分な定式化の重要性を無視するものであった。
本稿では,Retinex および semantic-based pre-processing condition を付加した新しいアプローチである JoReS-Diff を提案する。
論文 参考訳(メタデータ) (2023-12-20T08:05:57Z) - Unmasking Bias in Diffusion Model Training [40.90066994983719]
拡散モデルが画像生成の主流のアプローチとして登場した。
トレーニングの収束が遅く、サンプリングのカラーシフトの問題に悩まされている。
本稿では,これらの障害は,既定のトレーニングパラダイムに固有のバイアスや準最適性に大きく起因していると考えられる。
論文 参考訳(メタデータ) (2023-10-12T16:04:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。