論文の概要: Anchoring and Steering Diffusion: Enhancing the Faithfulness of Text-to-Image Generation at Inference Time
- arxiv url: http://arxiv.org/abs/2607.26647v1
- Date: Wed, 29 Jul 2026 09:08:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.606581
- Title: Anchoring and Steering Diffusion: Enhancing the Faithfulness of Text-to-Image Generation at Inference Time
- Title(参考訳): アンコリングとステアリング拡散:推論時間におけるテキスト・画像生成の忠実度を高める
- Authors: Xinyi Wang, Yuyang Huang, Yalin Su, Pengcheng Luan, Tao Zhang, Feiming Wei, Wenxian Yu,
- Abstract要約: AnchorSteerは、きめ細かい制御を行う、トレーニング不要のフレームワークである。
textbfAnchorSteerとそのコンポーネント。
GenEvalとT2I-CompBench++の実験は、AnchorSteerがテキストのアライメントにおいて既存のベースラインを一貫して上回っていることを示している。
- 参考スコア(独自算出の注目度): 16.04233421396159
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While text-to-image diffusion models achieve impressive visual quality, they frequently struggle to maintain precise alignment with complex compositional prompts. An effective strategy is to improve the inference process of diffusion models, thereby better leveraging their pretrained priors to address misalignment. Existing training-free methods can be divided into two categories. The first category focuses on improving the randomly sampled initial noise, either performing costly search over noise pools or manipulating sampled noise without ensuring reliable semantic injection. The second category focuses on improving the denoising trajectory, lacking explicit mechanisms to timely diagnose and correct semantic errors. we propose \textbf{AnchorSteer}, a training-free framework that exerts fine-grained control over \textbf{both initialization} and \textbf{the denoising trajectory}. AnchorSteer consists of two synergistic components: \textbf{Semantic Anchoring} replaces uninformative Gaussian noise with text-aligned initializations via CLIP-based prior extraction and a novel Latent-Prior Score Distillation Sampling (LP-SDS) objective. Specifically, LP-SDS distills CLIP visual priors into the knowledge distribution of diffusion models, mitigating the domain gap between CLIP-based priors and diffusion-based priors. \textbf{Reflective Steering} transforms passive denoising with an active Think--Erase--Retouch loop that enables mid-generation self-correction. It leverages VLM-based diagnosis to detect semantic deviations and performs targeted latent refinement to suppress erroneous content and recover missing attributes. Extensive experiments on GenEval and T2I-CompBench++ demonstrate that AnchorSteer consistently outperforms existing baselines in text--image alignment while preserving high visual quality.
- Abstract(参考訳): テキストから画像への拡散モデルは印象的な視覚的品質を達成するが、複雑な構成的プロンプトとの正確な整合性を維持するのにしばしば苦労する。
効果的な戦略は拡散モデルの推論プロセスを改善することである。
既存のトレーニングフリーの手法は2つのカテゴリに分けられる。
第1のカテゴリは、ランダムにサンプリングされた初期ノイズを改善することに焦点を当て、ノイズプールをコストで探索するか、信頼できるセマンティックインジェクションを保証せずにサンプルノイズを操作する。
第2のカテゴリは、意味的誤りをタイムリーに診断し、正すための明確なメカニズムが欠如している、聴覚的軌道を改善することに焦点を当てている。
本稿では, トレーニング不要なフレームワークである \textbf{AnchorSteer} と \textbf{the denoising trajectory} について, きめ細かい制御を行う。
AnchorSteerは2つの相乗的コンポーネントで構成されている: \textbf{Semantic Anchoring} は非形式的なガウスノイズをCLIPベースの事前抽出によるテキスト整列初期化と、新しいLP-SDS(Latent-Prior Score Distillation Sampling)の目的に置き換える。
具体的には、LP-SDSは、CLIPの視覚的先行を拡散モデルの知識分布に蒸留し、CLIPに基づく先行と拡散に基づく先行との領域ギャップを緩和する。
\textbf{Reflective Steering}は、中世代の自己補正を可能にするアクティブなThink-Erase--Retouchループで受動的復調を変換する。
VLMに基づく診断を利用して意味的偏差を検知し、不正な内容の抑制と欠落した属性の回復を目標とした潜在性改善を行う。
GenEvalとT2I-CompBench++に関する大規模な実験によると、AnchorSteerは、高い視覚的品質を維持しながら、テキストアライメントにおいて、既存のベースラインを一貫して上回っている。
関連論文リスト
- UniNDM: A Unified Noise-driven Detection and Mitigation Framework Against Sexual Content in Text-to-Image Generation [90.0896070825457]
本稿では,拡散過程におけるノイズダイナミクスのレンズを通して,安全機構を再考する統合ノイズ駆動フレームワークを提案する。
我々の重要な洞察は、早期の予測ノイズは、正常な内容と性的な内容の間に固有の分離性を示すことである。
我々は,計算オーバーヘッドがほとんどなく,精度の高い軽量ノイズベース検出器を開発した。
論文 参考訳(メタデータ) (2026-07-18T14:03:39Z) - A Step Towards Robust Unsupervised Domain Adaptation via Fine-Tuning and Reinforcement Learning [2.436631469537453]
我々は,2段階の堅牢なUDAフレームワークである textbfSFT+RL を提案し,Supervised Fine Tuning と Reinforcement Learning を統合した。
textbfSFT+RLは、清潔な精度で textbf10.2% を平均的に改善し、textbf15.8% を3つのデータセットで比較した。
論文 参考訳(メタデータ) (2026-07-03T20:56:12Z) - PRISM: Prior Rectification and Uncertainty-Aware Structure Modeling for Diffusion-Based Text Image Super-Resolution [51.96078493242164]
PRISMは単一ステップ拡散ベースのText-SRフレームワークである。
PRISMはミリ秒レベルの推論で最先端の性能を達成する。
論文 参考訳(メタデータ) (2026-05-13T05:31:06Z) - V-Co: A Closer Look at Visual Representation Alignment via Co-Denoising [65.5867130156805]
統合JTフレームワークにおける視覚的コデノゲーションの体系的研究であるV-Coについて述べる。
本研究は,視覚的コデノジングを効果的に行うための4つの重要な要素を明らかにする。
V-Coは、基礎となる画素空間拡散ベースラインと強い前の画素拡散法より優れている。
論文 参考訳(メタデータ) (2026-03-17T17:01:54Z) - Context-Aware Initialization for Reducing Generative Path Length in Diffusion Language Models [0.0]
DLLM(Large Language Models)は完全な並列トークン復号を可能にするが、推論時には実用的でないことが多い。
既存の加速法の多くは、改良された解法やサンプリング戦略を通じて、この生成軌道をより効率的にトラバースすることに焦点を当てている。
本稿では,軽量補助モデルから拡散初期化に事前条件付き事前条件を注入する学習自由インタフェースを提案する。
インジェクションされたプリエントは不完全であり、アンマスクのみのデコーディングは早期に過剰にコミットできるため、プリエントベースのリメイキング機構を事前の懐疑論の一形態として導入する。
論文 参考訳(メタデータ) (2025-12-22T03:45:04Z) - InfSplign: Inference-Time Spatial Alignment of Text-to-Image Diffusion Models [27.206678799411645]
InfSplignは、テキスト・ツー・イメージ・モデルのためのトレーニング不要な推論時間法である。
除音ステップ毎に複合損失によってノイズを調整することで空間アライメントを改善する。
既存の最強の推論時間ベースラインよりもパフォーマンスが大幅に向上する。
論文 参考訳(メタデータ) (2025-12-19T17:52:43Z) - Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion [52.315729095824906]
MLLM Semantic-Corrected Ping-Pong-Ahead Diffusion (PPAD) は,マルチモーダル大言語モデル(MLLM)を推論中の意味的オブザーバとして導入する新しいフレームワークである。
中間世代をリアルタイムに分析し、潜在意味的不整合を識別し、フィードバックを制御可能な信号に変換し、残りの認知ステップを積極的に導く。
大規模な実験ではPPADの大幅な改善が示されている。
論文 参考訳(メタデータ) (2025-05-26T14:42:35Z) - Improving Consistency in Diffusion Models for Image Super-Resolution [28.945663118445037]
拡散法における2種類の矛盾を観測する。
セマンティックとトレーニング-推論の組み合わせを扱うために、ConsisSRを導入します。
本手法は,既存拡散モデルにおける最先端性能を示す。
論文 参考訳(メタデータ) (2024-10-17T17:41:52Z) - Improving Adversarial Robustness of Masked Autoencoders via Test-time
Frequency-domain Prompting [133.55037976429088]
BERTプリトレーニング(BEiT, MAE)を備えた視覚変換器の対向ロバスト性について検討する。
意外な観察は、MAEが他のBERT事前訓練法よりも敵の頑健さが著しく悪いことである。
我々は,MAEの対角的堅牢性を高めるための,シンプルで効果的な方法を提案する。
論文 参考訳(メタデータ) (2023-08-20T16:27:17Z) - Boosting Few-shot Fine-grained Recognition with Background Suppression
and Foreground Alignment [53.401889855278704]
FS-FGR (Few-shot Fine-fine Recognition) は、限られたサンプルの助けを借りて、新しいきめ細かなカテゴリを認識することを目的としている。
本研究では,背景アクティベーション抑制 (BAS) モジュール,フォアグラウンドオブジェクトアライメント (FOA) モジュール,および局所的局所的(L2L) 類似度測定器からなる2段階の背景アライメントとフォアグラウンドアライメントフレームワークを提案する。
複数のベンチマークで行った実験により,提案手法は既存の最先端技術よりも大きなマージンで優れていることが示された。
論文 参考訳(メタデータ) (2022-10-04T07:54:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。