論文の概要: EquiSteer: Cross-Attention Steering Towards a Fairer Text-Guided Image Generation
- arxiv url: http://arxiv.org/abs/2607.01147v1
- Date: Wed, 01 Jul 2026 16:28:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.991941
- Title: EquiSteer: Cross-Attention Steering Towards a Fairer Text-Guided Image Generation
- Title(参考訳): EquiSteer: テキストガイド画像生成のためのクロスアテンションステアリング
- Authors: Tatiana Gaintseva, Akshit Achara, Gregory Slabaugh, Jiankang Deng, Ismail Elezi,
- Abstract要約: 提案するEmphEquiSteerは,クロスアテンション(CA)アクティベーションを推論時に操ることで,サンプル毎に動作可能なトレーニングフリーな手法である。
SD-1.5、SD-2.1、SDXL、SANA全体で、EquiSteerは平均パリティギャップを最大87%まで削減し、画質とテキスト画像のアライメントに最小限の影響を与える。
- 参考スコア(独自算出の注目度): 51.23690901725835
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Text-to-image diffusion models power everyday creative tasks, but they still reproduce the demographic biases in their training data. On common prompts such as ``a photo of a nurse,'' ``a photo of a CEO'', they skew their outputs toward one gender, driven by the statistics of training data rather than anything in the text. Existing debiasing methods show promise in narrow settings but require retraining, batch-level control, or prompt-specific tuning, limiting their scalability. We propose \emph{EquiSteer}, a training-free method that works per sample by steering cross-attention (CA) activations at inference time. For each target attribute, EquiSteer precomputes steering vectors from contrastive prompts. Then at generation time, a prompt-aware gate leaves attribute-specific prompts untouched, while for neutral ones it clears existing attribute signals from the CA activations and injects a target attribute. Across SD-1.5, SD-2.1, SDXL, and SANA, EquiSteer reduces the average parity gap by up to $87\%$, with minimal effect on image quality and text-image alignment. Code is available at \href{https://github.com/Atmyre/EquiSteer}{https://github.com/Atmyre/EquiSteer}.%
- Abstract(参考訳): テキストから画像への拡散モデルは日々の創造的なタスクに役立ちますが、それでもトレーニングデータの人口統計バイアスを再現します。
ナースの写真」や「CEOの写真」といった一般的なプロンプトでは、テキストの何よりもトレーニングデータの統計によって、アウトプットを1つの性別に向けてスキューします。
既存のデバイアス手法は、狭い設定でpromiseを示すが、リトレーニング、バッチレベルの制御、あるいはプロンプト固有のチューニングを必要とし、スケーラビリティを制限している。
本研究では,クロスアテンション(CA)アクティベーションを推論時に操ることで,サンプルごとのトレーニング不要な手法であるemph{EquiSteer}を提案する。
それぞれのターゲット属性に対して、EquiSteerはコントラスト的なプロンプトからステアリングベクトルをプリコンプリートする。
その後、プロンプト対応ゲートは属性固有のプロンプトを無タッチで残し、中立な場合、既存の属性信号をCAアクティベーションから排除し、ターゲット属性を注入する。
SD-1.5、SD-2.1、SDXL、SANA全体で、EquiSteerは平均パリティギャップを最大8.7 %$に減らし、画質とテキスト画像のアライメントに最小限の影響を与える。
コードは \href{https://github.com/Atmyre/EquiSteer}{https://github.com/Atmyre/EquiSteer} で公開されている。
%であった。
関連論文リスト
- Subimage Overlap Prediction: Task-Aligned Self-Supervised Pretraining For Semantic Segmentation In Remote Sensing Imagery [2.2402058702736185]
Subimage Overlap Predictionは、リモートセンシング画像におけるセマンティックセグメンテーションを支援するための、新しい自己教師型事前訓練タスクである。
このタスクで事前学習を行うことで、下流セグメンテーションの性能は大幅に向上し、同等かそれ以上に向上することを示す。
論文 参考訳(メタデータ) (2026-01-05T04:28:49Z) - Grouped Speculative Decoding for Autoregressive Image Generation [7.729178060213871]
Grouped Speculative Decodingは、AR画像モデルのためのトレーニング不要のアクセラレーション手法である。
我々の詳細な分析では、言語と画像トークンの根本的な違いが明らかになっている。
我々は,単一のターゲットトークンに頼るのではなく,視覚的に有効なトークンのクラスタを評価する新しいSD戦略を提案する。
論文 参考訳(メタデータ) (2025-08-11T08:27:57Z) - Few-shot Learner Parameterization by Diffusion Time-steps [133.98320335394004]
大規模なマルチモーダル・ファンデーション・モデルを使用する場合、ほとんどショット・ラーニングは難しい。
我々は、失った属性を補うために、時間ステップFew-shot(TiF)学習者を提案する。
TiF学習者は、OpenCLIPとそのアダプタを様々な細粒度でカスタマイズされた数発の学習タスクで大幅に上回っている。
論文 参考訳(メタデータ) (2024-03-05T04:38:13Z) - Discriminative Class Tokens for Text-to-Image Diffusion Models [102.88033622546251]
自由形式のテキストの表現可能性を利用した非侵襲的な微調整手法を提案する。
本手法は,従来の微調整法と比較して高速で,クラス内の画像の収集を必要としない。
i)標準拡散モデルよりも正確で高品質な生成画像,(ii)低リソース環境でのトレーニングデータの拡張,および(iii)誘導分類器の訓練に使用されるデータ情報を明らかにする。
論文 参考訳(メタデータ) (2023-03-30T05:25:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。