論文の概要: Learning Late, Guiding Early: Timestep-Decoupled Semantic Guidance for Fair Face Generation
- arxiv url: http://arxiv.org/abs/2608.25862v1
- Date: Wed, 26 Aug 2026 14:36:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.865121
- Title: Learning Late, Guiding Early: Timestep-Decoupled Semantic Guidance for Fair Face Generation
- Title(参考訳): 学習の遅さと早期指導: 公正な顔生成のための時間分解型セマンティックガイダンス
- Authors: Subir Kumar Parida, Rajbabu Velmurugan, Ketan Kotwal, R. S. Sengar, Swati Hiremath,
- Abstract要約: 本稿では,リバース・デノケーション中の一発的介入による人口動態誘導を行う推論時フレームワークであるセマンティック境界予測器(SBP)を紹介する。
SBPは、後期潜在表現から線形意味境界を学習し、初期雑音潜在表現でのみ適用する。
CelebA-HQでの実験では、人口の公平さが大幅に改善され、男女差が98%減り、二連レースが95%、四等レースが15%減少した。
- 参考スコア(独自算出の注目度): 2.2993779624428208
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Demographic imbalance in synthetic face generation can propagate to downstream face recognition systems, making fairness an important consideration when diffusion models are used for data generation. Existing fairness-aware generation approaches often require model retraining, architectural modifications, or repeated guidance throughout the reverse diffusion process. In this work, we introduce Semantic Boundary Predictor (SBP), an inference-time framework that performs demographic guidance through a one-shot intervention during reverse denoising. Our approach is motivated by the observation that latent representations at different diffusion timesteps play distinct semantic roles: late-stage latents provide stronger demographic separability, whereas early-stage latents offer greater flexibility for semantic intervention. SBP leverages this timestep decoupling by learning linear semantic boundaries from late-stage latent representations while applying them only once at the initial noisy latent, allowing the remainder of the reverse denoising process to proceed unchanged. The method requires neither retraining nor fine-tuning of the underlying Latent Diffusion Model and operates without external balanced datasets. Experiments on CelebA-HQ demonstrate substantial improvements in demographic fairness, reducing fairness disparity by 98% for gender, 95% for binary race, and 15% for four-class race, while maintaining perceptual image quality across demographic groups. Owing to its one-shot inference strategy and model-agnostic design, SBP introduces only a small computational overhead and can be readily integrated with existing pre-trained latent diffusion models.
- Abstract(参考訳): 合成顔生成におけるデモグラフィック不均衡は、下流の顔認識システムに伝播し、データ生成に拡散モデルを用いる場合、公平性は重要な考慮事項となる。
既存の公正を意識した生成アプローチでは、しばしばモデルの再訓練、アーキテクチャの変更、あるいは逆拡散プロセスを通して繰り返しのガイダンスが必要となる。
本研究では,逆復調時の一発的介入による人口統計誘導を行う推論時フレームワークであるセマンティック境界予測器(SBP)について紹介する。
我々のアプローチは、異なる拡散段階における潜在表現が異なる意味的役割を担っているという観察に動機づけられている。
SBPはこのタイムステップデカップリングを利用して、後期潜在表現から線形意味境界を学習し、初期雑音潜在表現で1回だけ適用することで、逆復調過程の残りを継続することができる。
この方法は、基礎となる潜在拡散モデルの再トレーニングや微調整を必要とせず、外部のバランスの取れたデータセットなしで運用する。
CelebA-HQの実験は、人口動態の公平性を大幅に改善し、男女差を98%減らし、二級レースで95%、四級レースで15%減らした。
単発推論戦略とモデルに依存しない設計のため、SBPは計算オーバーヘッドが小さく、既存のトレーニング済み潜在拡散モデルと容易に統合できる。
関連論文リスト
- Probing Diffusion Denoising Dynamics for Contrastive Representation Learning [48.679227622825806]
本研究では,事前学習した拡散モデルの認知力学を識別的表現学習に適応させる方法について検討する。
D$3$CL をこの問題の調査として提示する。
雑音レベルのコントラスト学習は、生成性能を維持しつつ、識別的タスクの認知表現を構造化できることを示す。
論文 参考訳(メタデータ) (2026-07-10T03:23:44Z) - Training-Free Debiasing of Diffusion Models via CLIP-Guided Denoising Optimization [15.96706698967133]
テキスト埋め込みステアリング(Text Embedding Steering, TES)は、拡散過程中に条件付きテキストの埋め込みを直接最適化することにより、人口統計バイアスを緩和するトレーニング不要のフレームワークである。
モデルパラメータを変更することなく、安定かつ制御可能な属性ステアリングを可能にする2段階戦略(アーリーステージグローバルアライメント、続いてCLIPベースのフィードバックによる反復的デノジング時間改善)が実現可能であることを示す。
論文 参考訳(メタデータ) (2026-07-01T11:41:40Z) - Temporal Difference Learning for Diffusion Models [19.82560792699663]
本稿では,モデルの多段階進行の不整合を抑えるための時間差(TD)手法を提案する。
そこで本研究では,トレーニングを安定化するサンプルベース再重み付け手法を提案する。
論文 参考訳(メタデータ) (2026-06-13T01:34:04Z) - Interpolating Discrete Diffusion Models with Controllable Resampling [49.771004594828405]
仮面拡散モデルは初期解凍による不可逆誤差に悩まされる。
自己補正が可能であるにもかかわらず、一様拡散モデルは、しばしば低品質のサンプルを生成する。
本稿では,中間潜伏状態への依存を減らすことで拡散を改善する補間離散拡散モデルを提案する。
論文 参考訳(メタデータ) (2026-04-19T07:55:57Z) - Hybrid Autoregressive-Diffusion Model for Real-Time Sign Language Production [0.0]
我々は手話生成のための自己回帰モデルと拡散モデルを組み合わせたハイブリッドアプローチを開発する。
微粒な体の動きを捉えるため,異なる音節から細かな特徴を別々に抽出するマルチスケール・ポース表現モジュールを設計した。
ポーズ生成過程を動的に導くために,共同レベルの信頼度スコアを利用する信頼度対応型因果注意機構を導入する。
論文 参考訳(メタデータ) (2025-07-12T01:34:50Z) - Exploring Representation-Aligned Latent Space for Better Generation [86.45670422239317]
生成性能を改善するために,セマンティックな事前情報を統合するReaLSを導入する。
本研究では、ReaLSでトレーニングされたDETとSiTが、FID測定値の15%改善を実現することを示す。
拡張されたセマンティック潜在空間は、セグメンテーションや深さ推定のようなより知覚的な下流タスクを可能にする。
論文 参考訳(メタデータ) (2025-02-01T07:42:12Z) - Self-Play Fine-Tuning of Diffusion Models for Text-to-Image Generation [59.184980778643464]
ファインチューニング拡散モデル : 生成人工知能(GenAI)の最前線
本稿では,拡散モデル(SPIN-Diffusion)のための自己演奏ファインチューニングという革新的な手法を紹介する。
提案手法は従来の教師付き微調整とRL戦略の代替として,モデル性能とアライメントの両方を大幅に改善する。
論文 参考訳(メタデータ) (2024-02-15T18:59:18Z) - Bridging Generative and Discriminative Models for Unified Visual
Perception with Diffusion Priors [56.82596340418697]
本稿では,豊富な生成前駆体を含む事前学習型安定拡散(SD)モデルと,階層的表現を統合可能な統一型ヘッド(Uヘッド)と,識別前駆体を提供する適応型専門家からなる,シンプルで効果的なフレームワークを提案する。
包括的調査では、異なる時間ステップで潜伏変数に隠された知覚の粒度や様々なU-netステージなど、バーマスの潜在的な特性が明らかになった。
有望な結果は,有望な学習者としての拡散モデルの可能性を示し,情報的かつ堅牢な視覚表現の確立にその意義を定めている。
論文 参考訳(メタデータ) (2024-01-29T10:36:57Z) - One More Step: A Versatile Plug-and-Play Module for Rectifying Diffusion
Schedule Flaws and Enhancing Low-Frequency Controls [77.42510898755037]
One More Step (OMS) は、推論中に単純だが効果的なステップを付加したコンパクトネットワークである。
OMSは画像の忠実度を高め、トレーニングと推論の二分法を調和させ、元のモデルパラメータを保存する。
トレーニングが完了すると、同じ潜在ドメインを持つ様々な事前訓練された拡散モデルが同じOMSモジュールを共有することができる。
論文 参考訳(メタデータ) (2023-11-27T12:02:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。