論文の概要: Multi-Axis Max@K Reinforcement Learning for Representative Diversity in Text-to-Image Generation
- arxiv url: http://arxiv.org/abs/2607.14962v1
- Date: Thu, 16 Jul 2026 13:14:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.118108
- Title: Multi-Axis Max@K Reinforcement Learning for Representative Diversity in Text-to-Image Generation
- Title(参考訳): テキスト・画像生成における多軸Max@K強化学習
- Abstract要約: テキスト・トゥ・イメージ(T2I)モデルはリアルでプロンプト・アラインなイメージを合成できるが、同じプロンプトで生成されたサンプルはしばしば視覚的に異なるモードの小さなサブセットのみをカバーする。
我々は、この問題を、ターゲットモードカバレッジと呼ばれる、セマンティック指定モードの事前定義されたセットのカバレッジとして定式化する。
次に、T2Iモデルにおけるそのようなカバレッジを改善するために、グループベースの強化学習目的である、多重軸max@Kを提案する。
- 参考スコア(独自算出の注目度): 29.478072341221722
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Text-to-image (T2I) models can synthesize realistic, prompt-aligned images, yet samples generated for the same prompt often cover only a small subset of visually distinct modes. This limits the diversity of images, and for person-centric prompts, can reflect or amplify demographic skew. We formalize this problem as coverage of a predefined set of semantically specified modes, which we call target-mode coverage. We then propose multi-axis max@K, a group-based reinforcement learning objective for improving such coverage in diffusion-based T2I models. Given a group of samples and one score per target category, multi-axis max@K first takes the maximum score across samples for each category and then sums these category-wise maxima. The resulting credit assignment gives a sample positive weight on a category only when it increases that category's group-wise maximum, allowing different samples to contribute to different categories. We first validate the credit-assignment mechanism on a synthetic mixture and on SD3.5-M using deterministic pixel-based color rewards. We then evaluate the same objective on perceived-appearance fairness. Across three automatic evaluators on held-out prompts, multi-axis max@K improves the Fairness Score by 0.23-0.36 relative to the base model, while maintaining image quality and text alignment.
- Abstract(参考訳): テキスト・トゥ・イメージ(T2I)モデルはリアルでプロンプト・アラインなイメージを合成できるが、同じプロンプトで生成されたサンプルはしばしば視覚的に異なるモードの小さなサブセットのみをカバーする。
これにより、画像の多様性が制限され、人中心のプロンプトは、人口統計学的な歪を反映または増幅することができる。
我々は、この問題を、ターゲットモードカバレッジと呼ばれる、セマンティック指定モードの事前定義されたセットのカバレッジとして定式化する。
次に、拡散型T2Iモデルにおいて、そのようなカバレッジを改善するためのグループベース強化学習目標である、多重軸max@Kを提案する。
サンプルのグループと対象カテゴリ毎のスコアが与えられた場合、multi-ax max@K はまず各カテゴリのサンプルごとの最大スコアを取得し、次にこれらのカテゴリごとの最大スコアを和算する。
結果として得られたクレジット代入は、カテゴリの集団的な最大値を増やす場合にのみ、カテゴリに対するサンプルの正の重みを与え、異なるサンプルが異なるカテゴリに寄与できるようにする。
筆者らはまず, 合成混合物とSD3.5-M上のクレジット割り当て機構を, 決定論的画素ベースの色報酬を用いて検証した。
次に,知覚的外観の公平性について,同じ目的を定めている。
ホールドアウトプロンプトに関する3つの自動評価器のうち、複数軸max@Kは、画質とテキストアライメントを維持しながら、ベースモデルに対してFairness Scoreを0.23-0.36改善する。
関連論文リスト
- Bridging the Gap: Aligning Text-to-Image Diffusion Models with Specific Feedback [5.415802995586328]
フィードバックからの学習は、テキスト間拡散モデルにおけるテキストプロンプトと画像の整合性を高めることが示されている。
本稿では,3段階を含む特定の報酬目標を持つ効率的な微動法を提案する。
このベンチマークによる実験結果から,本モデルはアライメントと忠実度の両方において,他のSOTA法よりも優れていることがわかった。
論文 参考訳(メタデータ) (2024-11-28T09:56:28Z) - A consensus-constrained parsimonious Gaussian mixture model for clustering hyperspectral images [0.0]
食品エンジニアは、ハイパースペクトル画像を使用して、食品サンプルのタイプと品質を分類する。
これらの手法を訓練するには、各トレーニング画像の各ピクセルにラベルを付ける必要がある。
ハイパースペクトル画像に画素をラベル付けするために, コンセンサス制約付き擬似ガウス混合モデル (ccPGMM) を提案する。
論文 参考訳(メタデータ) (2024-03-05T22:23:43Z) - Adversarial AutoMixup [50.1874436169571]
本稿では,AdAutomixupを提案する。
画像分類のための堅牢な分類器を訓練するために、挑戦的なサンプルを生成する。
本手法は, 様々な分類シナリオにおいて, 技術状況に優れる。
論文 参考訳(メタデータ) (2023-12-19T08:55:00Z) - Diversified in-domain synthesis with efficient fine-tuning for few-shot
classification [64.86872227580866]
画像分類は,クラスごとのラベル付き例の小さなセットのみを用いて,画像分類器の学習を目的としている。
合成データを用いた数ショット学習における一般化問題に対処する新しいアプローチである DisEF を提案する。
提案手法を10種類のベンチマークで検証し,ベースラインを一貫して上回り,数ショット分類のための新しい最先端の手法を確立した。
論文 参考訳(メタデータ) (2023-12-05T17:18:09Z) - Matcher: Segment Anything with One Shot Using All-Purpose Feature
Matching [63.88319217738223]
市販の視覚基礎モデルを用いて様々な知覚課題に対処する新しい知覚パラダイムであるMatcherを提案する。
Matcherは、様々なセグメンテーションタスクにまたがる印象的な一般化パフォーマンスを、すべてトレーニングなしでデモする。
我々の結果は、野生の画像に適用されたMatcherのオープンワールドの一般性と柔軟性をさらに示すものである。
論文 参考訳(メタデータ) (2023-05-22T17:59:43Z) - High-fidelity Pseudo-labels for Boosting Weakly-Supervised Segmentation [17.804090651425955]
画像レベルの弱い教師付きセグメンテーション(WSSS)は、トレーニング中にセグメンテーションマスクを代理することで、通常膨大なデータアノテーションコストを削減する。
本研究は,GAPの代替となる重要サンプリングと特徴類似性損失という,CAMを改善するための2つの手法に基づく。
複数の独立二項問題の後部二項問題に基づいて両手法を再構成する。
パフォーマンスが向上し、より一般的なものになり、事実上あらゆるWSSSメソッドを増強できるアドオンメソッドが出来上がります。
論文 参考訳(メタデータ) (2023-04-05T17:43:57Z) - Generating Representative Samples for Few-Shot Classification [8.62483598990205]
クラスごとの視覚的なサンプルで新しいカテゴリを学習することを目的としている。
データ不足によってクラス表現がバイアスを受ける場合が少なくない。
条件付き変分オートエンコーダモデルを用いて,意味的埋め込みに基づく視覚サンプルを生成する。
論文 参考訳(メタデータ) (2022-05-05T20:58:33Z) - Rank-Consistency Deep Hashing for Scalable Multi-Label Image Search [90.30623718137244]
スケーラブルなマルチラベル画像検索のための新しいディープハッシュ法を提案する。
2つの空間の類似性順序を整列するために、新しい階数整合性目的を適用した。
強力な損失関数は、意味的類似性とハミング距離が一致しないサンプルをペナルティ化するように設計されている。
論文 参考訳(メタデータ) (2021-02-02T13:46:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。