論文の概要: Amplify What You Gaze At: Target Saliency Boosting in Text-to-Image Generation
- arxiv url: http://arxiv.org/abs/2609.30733v1
- Date: Fri, 25 Sep 2026 03:01:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.196315
- Title: Amplify What You Gaze At: Target Saliency Boosting in Text-to-Image Generation
- Title(参考訳): テキスト・ツー・イメージ・ジェネレーションの精度向上を狙う
- Abstract要約: テキスト・ツー・イメージ生成において、特定のオブジェクトの視覚的正当性を高めることを目的とした新しいタスクであるTarget Saliency Boostingを紹介する。
私たちの重要な洞察は、視覚的サリエンシは本質的に相対的であるということです。
本稿では,学習可能なマーカートークンをオブジェクト記述に挿入し,視覚的に強調・抑制すべきオブジェクトを示す。
- 参考スコア(独自算出の注目度): 13.752966730175226
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Text-to-image generation has advanced in controlling what, where, and how objects appear, yet how visual attention is distributed among objects remains largely unexplored. In this paper, we introduce Target Saliency Boosting, a new task aimed at boosting the visual saliency of a specific object during text-to-image generation without requiring any visual priors. Our key insight is that visual saliency is inherently relative: boosting the saliency of a target object also depends on the global saliency distribution across all objects in the scene. Based on this insight, we propose GazeME, a lightweight framework that uses saliency-marked prompts, inserting learnable marker tokens around object descriptions to indicate which objects to visually emphasize or suppress. To learn these markers, we construct a saliency-semantics dataset that associates objects in image--prompt pairs with object-level saliency scores, and propose Saliency Prior Marker Activation (SPMA), a saliency-aware stochastic marker activation strategy that exploits relative saliency relationships for robust training. During inference, GazeME automatically inserts appropriate markers into the prompt, thereby directly enhancing the visual saliency of the target object. Extensive experiments demonstrate that GazeME effectively boosts target saliency while preserving both semantic alignment and image quality.
- Abstract(参考訳): テキスト・ツー・イメージ生成は、オブジェクトがどこに、どのように、どのように現れるかを制御するために進歩してきたが、オブジェクト間でどのように視覚的な注意が分散されるかは、まだ明らかにされていない。
本稿では,テキスト・ツー・イメージ生成において,視覚的先行を必要とせず,特定のオブジェクトの視覚的正当性を高めることを目的とした新しいタスクであるTarget Saliency Boostingを紹介する。
私たちの重要な洞察は、視覚的サリエンシは本質的に相対的であり、ターゲットオブジェクトのサリエンシを高めることは、シーン内のすべてのオブジェクトのグローバルサリエンシ分布にも依存する、ということです。
本稿では,この知見に基づいて,学習可能なマーカートークンをオブジェクト記述に挿入し,視覚的に強調・抑制すべきオブジェクトを示す軽量フレームワークであるGazeMEを提案する。
これらのマーカーを学習するために、イメージプロンプトペア内のオブジェクトとオブジェクトレベルのサリエンシスコアを関連付けるサリエンシ・セマンティックデータセットを構築し、ロバストトレーニングのために相対サリエンシ関係を利用するサリエンシ対応確率的マーカーアクティベーション戦略であるサリエンシ優先マーカアクティベーション(SPMA)を提案する。
推論中、GazeMEは自動的に適切なマーカーをプロンプトに挿入し、ターゲットオブジェクトの視覚的正当性を直接向上する。
大規模な実験により、GazeMEはセマンティックアライメントと画質の両方を保ちながら、標的の塩分濃度を効果的に向上することが示された。
関連論文リスト
- Leveraging Text-to-Image Diffusion Models for Unsupervised Visual Object Tracking [53.08526613328243]
教師なしの視覚的オブジェクト追跡は、地味なアノテーションをトレーニングすることなく、任意のターゲットをビデオで追従する必要がある難しいタスクである。
我々はテキストから画像への拡散モデルを構築し、事前訓練されたモデルに符号化されたリッチな意味知識を活用する。
我々の方法Diff-Trackingは、初期プロンプト学習者とオンラインプロンプト更新者という2つの主要コンポーネントから構成されている。
論文 参考訳(メタデータ) (2026-05-26T12:26:56Z) - Steerable Visual Representations [72.39044430620977]
我々は、グローバルでローカルな機能を自然言語で操れるステアブルなビジュアル表現を紹介した。
また,本手法は,異常検出とパーソナライズされた対象の識別に専用アプローチを適合させ,性能を向上する。
論文 参考訳(メタデータ) (2026-04-02T17:59:49Z) - Unbiased Semantic Decoding with Vision Foundation Models for Few-shot Segmentation [36.731980769369834]
我々は,Segment Anything Model(SAM)と統合したunbiased Semantic Decoding(USD)戦略を提案する。
USD戦略は、一貫した予測を行うために、サポートセットとクエリセットの両方からターゲット情報を同時に抽出する。
ターゲット中心のプロンプト埋め込みを生成するために、学習可能なビジュアルテキストターゲットプロンプト生成器を提案する。
論文 参考訳(メタデータ) (2025-11-19T04:41:43Z) - In-Context Brush: Zero-shot Customized Subject Insertion with Context-Aware Latent Space Manipulation [41.79836820271156]
In-Context Brush"は、被写体挿入をカスタマイズするためのゼロショットフレームワークである。
オブジェクトイメージとテキストプロンプトをクロスモーダルなデモとして定式化する。
目標は、対象画像を、モデルチューニングなしでテキストプロンプトを整列する対象に塗布することである。
論文 参考訳(メタデータ) (2025-05-26T17:49:10Z) - Leveraging Unknown Objects to Construct Labeled-Unlabeled Meta-Relationships for Zero-Shot Object Navigation [14.336117107170153]
ゼロショットオブジェクトナビゲーション(ZSON)は、エージェントがトレーニングセットに存在しない未確認オブジェクトにナビゲートする状況に対処する。
ラベルのない物体を訓練手順に導入し、エージェントの知識基盤を識別可能だが、これまで見過ごされていた情報で強化する。
論文 参考訳(メタデータ) (2024-05-24T05:26:18Z) - Open-Vocabulary Camouflaged Object Segmentation [66.94945066779988]
OVCOS(Open-vocabulary camouflaged Object segmentation)を導入した。
我々は11,483個の手選択画像とそれに対応するオブジェクトクラスを含む大規模複合シーンデータセット(textbfOVCamo)を構築した。
クラスセマンティック知識の指導とエッジ情報と深度情報からの視覚構造的手がかりの補足を統合することにより、提案手法は効率よくカモフラージュされたオブジェクトを捕捉できる。
論文 参考訳(メタデータ) (2023-11-19T06:00:39Z) - CiteTracker: Correlating Image and Text for Visual Tracking [114.48653709286629]
我々は、画像とテキストを接続することで、視覚的トラッキングにおけるターゲットモデリングと推論を強化するCiteTrackerを提案する。
具体的には、ターゲット画像パッチを記述テキストに変換するテキスト生成モジュールを開発する。
次に、注目に基づく相関モジュールを用いて対象記述と検索画像を関連付け、対象状態参照のための相関特徴を生成する。
論文 参考訳(メタデータ) (2023-08-22T09:53:12Z) - Detector Guidance for Multi-Object Text-to-Image Generation [61.70018793720616]
Detector Guidance(DG)は、潜在オブジェクト検出モデルを統合して、生成プロセス中に異なるオブジェクトを分離する。
人間の評価は、DGが対立する概念の融合を防ぐのに8-22%の利点をもたらすことを示した。
論文 参考訳(メタデータ) (2023-06-04T02:33:12Z) - Learning Object Detection from Captions via Textual Scene Attributes [70.90708863394902]
キャプションには、オブジェクトの属性やそれらの関係など、画像に関するよりリッチな情報が含まれている、と我々は主張する。
本稿では,この「テキストシーングラフ」の属性を用いて物体検知器を訓練する手法を提案する。
得られたモデルが、いくつかの挑戦的なオブジェクト検出データセットに対して、最先端の結果を達成することを実証的に実証した。
論文 参考訳(メタデータ) (2020-09-30T10:59:20Z) - A Deep Learning Approach to Object Affordance Segmentation [31.221897360610114]
我々は,ビデオと静的画像の両方において,画素単位の価格ラベルを推定するオートエンコーダを設計する。
本モデルは,ソフトアテンション機構を用いて,オブジェクトラベルやバウンディングボックスの必要性を克服する。
本モデルは,SOR3D-AFF上での強い教師付き手法と比較して,競争力のある結果が得られることを示す。
論文 参考訳(メタデータ) (2020-04-18T15:34:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。