論文の概要: Controlling Embedding Spaces with Text-Conditioned Transformations
- arxiv url: http://arxiv.org/abs/2607.22919v1
- Date: Fri, 24 Jul 2026 21:14:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.927662
- Title: Controlling Embedding Spaces with Text-Conditioned Transformations
- Title(参考訳): テキスト記述型変換による埋め込み空間の制御
- Abstract要約: 属性を明示的にアクセス可能にする視覚埋め込みのテキスト条件変換を提案する。
テキストの条件付けにより、多くの属性を同時に学習し、直感的なインターフェースを通じて推論時にそれらにアクセスすることができる。
- 参考スコア(独自算出の注目度): 54.94594915955756
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal embedding spaces in models like CLIP enable powerful capabilities such as semantic similarity retrieval and cross-modal zero-shot classification. These embeddings compress high-level semantics into a single vector, which comes at the cost of primarily expressing a dominant semantics like main object while suppressing other important attributes such as camera angle or color tone. We propose a text-conditioned transformation of visual embeddings that makes such attributes explicitly accessible. Given a natural language description of an attribute category (e.g., "color" or "art style"), a network generates an affine transformation that emphasizes the specified attribute. Conditioning on text enables it to learn many attributes simultaneously, accessing them at inference time through an intuitive interface. The network is trained to align transformed embeddings with the frozen latent space, enabling retrieval using existing large-scale embeddings without any re-encoding. When applied to a full set, the same mechanism transforms the latent space for attribute disentanglement tasks such as multi-clustering. By operating directly in latent space, our method provides a unified and efficient framework for controlling embedding spaces, demonstrating state-of-the-art performance across both attribute-based retrieval and multi-attribute organization tasks with near-zero inference cost. Project page: https://joefioresi718.github.io/ControlEmbed_webpage/
- Abstract(参考訳): CLIPのようなモデルにおけるマルチモーダル埋め込み空間は、セマンティック類似性検索やクロスモーダルゼロショット分類といった強力な機能を実現する。
これらの埋め込みは1つのベクトルにハイレベルなセマンティクスを圧縮するが、これは主にメインオブジェクトのような支配的なセマンティクスを表現し、カメラアングルやカラートーンのような他の重要な属性を抑圧するコストがかかる。
本稿では,このような属性を明示的にアクセス可能にする視覚埋め込みのテキスト条件変換を提案する。
属性カテゴリの自然言語記述(例:「カラー」または「アートスタイル」)が与えられた場合、ネットワークは特定の属性を強調するアフィン変換を生成する。
テキストの条件付けにより、多くの属性を同時に学習し、直感的なインターフェースを通じて推論時にそれらにアクセスすることができる。
ネットワークは、変換された埋め込みを凍結した潜伏空間に合わせるように訓練されており、既存の大規模な埋め込みを再エンコードせずに検索することができる。
完全集合に適用すると、同じ機構はマルチクラスタリングのような属性非絡み合いタスクの潜在空間を変換する。
提案手法は,遅延空間を直接操作することにより,組込み空間を制御し,属性ベースの検索と多属性組織タスクをほぼゼロの推論コストで実現し,最先端性能を示す。
プロジェクトページ:https://joefioresi718.github.io/ControlEmbed_webpage/
関連論文リスト
- GUIDED: Granular Understanding via Identification, Detection, and Discrimination for Fine-Grained Open-Vocabulary Object Detection [54.19989440021701]
細粒度オープン語彙オブジェクト検出(FG-OVD)は属性リッチテキストで記述された新しいオブジェクトカテゴリを検出することを目的としている。
FG-OVDは、非絡み合いモデリングとモジュラー最適化の利点を実証し、新しい最先端の結果を達成する。
論文 参考訳(メタデータ) (2026-03-27T22:08:11Z) - TokenCLIP: Token-wise Prompt Learning for Zero-shot Anomaly Detection [62.95726973851089]
TokenCLIPは、異常学習のためのトークンワイド適応フレームワークである。
視覚的なテキスト空間と学習可能なテキスト空間の動的アライメントを可能にし、微粒な異常学習を実現する。
論文 参考訳(メタデータ) (2025-10-24T05:51:31Z) - StyDeco: Unsupervised Style Transfer with Distilling Priors and Semantic Decoupling [5.12285618196312]
StyDecoは、スタイル転送タスクに適したテキスト表現を学習する教師なしのフレームワークである。
本フレームワークは, 構造的忠実度と構造的保存性の両方において, 既存手法より優れる。
論文 参考訳(メタデータ) (2025-08-02T06:17:23Z) - Compositional Caching for Training-free Open-vocabulary Attribute Detection [65.46250297408974]
オープンボキャブラリ属性検出のためのトレーニング不要なComcal Caching(ComCa)を提案する。
ComCaは、イメージの補助キャッシュをポップアップするために、ターゲット属性とオブジェクトのリストのみを入力として使用する。
パブリックデータセットの実験では、ComCaがゼロショットとキャッシュベースのベースラインを大幅に上回っていることが示されている。
論文 参考訳(メタデータ) (2025-03-24T21:00:37Z) - Dynamic Dictionary Learning for Remote Sensing Image Segmentation [22.457901431083645]
この研究は動的辞書学習フレームワークを導入し、反復的な洗練を通じてクラスIDの埋め込みを明示的にモデル化する。
その中核となる貢献は、クラス認識のセマンティック埋め込みが徐々に更新される新しい辞書構築メカニズムにある。
粗いデータセットときめ細かいデータセットの両方にわたる実験は、最先端の手法よりも一貫した改善を示している。
論文 参考訳(メタデータ) (2025-03-09T16:25:16Z) - Finetuning CLIP to Reason about Pairwise Differences [52.028073305958074]
本稿では,CLIPのような視覚言語モデルの学習手法を提案する。
画像間の差異のテキスト記述が画像埋め込み空間の差に対応するようにCLIPを微調整する。
提案手法は,特定の属性によって画像のランク付け能力を大幅に向上させ,下流画像分類タスクにおけるゼロショット分類性能を向上する。
論文 参考訳(メタデータ) (2024-09-15T13:02:14Z) - Text Attribute Control via Closed-Loop Disentanglement [72.2786244367634]
本稿では,コンテンツ保存性を高めつつ,属性のロバストな制御を実現するための新しい手法を提案する。
本稿では,半教師付きコントラスト学習法を用いて,潜在空間における属性のアンタングル化を促進する。
Yelp Serviceレビューデータセット、Amazon Product Reviewデータセット、GoEmotionsデータセットを含む3つのテキストデータセットの実験を行った。
論文 参考訳(メタデータ) (2023-12-01T01:26:38Z) - Distinguishability Calibration to In-Context Learning [31.375797763897104]
そこで本研究では, PLM符号化埋め込みを新しい距離空間にマッピングすることで, 埋め込みの識別性を保証する手法を提案する。
また、双曲的埋め込みの利点を生かして、粒度の細かいクラス関連トークン埋め込み間の階層的関係を捉える。
論文 参考訳(メタデータ) (2023-02-13T09:15:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。