論文の概要: Concepts Complement Dense Semantics: Learning Compact Sparse Spaces for Text-Image Retrieval
- arxiv url: http://arxiv.org/abs/2609.32671v1
- Date: Sat, 26 Sep 2026 14:26:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 21:26:23.611118
- Title: Concepts Complement Dense Semantics: Learning Compact Sparse Spaces for Text-Image Retrieval
- Title(参考訳): テキスト画像検索のためのコンパクトなスパース空間を学習するコンピレーション・センス・セマンティックス
- Abstract要約: クロスモーダル検索は、画像とテキストを共有密度の埋め込み空間にエンコードする視覚言語事前学習モデルによって進められている。
本稿では,コーパスから視覚テキストの概念を抽出する,コンパクトで基礎的なスパース学習フレームワークGRASPを提案する。
軽量スパースヘッドは、各画像やテキストに関連する概念を予測するために訓練され、密接なセマンティックマッチングを補完する解釈可能な概念レベルの証拠が得られる。
- 参考スコア(独自算出の注目度): 19.877395609433062
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Cross-modal retrieval has been advanced by vision-language pre-trained models that encode images and texts into a shared dense embedding space. While dense representations effectively capture overall semantic similarity, they often obscure fine-grained visual-textual information needed for precise cross-modal matching. Recent methods introduce a learned sparse branch to complement dense matching with lexical evidence, but they rely on a redundant language-model token space and lack explicit grounding for sparse dimensions. We propose GRASP, a compact and grounded sparse learning framework that mines visual-textual concepts from the corpus. A lightweight sparse head is trained to predict concepts relevant to each image or text, yielding interpretable concept-level evidence that complements dense semantic matching. Extensive experiments show that GRASP improves retrieval accuracy over the state-of-the-art dense-sparse baselines while yielding a more compact and grounded sparse space.
- Abstract(参考訳): クロスモーダル検索は、画像とテキストを共有密度の埋め込み空間にエンコードする視覚言語事前学習モデルによって進められている。
濃密な表現は、全体的な意味的類似性を効果的にとらえるが、正確なクロスモーダルマッチングに必要な細粒度の視覚的・テクスチャ情報を隠蔽することが多い。
最近の手法では、語彙的証拠と密マッチングを補完するために、学習されたスパース分岐を導入するが、それらは冗長な言語モデルトークン空間に依存しており、スパース次元の明示的な基礎を欠いている。
本稿では,コーパスから視覚テキストの概念を抽出する,コンパクトで基礎的なスパース学習フレームワークGRASPを提案する。
軽量スパースヘッドは、各画像やテキストに関連する概念を予測するために訓練され、密接なセマンティックマッチングを補完する解釈可能な概念レベルの証拠が得られる。
広範囲な実験により、GRASPはよりコンパクトで接地されたスパース空間を得るとともに、最先端の高密度スパースベースラインの検索精度を向上させることが示されている。
関連論文リスト
- Rewrite Caption Semantics: Bridging Semantic Gaps for
Language-Supervised Semantic Segmentation [100.81837601210597]
本研究では,事前学習データにおける視覚的意味論とテキスト的意味論のギャップを埋めるための概念キュレーション(CoCu)を提案する。
CoCuは、最高にゼロショット転送性能を達成し、言語教師ありセグメンテーションベースラインを大きなマージンで大幅に向上させる。
論文 参考訳(メタデータ) (2023-09-24T00:05:39Z) - STAIR: Learning Sparse Text and Image Representation in Grounded Tokens [84.14528645941128]
疎結合なセマンティック表現を構築することは、密度の高いプレゼンテーションと同程度、あるいはそれ以上に強力であることを示す。
CLIPモデルを拡張してスパーステキストと画像表現(STAIR)を構築し、画像とテキストをスパーストークン空間にマッピングする。
CLIPモデルでは、+4.9%$と+4.3%$絶対リコール@1の改善で大幅にパフォーマンスが向上した。
論文 参考訳(メタデータ) (2023-01-30T17:21:30Z) - Fine-Grained Semantically Aligned Vision-Language Pre-Training [151.7372197904064]
大規模な視覚言語による事前学習は、幅広い下流タスクにおいて顕著な進歩を見せている。
既存の手法は主に、画像とテキストのグローバルな表現の類似性によって、モーダル間のアライメントをモデル化する。
ゲーム理論的相互作用の新たな視点から, 微粒なセマンティックアライメントを学習する, 微粒なセマンティックなvisiOn-langUage PrEトレーニングフレームワークであるLOを導入する。
論文 参考訳(メタデータ) (2022-08-04T07:51:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。