論文の概要: UEmbed: Unified Sparse and Dense Multimodal Embeddings
- arxiv url: http://arxiv.org/abs/2608.02583v1
- Date: Mon, 03 Aug 2026 17:54:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.747526
- Title: UEmbed: Unified Sparse and Dense Multimodal Embeddings
- Title(参考訳): UEmbed: 統一スパースと高密度マルチモーダル埋め込み
- Abstract要約: 本稿では,デコーダのみのマルチモーダル埋め込みモデルUEmbedを紹介する。
緩やかな語彙と密度の表現を1つの因果前方通過で生成する。
UEmbedを2B、4B、9Bスケールでトレーニングし、公開されているデータに基づいてトレーニングされたマルチモーダル埋め込みモデルよりも優れています。
UEmbedは1つのモデルに密でスパースな埋め込みを統一し、さらにスパース検索を拡張してテキストとマルチモーダル入力を統一する、という新しいパラダイムを提供する。
- 参考スコア(独自算出の注目度): 56.1131203949042
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sparse retrieval underpins modern search systems, from web search to retrieval-augmented generation. Existing work has introduced Learned Sparse Retrieval (LSR) to push beyond exact lexical matching toward richer semantics. Yet LSR has so far remained tied to encoder-style bidirectional architectures, and its extension to multimodal settings still relies heavily on auxiliary cross-modal modules. To address these limitations, we introduce UEmbed (Unified Embedding), a decoder-only multimodal embedding model that produces both sparse lexical and dense representations in one causal forward pass. UEmbed appends N learnable special tokens to the input and partitions the vocabulary into N disjoint subsets. Each token's causal hidden state predicts sparse weights over its assigned subset, and the N subsets are concatenated into the full sparse vector. Trained on public data, we release UEmbed at 2B, 4B, and 9B scales. UEmbed-9B reaches 71.8 (dense) and 71.0 (sparse) on MMEB-v2, outperforming multimodal embedding models trained on publicly available data (e.g., RzenEmbed). On BEIR, UEmbed also remains competitive with strong dense and sparse baselines. Furthermore, we demonstrate the practical utility of UEmbed across three dimensions: effectiveness, efficiency, and agentic applications. Overall, UEmbed offers a new paradigm: it unifies dense and sparse embeddings in one model, while further extending sparse retrieval to unify text and multimodal inputs.
- Abstract(参考訳): スパース検索は、Web検索から検索強化世代まで、現代の検索システムを支える。
既存の研究はLearned Sparse Retrieval (LSR)を導入し、よりリッチなセマンティクスへ正確な語彙マッチングを推し進めた。
しかし、LSRはエンコーダスタイルの双方向アーキテクチャに依存しており、マルチモーダル設定への拡張はいまだに補助的なモジュールに依存している。
これらの制約に対処するため, UEmbed (Unified Embedding) というデコーダのみのマルチモーダル埋め込みモデルを導入する。
UEmbed は N の学習可能な特別なトークンを入力に追加し、語彙を N の非随伴部分集合に分割する。
各トークンの因果隠れ状態は割り当てられた部分集合上のスパース重みを予測し、Nの部分集合はフルスパースベクトルに連結される。
公開データに基づいて、UEmbedを2B、4B、9Bスケールでリリースします。
UEmbed-9B は MMEB-v2 上で 71.8 (dense) と 71.0 (sparse) に達する。
BEIRでは、UEmbedは強い密度と希薄なベースラインとの競争も継続している。
さらに, UEmbedの実用性は, 有効性, 効率性, エージェント的応用の3次元にわたって実証する。
UEmbedは1つのモデルに密でスパースな埋め込みを統一し、さらにスパース検索を拡張してテキストとマルチモーダル入力を統一する、という新しいパラダイムを提供する。
関連論文リスト
- Douyin Multimodal Embedding Model Technical Report [77.9018834072698]
マルチモーダル表現学習は、現代のAIの基盤となっている。
両強度を組み合わせた2段階のモデルであるDME(Douyin Multimodal Embedding)を提案する。
論文 参考訳(メタデータ) (2026-08-03T12:31:49Z) - On the Challenges and Opportunities of Learned Sparse Retrieval for Code [13.929722643500341]
SPLADE-Codeは、コード検索に特化した学習スパース検索モデルの最初の大規模ファミリである。
本研究では,SPLADE-Codeが1Bパラメータ下での検索者間の最先端性能を実現することを示す。
論文 参考訳(メタデータ) (2026-03-23T14:14:08Z) - Decomposing multimodal embedding spaces with group-sparse autoencoders [4.817429789586128]
クロスモーダルなランダムマスキングとグループスパース正規化を用いた多モード埋め込み分解のためのSAEに基づく新しい手法を提案する。
我々は,標準的なSAEと比較して,死んだニューロンの数を減らし,特徴的意味性を改善するとともに,より多モーダルな辞書を学習することを示す。
論文 参考訳(メタデータ) (2026-01-27T20:04:07Z) - Towards Unified Multimodal Misinformation Detection in Social Media: A Benchmark Dataset and Baseline [56.790045049514326]
詐欺の2つの主要な形態は、人造誤報とAI生成コンテンツである。
両形態の偽造を扱うためのフレームワークであるUMFDet(Unified Multimodal Fake Content Detection)を提案する。
UMFDetは、両方の誤情報型に対して堅牢で一貫したパフォーマンスを実現し、特殊ベースラインを上回っている。
論文 参考訳(メタデータ) (2025-09-30T09:26:32Z) - MetaEmbed: Scaling Multimodal Retrieval at Test-Time with Flexible Late Interaction [13.70527493534928]
マルチモーダル検索のための新しいフレームワークであるMetaEmbedを紹介する。
トレーニング中は、入力シーケンスに一定の数の学習可能なメタトークンが付加される。
テスト時には、その最後のレイヤのコンテキスト化表現はコンパクトだが表現力のあるマルチベクトル埋め込みとして機能する。
論文 参考訳(メタデータ) (2025-09-22T17:59:42Z) - SitEmb-v1.5: Improved Context-Aware Dense Retrieval for Semantic Association and Long Story Comprehension [77.93156509994994]
本研究では,検索性能を向上させるために,より広いコンテキストウインドウに条件付きで短いチャンクを表現する方法を示す。
既存の埋め込みモデルは、そのような場所のコンテキストを効果的にエンコードするのに十分な装備がない。
我々の手法は、最先端の埋め込みモデルよりも大幅に優れている。
論文 参考訳(メタデータ) (2025-08-03T23:59:31Z) - Multimodal Learned Sparse Retrieval with Probabilistic Expansion Control [66.78146440275093]
学習検索(LSR)は、クエリとドキュメントを疎語彙ベクトルにエンコードするニューラルネットワークのファミリーである。
テキスト画像検索に焦点をあて,マルチモーダル領域へのLSRの適用について検討する。
LexLIPやSTAIRのような現在のアプローチでは、大規模なデータセットで複雑なマルチステップのトレーニングが必要です。
提案手法は, 密度ベクトルを凍結密度モデルからスパース語彙ベクトルへ効率的に変換する。
論文 参考訳(メタデータ) (2024-02-27T14:21:56Z) - UnifieR: A Unified Retriever for Large-Scale Retrieval [84.61239936314597]
大規模な検索は、クエリを与えられた巨大なコレクションから関連ドキュメントをリコールすることである。
事前学習型言語モデル(PLM)に基づく最近の検索手法は,高密度ベクターあるいはレキシコンに基づくパラダイムに大別することができる。
本論文では,高密度ベクトルとレキシコンに基づく検索を2つの表現能力を持つ1つのモデルで統合する学習フレームワークUnifieRを提案する。
論文 参考訳(メタデータ) (2022-05-23T11:01:59Z) - Unsupervised Multimodal Language Representations using Convolutional
Autoencoders [5.464072883537924]
本稿では,教師なしマルチモーダル言語表現の抽出について提案する。
単語レベルのアライメントされたマルチモーダルシーケンスを2次元行列にマップし、畳み込みオートエンコーダを用いて複数のデータセットを組み合わせることで埋め込みを学習する。
また,本手法は非常に軽量で,他のタスクに容易に一般化でき,少ない性能低下とほぼ同じ数のパラメータを持つ未確認データが得られることを示した。
論文 参考訳(メタデータ) (2021-10-06T18:28:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。