論文の概要: Your Embedding Model is SMARTer Than You Think
- arxiv url: http://arxiv.org/abs/2605.24938v1
- Date: Sun, 24 May 2026 08:36:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 19:50:18.525282
- Title: Your Embedding Model is SMARTer Than You Think
- Title(参考訳): あなたの埋め込みモデルは、想像以上にSMARTです
- Authors: Jianrui Zhang, Hyun Jung Lee, Sukanta Ganguly, Tae-Eui Kam, Donghyun Kim, Yong Jae Lee,
- Abstract要約: マルチモーダル検索は、リッチでシーケンシャルなトークンシーケンスを単一のグローバル表現に圧縮する単一ベクトルレトリバーに大きく依存する。
SMARTは、標準の単一ベクトルモデルの潜在マルチベクトル能力を解放するフレームワークである。
SMARTの優れたパフォーマンスも明らかにしています。単純な軽量なポストトレーニングは時間と計算時間を節約するだけでなく、ビジュアルドキュメント検索をさらに改善します。
- 参考スコア(独自算出の注目度): 34.89235585294595
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal retrieval relies heavily on single-vector retrievers, which compress rich, sequential token sequences into one single global representation. While efficient, they discard fine-grained, local evidence critical for dense retrieval tasks. Multi-vector approaches were introduced as a solution, but they strictly require training and many ignore the necessity of a globally summarizing representation. To address this, we introduce SMART, a framework that unlocks the latent multi-vector capabilities of standard single-vector models. We first demonstrate that standard contrastive training on the pooled embedding implicitly shapes the retrieval geometry of preceding hidden states via gradient flow. By applying direct late-interaction over these frozen hidden states during inference, SMART acts as a plug-and-play upgrade that consistently improves performance across diverse modalities, improving even the state-of-the-art models further on MMEB-V2. We also reveal SMART's superior performance, as simple lightweight post-training not only saves time and compute, but also brings forth further improvement on Visual Document retrieval, allowing a single-vector model to outperform SoTA multi-vector counterparts. Ultimately, SMART offers both a highly efficient inference enhancement and a powerful finetuning technique for multimodal retrieval. We open source our code and weights at https://github.com/HanSolo9682/SMART.
- Abstract(参考訳): マルチモーダル検索は、リッチでシーケンシャルなトークンシーケンスを単一のグローバル表現に圧縮する単一ベクトルレトリバーに大きく依存する。
効率性はあるものの、密集した検索作業において重要な、きめ細かい局所的な証拠を捨てる。
マルチベクトルアプローチはソリューションとして導入されたが、厳密な訓練が必要であり、大域的な要約表現の必要性を無視する者も多い。
SMARTは、標準の単一ベクトルモデルの潜在マルチベクトル能力を解放するフレームワークである。
まず,プール埋め込みにおける標準的なコントラストトレーニングが,勾配流による先行隠蔽状態の探索幾何学を暗黙的に形作っていることを実証した。
推論中にこれらの凍結した隠れ状態に対して直接遅延処理を適用することで、SMARTはプラグイン・アンド・プレイのアップグレードとして機能し、様々なモダリティにわたるパフォーマンスを一貫して改善し、MMEB-V2上での最先端モデルでさえ改善する。
また、SMARTの優れた性能も明らかにし、単純な軽量なポストトレーニングは時間と計算時間を節約するだけでなく、Visual Document検索をさらに改善し、シングルベクターモデルがSoTAマルチベクターモデルを上回るパフォーマンスを実現した。
最終的にSMARTは、高効率な推論拡張と、マルチモーダル検索のための強力な微調整技術の両方を提供する。
コードと重みはhttps://github.com/HanSolo9682/SMART.comで公開しています。
関連論文リスト
- LEMUR: Learned Multi-Vector Retrieval [9.22384870426709]
マルチベクタ類似度探索のためのフレームワーク LEMUR を紹介する。
LEMURは2つの連続した問題削減で構成されている。
LEMURは、従来のマルチベクトル類似性探索法よりも桁違いに高速である。
論文 参考訳(メタデータ) (2026-01-29T15:26:32Z) - OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generation [91.45421429922506]
OneCATは、理解、生成、編集をシームレスに統合する統合マルチモーダルモデルである。
我々のフレームワークは、推論中に視覚変換器(ViT)や視覚トークン化器などの外部コンポーネントを不要にする。
論文 参考訳(メタデータ) (2025-09-03T17:29:50Z) - PyLate: Flexible Training and Retrieval for Late Interaction Models [3.737581531719168]
マルチベクタアーキテクチャをサポートするために,Sentence Transformer上に構築されたライブラリであるPyLateを紹介した。
PyLateは、効率的なインデックスのようなマルチベクタ固有の機能を提供することで、遅延相互作用モデルの研究開発と実世界の応用を加速することを目指している。
PyLateはすでに、GTE-ModernColBERTやReason-ModernColBERTなど、最先端のモデルの開発を可能にしている。
論文 参考訳(メタデータ) (2025-08-05T15:23:40Z) - MUVERA: Multi-Vector Retrieval via Fixed Dimensional Encodings [15.275864151890511]
マルチベクトル探索を単一ベクトル類似性探索に還元する検索機構であるMUVERA(MUlti-VEctor Retrieval Algorithm)を導入する。
MUVERAはBEIR検索データセットの多種多様なセットに対して、一貫して優れたエンドツーエンドのリコールとレイテンシを実現する。
論文 参考訳(メタデータ) (2024-05-29T20:40:20Z) - Sports-Traj: A Unified Trajectory Generation Model for Multi-Agent Movement in Sports [53.637837706712794]
任意の軌道をマスク入力として処理する統一軌道生成モデルUniTrajを提案する。
具体的には,空間特徴抽出のためのトランスフォーマーエンコーダ内に埋め込まれたゴースト空間マスキング(GSM)モジュールを紹介する。
バスケットボールU,サッカーU,サッカーUの3つの実践的スポーツデータセットをベンチマークして評価を行った。
論文 参考訳(メタデータ) (2024-05-27T22:15:23Z) - Multimodal Learned Sparse Retrieval with Probabilistic Expansion Control [66.78146440275093]
学習検索(LSR)は、クエリとドキュメントを疎語彙ベクトルにエンコードするニューラルネットワークのファミリーである。
テキスト画像検索に焦点をあて,マルチモーダル領域へのLSRの適用について検討する。
LexLIPやSTAIRのような現在のアプローチでは、大規模なデータセットで複雑なマルチステップのトレーニングが必要です。
提案手法は, 密度ベクトルを凍結密度モデルからスパース語彙ベクトルへ効率的に変換する。
論文 参考訳(メタデータ) (2024-02-27T14:21:56Z) - Missing Modality Robustness in Semi-Supervised Multi-Modal Semantic
Segmentation [27.23513712371972]
簡単なマルチモーダル核融合機構を提案する。
また,マルチモーダル学習のためのマルチモーダル教師であるM3Lを提案する。
我々の提案は、最も競争力のあるベースラインよりも、ロバストmIoUで最大10%の絶対的な改善を示す。
論文 参考訳(メタデータ) (2023-04-21T05:52:50Z) - USER: Unified Semantic Enhancement with Momentum Contrast for Image-Text
Retrieval [115.28586222748478]
Image-Text Retrieval (ITR) は、与えられたクエリに意味のあるターゲットインスタンスを、他のモダリティから検索することを目的としている。
既存のアプローチは通常、2つの大きな制限に悩まされる。
論文 参考訳(メタデータ) (2023-01-17T12:42:58Z) - CITADEL: Conditional Token Interaction via Dynamic Lexical Routing for
Efficient and Effective Multi-Vector Retrieval [72.90850213615427]
マルチベクター検索法はスパース(例えばBM25)と高密度(例えばDPR)レトリバーの利点を組み合わせたものである。
これらの手法は桁違いに遅く、単ベクトルの手法に比べてインデックスを格納するのにはるかに多くのスペースを必要とする。
動的語彙ルーティング(CITADEL)による条件付きトークンの相互作用を,効率的かつ効率的なマルチベクタ検索のために提案する。
論文 参考訳(メタデータ) (2022-11-18T18:27:35Z) - Retrieve Fast, Rerank Smart: Cooperative and Joint Approaches for
Improved Cross-Modal Retrieval [80.35589927511667]
画像中のすべての単語やオブジェクトに係わるクロスアテンション機構を備えたTransformerベースのアーキテクチャを頼りに、クロスモーダル検索プロセスのテキストとビジュアルインプットへの最先端のアプローチ。
事前学習したテキスト画像のマルチモーダルモデルを効率的な検索モデルに変換する新しい微調整フレームワークを提案する。
我々は,モノリンガル,マルチリンガル,ゼロショットにおける一連の標準クロスモーダル検索ベンチマーク実験を行い,最先端クロスエンコーダに対する精度向上と大幅な効率向上を実証した。
論文 参考訳(メタデータ) (2021-03-22T15:08:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。