論文の概要: GEM: A Generative Embedding Model Bridging Reasoning and Retrieval
- arxiv url: http://arxiv.org/abs/2608.13200v2
- Date: Fri, 14 Aug 2026 09:58:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 13:59:16.227332
- Title: GEM: A Generative Embedding Model Bridging Reasoning and Retrieval
- Title(参考訳): GEM: 推論と検索のためのジェネレーティブな埋め込みモデル
- Abstract要約: 本稿では,ジェネレーティブな埋め込みモデルであるGEMについて述べる。
推論集約型および命令追従型検索タスクの評価
GEMの生成特性は、検索性能をさらに向上させるプロンプトによるテスト時間計算のスケーリングを可能にする。
- 参考スコア(独自算出の注目度): 15.116615102031771
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern LLMs excel at reasoning and instruction following, enabling users to express complex and diverse information needs. However, conventional retrievers largely rely on surface-level matching between queries and documents, resulting in a growing gap between how users express their needs and how retrievers interpret them. In this paper, we present GEM, a generative embedding model that augments retrieval through its own knowledge by explicitly reasoning about user intent and relevance criteria. GEM unifies generation and embedding within a single model: it first reasons over the query, then appends an embedding token to encode the enriched context for retrieval. Evaluated on reasoning-intensive and instruction-following retrieval tasks, GEM demonstrates the effectiveness of its reasoning-augmented retrieval, outperforming its non-reasoning variant and matching baselines using substantially larger models. Furthermore, GEM's generative nature allows test-time compute scaling via prompting to further enhance retrieval performance. Our code is available at: https://anonymous.4open.science/r/GEM.
- Abstract(参考訳): 現代のLSMは推論と命令の処理に優れており、ユーザーは複雑で多様な情報要求を表現できる。
しかし、従来の検索者は、クエリとドキュメント間の表面レベルのマッチングに大きく依存しているため、ユーザのニーズの表現方法とレトリバーの解釈方法のギャップが増大する。
本稿では,ユーザ意図と関連基準を明確に推論することで,検索を自身の知識で強化するジェネレーティブ埋め込みモデルであるGEMを提案する。
GEMは、単一のモデルに生成と埋め込みを統一する: クエリを最初に理由付け、次に埋め込みトークンを追加して、リッチなコンテキストをエンコードして検索する。
GEMは推論集約的かつ命令追従型検索タスクの評価を行い、推論強化型検索の有効性を実証し、その非推論型およびマッチングベースラインをはるかに大きなモデルを用いて上回った。
さらに、GEMの生成特性は、検索性能をさらに向上させるプロンプトによるテスト時間計算のスケーリングを可能にする。
私たちのコードは、https://anonymous.4open.science/r/GEM.comで利用可能です。
関連論文リスト
- OneFeed: A Unified Generative Framework for Feed Content Enhancement and Query Generation [0.0]
OneFeedはフィードコンテンツ拡張とクエリ生成をモデリングするための統合生成フレームワークである。
OneFeedは異種ユーザ行動シーケンスを共有振る舞いエンコーダでエンコードする。
OneFeedはコンテンツセマンティックIDとクエリ表現のための共有セマンティックスペースを学習する。
論文 参考訳(メタデータ) (2026-06-06T04:17:09Z) - GrepSeek: Training Search Agents for Direct Corpus Interaction [66.69568141699311]
GrepSeekは、コンパクトな検索エージェントを訓練し、大きなテキストコーパスから証拠を見つけ、フィルタリングし、構成する、最適化された直接コーパスインタラクション(DCI)検索エージェントである。
DCIを大規模に実用化するためには、シェルコマンドのシーケンシャルな実行とバイトエクササイズ等価性を保ちながら、シェルベースの検索を最大7.6タイムで高速化するセマンティックス保存のシャード並列実行エンジンを使用する。
論文 参考訳(メタデータ) (2026-05-28T03:37:33Z) - Multi-Step Semantic Reasoning in Generative Retrieval [50.65947993017158]
生成検索(GR)モデルは、モデルパラメータ内のコーパスを符号化し、所定のクエリに対して関連するドキュメント識別子を生成する。
既存のGRモデルは、財務報告に対するセマンティック推論など、数値的な文脈で複雑なクエリに苦しむ。
GR内の数値文脈における多段階意味推論を強化するためのフレームワークであるReasonGRを提案する。
論文 参考訳(メタデータ) (2026-03-12T18:38:50Z) - Reasoning-Augmented Representations for Multimodal Retrieval [27.4146940988752]
Universal Multimodal Retrieval (UMR) は、テキストと視覚を横断する任意の検索を求める。
画像が“サイレント”なエビデンスを持ち、クエリがキーセマンティクスを暗黙的に残す場合、単一の埋め込みパスは理由と圧縮の両方でなければならない。
本稿では、検索前の推論を外部化することで、これらの役割を分離するデータ中心のフレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-06T19:01:54Z) - Rethinking On-policy Optimization for Query Augmentation [49.87723664806526]
本稿では,様々なベンチマークにおいて,プロンプトベースとRLベースのクエリ拡張の最初の体系的比較を示す。
そこで我々は,検索性能を最大化する擬似文書の生成を学習する,新しいハイブリッド手法 On-policy Pseudo-document Query Expansion (OPQE) を提案する。
論文 参考訳(メタデータ) (2025-10-20T04:16:28Z) - Reasoning-enhanced Query Understanding through Decomposition and Interpretation [87.56450566014625]
ReDIは、分解と解釈によるクエリ理解のための推論強化アプローチである。
我々は,大規模検索エンジンから実世界の複雑なクエリの大規模データセットをコンパイルした。
BRIGHT と BEIR の実験により、ReDI はスパースと密度の高い検索パラダイムの両方において、強いベースラインを一貫して超えることを示した。
論文 参考訳(メタデータ) (2025-09-08T10:58:42Z) - ImpRAG: Retrieval-Augmented Generation with Implicit Queries [34.72864597562907]
ImpRAGは、検索と生成を統一モデルに統合するクエリフリーなRAGシステムである。
我々は、ImpRAGが、多様な形式を持つ未確認タスクの正確なマッチスコアを3.6-11.5改善したことを示す。
論文 参考訳(メタデータ) (2025-06-02T21:38:21Z) - GENIUS: A Generative Framework for Universal Multimodal Search [26.494338650656594]
本稿では,複数のモダリティやドメインにまたがる多様なタスクを支援する汎用的な生成検索フレームワークGENIUSを提案する。
GENIUSは、モダリティを分離したセマンティック量子化を導入し、マルチモーダルデータをモダリティとセマンティクスの両方をコードする離散IDに変換する。
汎用性を高めるために,クエリとターゲットを補間するクエリ拡張を提案し,genIUSが様々なクエリ形式に適応できるようにする。
論文 参考訳(メタデータ) (2025-03-25T17:32:31Z) - BRIGHT: A Realistic and Challenging Benchmark for Reasoning-Intensive Retrieval [54.54576644403115]
BRIGHTは、関係する文書を検索するために、集中的推論を必要とする最初のテキスト検索ベンチマークである。
私たちのデータセットは、経済学、心理学、数学、コーディングなど、さまざまな領域にまたがる1,384の現実世界のクエリで構成されています。
クエリに関する明示的な推論を取り入れることで、検索性能が最大12.2ポイント向上することを示す。
論文 参考訳(メタデータ) (2024-07-16T17:58:27Z) - Corrective Retrieval Augmented Generation [36.04062963574603]
Retrieval-augmented Generation (RAG) は、検索された文書の関連性に大きく依存しており、検索が失敗した場合のモデルがどのように振る舞うかについての懸念を提起する。
生成の堅牢性を改善するために,CRAG(Corrective Retrieval Augmented Generation)を提案する。
CRAGはプラグアンドプレイであり、様々なRAGベースのアプローチとシームレスに結合できる。
論文 参考訳(メタデータ) (2024-01-29T04:36:39Z) - Enhancing Retrieval-Augmented Large Language Models with Iterative
Retrieval-Generation Synergy [164.83371924650294]
検索と生成を反復的に同期させるIter-RetGenと呼ばれる手法により,高い性能が得られることを示す。
モデル出力は、タスクを完了するために必要なものを示し、より関連する知識を取得するための情報的コンテキストを提供する。
Iter-RetGenプロセスは、すべての知識を全体として取得し、構造的な制約なしに生成時の柔軟性をほとんど保持します。
論文 参考訳(メタデータ) (2023-05-24T16:17:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。