論文の概要: Relevance-Based Embeddings: Lightweight Candidate Retrieval via Heavy-Ranker Calls
- arxiv url: http://arxiv.org/abs/2607.03515v1
- Date: Fri, 03 Jul 2026 17:41:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.636939
- Title: Relevance-Based Embeddings: Lightweight Candidate Retrieval via Heavy-Ranker Calls
- Title(参考訳): 関連性に基づく埋め込み:ヘビーランカーコールによる軽量候補検索
- Abstract要約: 機械学習アプリケーションでは、クエリの最も関連性の高い項目を効率的に検索する必要がある。
典型的な解決策は、クエリとアイテムを別々にベクトル空間に埋め込む別のモデルを訓練することである。
これにより、品質のある程度の低下を犠牲にして、近接した近接探索によって関連する項目を探索することができる。
- 参考スコア(独自算出の注目度): 13.621771270112802
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In many machine learning applications, the most relevant items for a query should be efficiently retrieved. The relevance function is usually an expensive similarity model, making the exhaustive search infeasible. A typical solution is to train another model that separately embeds queries and items to a vector space, where similarity is defined via the dot product or cosine similarity. This allows one to search the relevant items through fast approximate nearest neighbor search at the cost of some reduction in quality. To compensate for this reduction, the found items (candidates) are re-ranked by the expensive ranking model. In this paper, we investigate an alternative approach to candidate selection that utilizes the scores of the expensive model to improve the representations of queries and items. The idea is to describe each query (item) by its relevance to a set of support items (queries) and use these new representations to obtain query (item) embeddings. We theoretically prove that such embeddings are powerful enough to approximate any complex similarity model (under mild conditions). We also investigate the choice of support items, which is a crucial ingredient of the proposed approach. The experiments on diverse academic and production datasets illustrate the power of our method.
- Abstract(参考訳): 多くの機械学習アプリケーションでは、クエリの最も関連性の高い項目を効率的に検索する必要がある。
関連関数は通常、高価な類似性モデルであり、徹底的な探索が実現不可能である。
典型的な解決策は、クエリとアイテムを別々にベクトル空間に埋め込む別のモデルを訓練することである。
これにより、品質のある程度の低下を犠牲にして、近接した近接探索によって関連する項目を探索することができる。
この削減を補うため、見つかった項目(候補)を高価なランキングモデルで再ランク付けする。
本稿では、高価なモデルのスコアを利用してクエリやアイテムの表現を改善する候補選択に対する代替手法について検討する。
それぞれのクエリ(item)を、サポート項目(クエリ)のセットと関連付けて記述し、これらの新しい表現を使用してクエリ(item)の埋め込みを取得する。
理論的には、そのような埋め込みは任意の複雑な類似性モデル(軽度条件下で)を近似するのに十分強力である。
また,提案手法の重要な要素である支援項目の選択についても検討する。
多様な学術的および生産的なデータセットに関する実験は、我々の方法の力を示しています。
関連論文リスト
- DISCO: Diversifying Sample Condensation for Efficient Model Evaluation [59.01400190971061]
コスト評価は傾向を低下させ、イノベーションのサイクルを遅くし、環境への影響を悪化させる。
モデル応答の多様性を最大化するサンプルを選択することが重要となる。
我々のメソッドである$textbfDiversifying Sample Condensation (DISCO)$は、最も大きなモデル不一致を持つトップkサンプルを選択します。
論文 参考訳(メタデータ) (2025-10-09T08:53:59Z) - MultiConIR: Towards multi-condition Information Retrieval [38.864056667809095]
MultiConIRは、複雑なマルチ条件クエリシナリオ下での検索および再ランクモデルの評価のために設計されたベンチマークである。
ほとんどのレトリバーとリランカは、クエリの複雑さが増大するにつれて、パフォーマンスが大幅に低下する。
この研究は、リランカの性能劣化の原因を解明し、クエリ内の条件位置が類似性評価にどのように影響するかを検討する。
論文 参考訳(メタデータ) (2025-03-11T05:02:03Z) - Relevance Filtering for Embedding-based Retrieval [46.851594313019895]
埋め込み型検索では、ANN(Approximate Nearest Neighbor)検索により、大規模データセットから類似したアイテムを効率的に検索することができる。
本稿では,この課題に対処するために,埋め込み型検索のための新しい関連フィルタリングコンポーネント("Cosine Adapter" と呼ぶ)を提案する。
少ないリコールの損失を犠牲にして、回収したセットの精度を大幅に向上することが可能です。
論文 参考訳(メタデータ) (2024-08-09T06:21:20Z) - Retrieval with Learned Similarities [2.729516456192901]
最先端の検索アルゴリズムは、学習された類似点に移行した。
そこで本研究では,Mixture-of-Logits (MoL) を実証的に実現し,多様な検索シナリオにおいて優れた性能が得られることを示す。
論文 参考訳(メタデータ) (2024-07-22T08:19:34Z) - Group Testing for Accurate and Efficient Range-Based Near Neighbor Search for Plagiarism Detection [2.3814052021083354]
本研究は, 近接探索問題に対する適応型群検定フレームワークを提案する。
本研究では,データベース内の各項目を問合せ点の隣人あるいは非隣人として,余剰距離閾値に基づいて効率よくマークする。
本研究では,ソフトマックスに基づく特徴量を用いて,完全探索よりも10倍以上の高速化を実現し,精度を損なわないことを示す。
論文 参考訳(メタデータ) (2023-11-05T06:12:03Z) - Semantic Equivalence of e-Commerce Queries [6.232692545488813]
本稿では,クエリの等価性を認識・活用し,検索とビジネスの成果を高めるためのフレームワークを提案する。
提案手法は,検索意図のベクトル表現へのクエリのマッピング,等価あるいは類似の意図を表現した近傍のクエリの特定,ユーザやビジネス目的の最適化という3つの重要な問題に対処する。
論文 参考訳(メタデータ) (2023-08-07T18:40:13Z) - Answering Compositional Queries with Set-Theoretic Embeddings [43.926610595182126]
ボックス埋め込みは、学習可能なVennダイアグラムと考えることができる領域ベースの表現である。
双方の行動に関する知見を提供する実験と分析について述べる。
ベクトルとボックスの埋め込みは単一の属性クエリに等しく適しているが、コンポジションクエリボックスの埋め込みは大きな利点がある。
論文 参考訳(メタデータ) (2023-06-07T04:04:36Z) - Query Expansion Using Contextual Clue Sampling with Language Models [69.51976926838232]
本稿では,実効的なフィルタリング戦略と検索した文書の融合の組み合わせを,各文脈の生成確率に基づいて提案する。
我々の語彙マッチングに基づくアプローチは、よく確立された高密度検索モデルDPRと比較して、同様のトップ5/トップ20検索精度と上位100検索精度を実現する。
エンド・ツー・エンドのQAでは、読者モデルも我々の手法の恩恵を受けており、いくつかの競争基準に対してエクサクト・マッチのスコアが最も高い。
論文 参考訳(メタデータ) (2022-10-13T15:18:04Z) - CODER: An efficient framework for improving retrieval through
COntextualized Document Embedding Reranking [11.635294568328625]
本稿では,最小計算コストで広範囲の検索モデルの性能を向上させるためのフレームワークを提案する。
ベース密度検索法により抽出された事前計算された文書表現を利用する。
実行時に第一段階のメソッドの上に無視可能な計算オーバーヘッドを発生させ、最先端の高密度検索手法と簡単に組み合わせられるようにする。
論文 参考訳(メタデータ) (2021-12-16T10:25:26Z) - How to Query An Oracle? Efficient Strategies to Label Data [59.89900843097016]
機械学習におけるデータセットのラベル付けに専門家の託宣を照会する際の基本的な問題について考察する。
本稿では,サンプルをラベル付けするために,ラウンド・バイ・ラウンドでランダム化されたバッチアルゴリズムを提案し,クエリレートが$O(fracNk2)$であることを示す。
さらに,適応型グリージークエリ方式を提案し,三重項クエリを用いたサンプルあたり平均$approx 0.2N$クエリを実現する。
論文 参考訳(メタデータ) (2021-10-05T20:15:35Z) - Online Learning of Optimally Diverse Rankings [63.62764375279861]
ユーザのフィードバックのみに基づいて最適なリストを効率よく学習するアルゴリズムを提案する。
我々は、$T$クエリの後に、LDRの後悔は$O((N-L)log(T))$としてスケールする。
論文 参考訳(メタデータ) (2021-09-13T12:13:20Z) - IRLI: Iterative Re-partitioning for Learning to Index [104.72641345738425]
分散環境でのロードバランスとスケーラビリティを維持しながら、高い精度を得る方法とのトレードオフが必要だ。
クエリ項目関連データから直接バケットを学習することで、アイテムを反復的に分割するIRLIと呼ばれる新しいアプローチを提案する。
我々は,irliが極めて自然な仮定の下で高い確率で正しい項目を検索し,優れた負荷分散を実現することを数学的に示す。
論文 参考訳(メタデータ) (2021-03-17T23:13:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。