論文の概要: Parameterized Dense-Sparse Fusion for Hybrid Retrieval: Tuning a Rank-Score Mix on BEIR SciFact with Qdrant
- arxiv url: http://arxiv.org/abs/2609.22770v2
- Date: Tue, 22 Sep 2026 04:09:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:03.899805
- Title: Parameterized Dense-Sparse Fusion for Hybrid Retrieval: Tuning a Rank-Score Mix on BEIR SciFact with Qdrant
- Title(参考訳): ハイブリッド検索のためのパラメタライズド・スパース融合:Qdrantを用いたBEIR SciFactのランクスコア混合のチューニング
- Abstract要約: パラメータ化されたハイブリッドローダは、密着した埋め込みリストとスパース語彙リストを融合する。
SciFact train(809クエリ)でこれらの範囲をグリッド検索し、選択した値をSciFact test(300クエリ)で凍結します。
調整されたランクスコアミックス(=0.8$, $= 0.75$, $= 20$)は0.753 nDCG@10と0.889リコール@10に到達し、このテストスプリットでは密度の高いBGE(0.742 / 0.871)と等重量RF(0.707 nDCG@10)を上回った。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study a parameterized hybrid ranker that fuses a dense embedding list and a sparse lexical list. The method has a small, explicit parameter vector: a dense prior $α\in [0,1]$, a score-versus-rank mix $λ\in [0,1]$, an RRF smoothing parameter $κ> 0$, optional list-geometry coefficients that move $α$ per query, and a router margin $τ$ that can turn sparse search off. We grid-search those ranges on SciFact train (809 queries) and freeze the chosen values on SciFact test (300). The tuned rank-score mix ($α= 0.8$, $λ= 0.75$, $κ= 20$) reaches 0.753 nDCG@10 and 0.889 recall@10, outperforming dense BGE (0.742 / 0.871) and equal-weight RRF (0.707 nDCG@10) on that test split. A list-conditioned $α$ adds +0.0006 nDCG; a sparse-off router is rejected by the same train split (any $τ$ that skipped approximately 50% of queries lost nDCG). These coefficients are dataset-specific. Equal RRF with the same models does not beat dense on a nine-zip BEIR macro-average (0.479 vs. 0.519 nDCG@10). Repeating the same train-then-freeze sweep independently on all 20 indexed units beats equal RRF on 20/20 and dense on 16/20 (unit-mean nDCG@10 0.467 vs. 0.462 dense vs. 0.420 RRF). Other corpora should reuse the ranges, not a copy of the SciFact point.
- Abstract(参考訳): 本研究では,密埋め込みリストと疎語彙リストを融合したパラメータ化ハイブリッドローダについて検討する。
このメソッドは、小さな明示的なパラメータベクトルを持つ: a dense pre $α\in [0,1]$, a score-versus-rank mix $λ\in [0,1]$, a RRF smoothing parameter $κ> 0$, optional list-geometry coefficients that move $α$ per query, and a router margin $τ$。
SciFact Train (809クエリ) でこれらの範囲をグリッド検索し、選択した値をSciFact test (300) で凍結する。
調整されたランクスコアミックス(α=0.8$, $λ= 0.75$, $κ= 20$)は0.753 nDCG@10と0.889リコール@10に達し、そのテストスプリットで高密度なBGE(0.742 / 0.871)と等重量RF(0.707 nDCG@10)を上回った。
リスト付き$α$ add +0.0006 nDCG; スパースオフルータは同じ列車分割により拒否される(nDCGを失ったクエリの約50%をスキップしたτ$)。
これらの係数はデータセット固有である。
同じモデルを持つ等式RFは、9ジップのBEIRマクロ平均値(0.479対0.519 nDCG@10)では高密度ではない。
20号機は20/20号機と16/20号機(単位平均のnDCG@10 0.467 vs. 0.462号機対. 0.420号機)でRRFが等しい。
他のコーパスは、SciFactポイントのコピーではなく、範囲を再利用すべきである。
関連論文リスト
- Conditioning Tree-Based Diffusions and Flows for Probabilistic Tabular Regression [0.0]
木に基づく拡散モデルは、神経密度推定器を使わずに回帰の柔軟な条件付き予測分布に適合する。
これらのデフォルトはバインディングの制約であることを示す: 勾配のブーストされたアンサンブルが実際に解決するのは、教師付き回帰問題である。
DiffGBM を2つの軸に沿って明示する。
論文 参考訳(メタデータ) (2026-07-30T22:08:02Z) - Operadic consistency: a label-free signal for compositional reasoning failures in LLMs [11.547457355495903]
我々は、このアイデアを操作整合性(OC)として、要求ごとの信号としてインスタンス化する。
OCは各データセットの精度と強く相関している。
モデル自身の思考連鎖から分解が抽出される5つのフロンティア思考モデルにおいて、同じ同コスト比較は正の選択的予測点推定リフトを与える。
論文 参考訳(メタデータ) (2026-06-11T17:50:40Z) - SPEAR: Code-Augmented Agentic Prompt Optimization [27.161602978517706]
SPEAR(SandFrame Prompt Engineer with Active Roll-back)は4つのツールを備えたフリーフォームエージェントである。
Pythonツールは、複雑な判断タスクにおける最大のシングルレバーである。
論文 参考訳(メタデータ) (2026-05-25T19:01:10Z) - The 99% Success Paradox: When Near-Perfect Retrieval Equals Random Selection [1.2647816797166167]
本稿では,ビットオーバランサム(BoR)について紹介する。これは,高い成功率がランダムレベルのパフォーマンスを隠蔽することを示す検索選択度尺度である。
予測カバレッジ比$left(fracK cdot barR_qNright)$が3~5を超えると,ベースラインが支配的になり,選択性が低下することを示す。
これらの結果から,BoRは従来の指標とともに報告され,追加検索が無視可能な選択性向上をもたらす場合の深度選択を再考することが示唆された。
論文 参考訳(メタデータ) (2026-05-14T00:19:57Z) - vstash: Local-First Hybrid Retrieval with Adaptive Fusion for LLM Agents [0.0]
ベクトル類似性検索と全文キーワードマッチングを組み合わせたローカルファーストの文書メモリシステム**vstash**を提案する。
すべてのデータはsqlite-vecを使って近傍の検索に近づき、FTS5でキーワードマッチングを行う単一のファイルに格納される。
論文 参考訳(メタデータ) (2026-04-16T19:22:58Z) - Optimal Unconstrained Self-Distillation in Ridge Regression: Strict Improvements, Precise Asymptotics, and One-Shot Tuning [61.07540493350384]
自己蒸留(英: Self-distillation, SD)とは、教師自身の予測と地道の混合で学生を訓練する過程である。
任意の予測リスクに対して、各正規化レベルにおいて、最適に混合された学生がリッジ教師に改善されることが示される。
本稿では,グリッド探索やサンプル分割,再構成なしに$star$を推定する一貫したワンショットチューニング手法を提案する。
論文 参考訳(メタデータ) (2026-02-19T17:21:15Z) - Proving the Limited Scalability of Centralized Distributed Optimization via a New Lower Bound Construction [57.93371273485736]
我々は、すべての労働者が同一の分布にアクセスする均質な(すなわちd.d.)場合であっても、すべての労働者が非バイアス付き境界 LDeltaepsilon2,$$$$$ のポリ対数的により良いポリ対数を求める集中型分散学習環境を考える。
論文 参考訳(メタデータ) (2025-06-30T13:27:39Z) - ReSQueing Parallel and Private Stochastic Convex Optimization [59.53297063174519]
本稿では,BFG凸最適化(SCO: Reweighted Query (ReSQue) 推定ツールを提案する。
我々はSCOの並列およびプライベート設定における最先端の複雑さを実現するアルゴリズムを開発した。
論文 参考訳(メタデータ) (2023-01-01T18:51:29Z) - Generalized Differentiable RANSAC [95.95627475224231]
$nabla$-RANSACは、ランダム化された堅牢な推定パイプライン全体を学ぶことができる、微分可能なRANSACである。
$nabla$-RANSACは、精度という点では最先端のシステムよりも優れているが、精度は低い。
論文 参考訳(メタデータ) (2022-12-26T15:13:13Z) - Sharper Convergence Guarantees for Asynchronous SGD for Distributed and
Federated Learning [77.22019100456595]
通信周波数の異なる分散計算作業者のトレーニングアルゴリズムを示す。
本研究では,より厳密な収束率を$mathcalO!!(sigma2-2_avg!)とする。
また,不均一性の項は,作業者の平均遅延によっても影響されることを示した。
論文 参考訳(メタデータ) (2022-06-16T17:10:57Z) - Deep Learning Meets Projective Clustering [66.726500395069]
NLPネットワークを圧縮するための一般的なアプローチは、埋め込み層を行列 $AinmathbbRntimes d$ としてエンコードすることである。
計算幾何学から遠射的クラスタリングに着想を得て、この部分空間を$k$部分空間の集合で置き換えることを提案する。
論文 参考訳(メタデータ) (2020-10-08T22:47:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。