論文の概要: Do Static Embeddings Add Value to Hybrid Dutch Retrieval?
- arxiv url: http://arxiv.org/abs/2608.02112v1
- Date: Mon, 03 Aug 2026 12:10:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.522203
- Title: Do Static Embeddings Add Value to Hybrid Dutch Retrieval?
- Title(参考訳): 静的埋め込みはハイブリッドオランダ検索に価値をもたらすか?
- Authors: António Pereira Barata,
- Abstract要約: 埋め込みベンチマークは、スタンドアロンのモデル品質を測定するが、低コストのレトリバーがランキング情報に貢献するかどうかを定めていない。
オランダ語検索課題を対象としたMTEB-NL (Massive Text Embedding Benchmark for Dutch) によるこの問題の制御評価について述べる。
重み付き相互階級融合(RRF)はBest Matching 25 (BM25)、Qwen/Qwen3-Embedding-0.6B (Qwen)、および2つの多言語静的埋め込みモデルを組み合わせたものである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Embedding benchmarks measure standalone model quality, but they do not establish whether a low-cost retriever contributes complementary ranking information once lexical and transformer-based retrieval are already combined. We present a controlled evaluation of this question across Dutch retrieval tasks from the Massive Text Embedding Benchmark for Dutch (MTEB-NL). Weighted reciprocal rank fusion (RRF) combines Best Matching 25 (BM25), Qwen/Qwen3-Embedding-0.6B (Qwen), and two multilingual static embedding models. Five datasets comprising 14,500 queries and 786,573 documents are scored exhaustively, and fusion weights are searched on a simplex in increments of 0.1. Ten-fold query-level cross-validation selects weights on nine folds and evaluates them on the held-out fold; paired bootstrap confidence intervals and sign-randomisation tests quantify the resulting differences. Fusion improves over the training-selected individual retriever by 0.061 mean reciprocal rank (MRR) on Dutch News, 0.029 on VABB, 0.004 on WebFAQ NL, and 0.025 on Wikipedia NL, while matching BM25 on Open Tender. All four positive differences remain distinguishable from zero after Holm correction. No unrestricted fold assigns positive weight to either static retriever: all 50 selections lie on the BM25-Qwen edge, and forcing a static contribution reduces effectiveness. Leave-one-dataset-out selection chooses equal BM25-Qwen weighting in every iteration and outperforms the cross-domain-selected individual retriever on every held-out task. The results support a two-retriever lexical-transformer architecture as a robust tested default across the evaluated Dutch tasks and show that standalone benchmark performance is insufficient to establish marginal value in hybrid retrieval.
- Abstract(参考訳): 埋め込みベンチマークは、スタンドアロンモデルの品質を計測するが、レトリバーがレキシカルとトランスフォーマーをベースとした検索が組み合わされていれば、補完的なランキング情報を提供するかどうかを定めていない。
本稿では,オランダ語検索タスクを対象に,MTEB-NL (Massive Text Embedding Benchmark for Dutch) からこの問題を制御した評価を行う。
重み付き相互階級融合(RRF)はBest Matching 25 (BM25)、Qwen/Qwen3-Embedding-0.6B (Qwen)、および2つの多言語静的埋め込みモデルを組み合わせたものである。
14,500のクエリと786,573のドキュメントからなる5つのデータセットを総括的に収集し、融合重みを0.1の単純なインクリメントで探索する。
10倍のクエリレベルのクロスバリデーションは、9つの折り畳みの重みを選択し、保持された折り畳みの重みを評価します。
フュージョンは、オランダニュースでは0.061、VABBでは0.029、WebFAQ NLでは0.004、ウィキペディアでは0.025、オープンテンダーではBM25と一致する。
4つの正差はすべて、ホルム補正後のゼロと区別可能である。
50個の選択はBM25-Qwenエッジに配置され、静的なコントリビューションを強制することで効率が低下する。
Leave-one-dataset-outセレクションは、繰り返し毎に同じBM25-Qwen重み付けを選択し、保持されたタスクごとにクロスドメイン選択された個別レトリバーより優れている。
その結果、評価されたオランダのタスクにまたがる堅牢なテストデフォルトとして、2レトリバーのレキシカル・トランスフォーマーアーキテクチャがサポートされ、ハイブリッド検索における限界値を確立するには、スタンドアロンのベンチマーク性能が不十分であることが示されている。
関連論文リスト
- Querit-Reranker: Training Compact Multilingual Rerankers via Efficient Label-Free Distribution Adaptation [43.66118282567413]
データ中心のパイプラインでトレーニングされた多言語クロスエンコーダリランカのファミリーであるQuarit-Rerankerを紹介します。
我々のパイプラインはまず、大規模ランキング指向データから一般的な関連性モデリングを学び、次にターゲット分布に適応する。
Querit-Reranker-A0.4B 平均 nDCG@10 は BEIR では 54.11 から 59.28 に、MIRACL では 59.87 から 67.70 に改善されている。
論文 参考訳(メタデータ) (2026-06-17T13:06:47Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - A Modelling and Evaluation Framework for EuroCrops-Driven Sentinel-2 Crop Segmentation [78.66324246922831]
本研究では,Sentinel-2イメージとEuroCropsパーセルレベルのアノテーションからセマンティックセグメンテーション対応農業データセットを生成するパイプラインを提案する。
このデータセットには、ヨーロッパ5カ国から67,337のパッチが含まれており、10種類の作物と背景の分類を減らしている。
The four-level U-Net with Group Normalization were training using 10 Sentinel-2 spectrum bands and a Composite loss with class-weighted cross-entropy and Dice loss。
論文 参考訳(メタデータ) (2026-05-30T11:20:29Z) - vstash: Local-First Hybrid Retrieval with Adaptive Fusion for LLM Agents [0.0]
ベクトル類似性検索と全文キーワードマッチングを組み合わせたローカルファーストの文書メモリシステム**vstash**を提案する。
すべてのデータはsqlite-vecを使って近傍の検索に近づき、FTS5でキーワードマッチングを行う単一のファイルに格納される。
論文 参考訳(メタデータ) (2026-04-16T19:22:58Z) - Calibrated Confidence Estimation for Tabular Question Answering [0.0]
ECE 0.35-0.64 に対して、テキスト QA では 0.10-0.15 が報告されている)。
摂動二分法に対する一貫した自己評価は、両方のベンチマークと4つの完全にカバーされたモデル間で複製される。
構造を意識した再校正による二次貢献は、標準的なポストホック法よりもAUROCをパーセンテージポイントで改善する。
論文 参考訳(メタデータ) (2026-04-14T09:16:53Z) - Relational Preference Encoding in Looped Transformer Internal States [0.0]
ループ変換器は内部の反復状態においてどのように人間の嗜好を符号化するかを検討する。
繰り返し洗練された2.6Bパラメータループ変換器であるOuro-2.6B-Thinkingを用いて,各ループ繰り返しから隠れた状態を抽出する。
我々は、HH-RLHFデータセット上で人間の嗜好を予測するために軽量評価器ヘッドを訓練する。
我々のペアワイズ評価器は8,552個の未確認例に対して95.2%の精度を達成し、ベースモデルは完全に凍結されている間に全バッチのL-BFGSプローブ(84.5%)を上回った。
論文 参考訳(メタデータ) (2026-04-10T20:00:49Z) - MultiHaystack: Benchmarking Multimodal Retrieval and Reasoning over 40K Images, Videos, and Documents [57.32877731797049]
MultiHaystackは、大規模なクロスモーダル条件下での検索と推論の両方を評価するために設計された最初のベンチマークである。
モデルが対応するエビデンスを付与した場合,その性能は,全コーパスからそのエビデンスを取得するために必要な場合,急激に低下することがわかった。
論文 参考訳(メタデータ) (2026-03-05T21:43:02Z) - Rethinking LLM Evaluation: Can We Evaluate LLMs with 200x Less Data? [82.09573568241724]
EssenceBenchは反復遺伝的アルゴリズム(GA)を利用した粗粒度フレームワーク
提案手法は, 再構成誤差が低く, 効率が著しく向上した, 優れた圧縮結果が得られる。
HellaSwagベンチマーク(10Kサンプル)では,25倍少ないサンプルを用いて,全モデルが5%以内の順位を保ち,わずか200倍少ないサンプルを用いて,95%未満のランキング保持シフトを達成している。
論文 参考訳(メタデータ) (2025-10-12T05:38:10Z) - Evaluating Hybrid Retrieval Augmented Generation using Dynamic Test Sets: LiveRAG Challenge [8.680958290253914]
本稿では,動的テストセット上での検索強化生成システム(RAG)の評価を行うLiveRAG Challenge 2025を提案する。
我々の最後のハイブリッドアプローチはスパース (BM25) と高密度 (E5) の検索手法を組み合わせたものである。
RankLLaMA を用いたニューラルリランクでは MAP は0.523 から 0.797 に向上するが,計算コストは禁忌である。
論文 参考訳(メタデータ) (2025-06-27T21:20:43Z) - SPRINT: A Unified Toolkit for Evaluating and Demystifying Zero-shot
Neural Sparse Retrieval [92.27387459751309]
ニューラルスパース検索を評価するための統一PythonツールキットであるSPRINTを提供する。
我々は、よく認識されているベンチマークBEIRにおいて、強く再現可能なゼロショットスパース検索ベースラインを確立する。
SPLADEv2は、元のクエリとドキュメントの外で、ほとんどのトークンでスパース表現を生成する。
論文 参考訳(メタデータ) (2023-07-19T22:48:02Z) - OneAligner: Zero-shot Cross-lingual Transfer with One Rich-Resource
Language Pair for Low-Resource Sentence Retrieval [91.76575626229824]
文検索タスク用に特別に設計されたアライメントモデルであるOneAlignerを提案する。
大規模並列多言語コーパス(OPUS-100)の全ての言語ペアで訓練すると、このモデルは最先端の結果が得られる。
実験結果から,文アライメントタスクの性能はモノリンガルおよび並列データサイズに大きく依存することがわかった。
論文 参考訳(メタデータ) (2022-05-17T19:52:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。