Fugu-MT 論文翻訳(概要): LoRE: Logit-Ranked Retriever Ensemble for Enhancing Open-Domain Question Answering

論文の概要: LoRE: Logit-Ranked Retriever Ensemble for Enhancing Open-Domain Question Answering

arxiv url: http://arxiv.org/abs/2410.10042v1
Date: Sun, 13 Oct 2024 23:06:08 GMT
ステータス: 翻訳完了
システム内更新日: 2024-10-30 03:33:49.618505
Title: LoRE: Logit-Ranked Retriever Ensemble for Enhancing Open-Domain Question Answering
Title（参考訳）: Lore: オープンドメインの質問応答を促進するために、ロジト対応のレトリバーアンサンブル
Authors: Saikrishna Sanniboina, Shiv Trivedi, Sreenidhi Vijayaraghavan,
Abstract要約: 位置バイアスを緩和することで解答精度と妥当性を向上させる新しいアプローチであるLoREを提案する。 LoREはBM25やFAISSインデックス付き文変換器といった多様なレトリバーのアンサンブルを使用している。重要な革新は、ロジットベースの回答ランキングアルゴリズムで、大きな言語モデルからのロジットスコアとパスの検索ランクを組み合わせたものである。
参考スコア（独自算出の注目度）: 0.0
License: http://creativecommons.org/licenses/by/4.0/
Abstract: Retrieval-based question answering systems often suffer from positional bias, leading to suboptimal answer generation. We propose LoRE (Logit-Ranked Retriever Ensemble), a novel approach that improves answer accuracy and relevance by mitigating positional bias. LoRE employs an ensemble of diverse retrievers, such as BM25 and sentence transformers with FAISS indexing. A key innovation is a logit-based answer ranking algorithm that combines the logit scores from a large language model (LLM), with the retrieval ranks of the passages. Experimental results on NarrativeQA, SQuAD demonstrate that LoRE significantly outperforms existing retrieval-based methods in terms of exact match and F1 scores. On SQuAD, LoRE achieves 14.5\%, 22.83\%, and 14.95\% improvements over the baselines for ROUGE-L, EM, and F1, respectively. Qualitatively, LoRE generates more relevant and accurate answers, especially for complex queries.
Abstract（参考訳）: 検索に基づく質問応答システムは、しばしば位置バイアスに悩まされ、最適以下の回答が生成される。位置バイアスを緩和することで解答精度と妥当性を向上させる新しいアプローチであるLoRE(Logit-Ranked Retriever Ensemble)を提案する。 LoREはBM25やFAISSインデックス付き文変換器といった多様なレトリバーのアンサンブルを使用している。重要な革新は、ログベースの回答ランキングアルゴリズムで、大きな言語モデル(LLM)からのロジットスコアと、パスの検索ランクを組み合わせたものである。 NarrativeQA, SQuADの実験結果から, LoREは一致率とF1スコアの点で, 既存の検索手法を著しく上回っていることが示された。 SQuADでは、ROUGE-L、EM、F1のベースラインよりも14.5\%、22.83\%、14.95\%改善されている。定性的には、LoREは特に複雑なクエリに対して、より関連性があり正確な回答を生成する。

関連論文リスト

InsertRank: LLMs can reason over BM25 scores to Improve Listwise Reranking [3.1125398490785217]
InsertRankはLLMベースのリランカで、リランク中のBM25スコアなどの語彙信号を活用して、検索性能をさらに向上する。 Deepseek-R1では、InsertRankはBRIGHTベンチマークで37.5点、R2MEDベンチマークで51.1点を獲得し、以前の手法を上回りました。
論文参考訳（メタデータ） (2025-06-17T01:04:45Z)
LTRR: Learning To Rank Retrievers for LLMs [53.285436927963865]
ルーティングベースのRAGシステムは、単一リトリバーベースのシステムよりも優れていることを示す。パフォーマンス向上は、特にAnswer Correctness(AC)メトリックでトレーニングされたモデルで顕著である。 SIGIR 2025 LiveRAG チャレンジの一環として,提案システムを用いて提案手法の有効性を実証した。
論文参考訳（メタデータ） (2025-06-16T17:53:18Z)
ReasonIR: Training Retrievers for Reasoning Tasks [139.54343970560103]
ReasonIR-8Bは一般的な推論タスクのために特別に訓練された最初のレトリバーである。新たに29.9 nDCG@10をリランカなしで、36.9 nDCG@10をリランカで達成している。
論文参考訳（メタデータ） (2025-04-29T09:49:28Z)
Rank-R1: Enhancing Reasoning in LLM-based Document Rerankers via Reinforcement Learning [76.50690734636477]
ランキングタスクを実行する前にユーザクエリと候補文書の両方を推論する新しいLCMベースのリランカである Rank-R1 を導入する。 TREC DL と BRIGHT データセットを用いた実験により,Ranc-R1 が特に複雑なクエリに対して非常に有効であることが判明した。
論文参考訳（メタデータ） (2025-03-08T03:14:26Z)
Intrinsic Evaluation of RAG Systems for Deep-Logic Questions [2.869056892890114]
本稿では,検索拡張生成(RAG)機構を深い論理的クエリを含むアプリケーションに適用するための本質的な指標である総合性能指標(OPI)を紹介する。 OPIは2つの重要な指標の調和平均として計算される: 論理関係の正確度比(Logical-Relation Correctness Ratio)と BERT の平均値。
論文参考訳（メタデータ） (2024-10-03T19:25:05Z)
W-RAG: Weakly Supervised Dense Retrieval in RAG for Open-domain Question Answering [28.79851078451609]
大規模言語モデル(LLM)は、内部(パラメトリック)知識にのみ依存して、事実的な回答を生成するのに苦労することが多い。この制限に対処するため、Retrieval-Augmented Generation (RAG)システムでは、外部ソースから関連情報を検索することでLLMを強化している。我々はLLMのランキング機能を活用してW-RAGを提案する。
論文参考訳（メタデータ） (2024-08-15T22:34:44Z)
RAG-QA Arena: Evaluating Domain Robustness for Long-form Retrieval Augmented Question Answering [61.19126689470398]
Long-form RobustQA (LFRQA)は、7つの異なるドメインにわたる26Kクエリと大きなコーパスをカバーする新しいデータセットである。 RAG-QAアリーナと人間の回答品質判断は高い相関関係にあることを示す。最も競争力のあるLLMの回答の41.3%のみがLFRQAの回答に好まれており、RAG-QAアリーナは将来の研究の挑戦的な評価プラットフォームであることを示している。
論文参考訳（メタデータ） (2024-07-19T03:02:51Z)
FIRST: Faster Improved Listwise Reranking with Single Token Decoding [56.727761901751194]
まず、第1生成識別子の出力ロジットを活用して、候補のランク付け順序を直接取得する新しいリストワイズLLMリグレードアプローチであるFIRSTを紹介する。実験結果から、BEIRベンチマークの利得により、FIRSTはロバストなランキング性能を維持しつつ、推論を50%高速化することが示された。以上の結果から,LLMリランカーはクロスエンコーダに比べて強い蒸留信号を提供できることが示唆された。
論文参考訳（メタデータ） (2024-06-21T21:27:50Z)
SuRe: Summarizing Retrievals using Answer Candidates for Open-domain QA of LLMs [85.54906813106683]
大規模言語モデル(LLM)を用いたオープンドメイン質問応答(ODQA)の簡易かつ効果的なフレームワークを提案する。 SuRe は LLM が与えられた質問に対するより正確な回答を予測するのに役立つ。様々なODQAベンチマークの実験結果はSuReの優位性を示し、標準的なプロンプトアプローチよりも4.6%、F1スコアが4.0%向上した。
論文参考訳（メタデータ） (2024-04-17T01:15:54Z)
GenQREnsemble: Zero-Shot LLM Ensemble Prompting for Generative Query Reformulation [5.793298194062544]
我々は,複数のキーワードセットを生成するためのアンサンブルベースのプロンプト手法GenQREnsembleを提案する。 4つのIRベンチマークで評価したところ、GenQREnsembleは相対的なnDCG@10の改善を18%まで、MAPの改善を24%まで改善した。
論文参考訳（メタデータ） (2024-04-04T18:35:25Z)
ReFIT: Relevance Feedback from a Reranker during Inference [109.33278799999582]
Retrieve-and-Rerankは、ニューラル情報検索の一般的なフレームワークである。本稿では,リランカを利用してリコールを改善する手法を提案する。
論文参考訳（メタデータ） (2023-05-19T15:30:33Z)
Few-shot Reranking for Multi-hop QA via Language Model Prompting [56.454088569241534]
オープンドメイン質問を用いたマルチホップQAにおける数点のリランクについて検討した。本稿では,マルチホップパスの再ランク付けを促す大規模言語モデルに依存するPromptRankを提案する。 PromptRankは、HotpotQA上で128のトレーニング例で強力な検索性能を得る。
論文参考訳（メタデータ） (2022-05-25T10:45:55Z)
Adversarial Retriever-Ranker for dense text retrieval [51.87158529880056]
本稿では、二重エンコーダレトリバーとクロスエンコーダローダからなるAdversarial Retriever-Ranker(AR2)を提案する。 AR2は、既存の高密度レトリバー法より一貫して大幅に優れている。これには、R@5から77.9%(+2.1%)、TriviaQA R@5から78.2%(+1.4)、MS-MARCO MRR@10から39.5%(+1.3%)の改善が含まれている。
論文参考訳（メタデータ） (2021-10-07T16:41:15Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。