論文の概要: Boolean queries are all you need?
- arxiv url: http://arxiv.org/abs/2607.11362v1
- Date: Mon, 13 Jul 2026 10:25:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.43461
- Title: Boolean queries are all you need?
- Title(参考訳): ブールクエリがすべて必要ですか?
- Authors: Charles L. A. Clarke, Mark D. Smucker,
- Abstract要約: TREC 2024 RAGトラックで使用されるMS MARCO V2.1復号セグメントコレクションを検索する。
86のトピックの標準トラックサブセットと100のモデルコール/トピックの予算の下で動作し、エージェントは0.6863のNDCG@10を達成した。
ランク付けは、クエリにマッチするコーパスの密度のみに基づいており、教師付き学習、グローバル統計、用語の重み付けは不要である。
- 参考スコア(独自算出の注目度): 10.637635718179075
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We equipped an LLM-based search agent with access to a Boolean retrieval engine to search the MS MARCO V2.1 deduped segment collection used by the TREC 2024 RAG track. Over a standard track subset of 86 topics, and operating under a budget of 100 model calls/topic, the agent achieved an NDCG@10 of 0.6863, which would place it above many dense, sparse, and learned-sparse first-stage retrievers. Ranking is based solely on the density of corpus substrings matching a query, with no requirement for supervised learning, global statistics, or term weights. Formally, the query language expresses a strict subset of the regular languages, with a document's score based on the number and length of matches it contains. Although the results are more exploratory than definitive, because they are based on a single test collection that was publicly available during model training, they suggest that simple pattern matching may be sufficient for agentic search.
- Abstract(参考訳): TREC 2024 RAGトラックで使用するMS MARCO V2.1復号セグメントコレクションを検索するために,LLMベースの検索エージェントとブール検索エンジンを併用した。
86のトピックの標準トラックサブセットと100のモデルコール/トピックの予算の下で動作し、エージェントは0.6863のNDCG@10を達成した。
ランク付けは、クエリにマッチするコーパスサブストリングの密度のみに基づいており、教師付き学習、グローバル統計、用語の重み付けは不要である。
形式的には、クエリ言語は正規言語の厳密なサブセットを表現し、文書のスコアはそれが含むマッチの数と長さに基づいて表される。
結果は, モデルトレーニング中に公開されている単一のテストコレクションに基づいているため, 確定性よりも探索性が高いが, 単純なパターンマッチングはエージェント検索に十分である可能性が示唆された。
関連論文リスト
- Superintelligent Retrieval Agent: The Next Frontier of Information Retrieval [25.731213365755234]
textitSuperIntelligent Retrieval Agent (SIRA)を紹介する。
SIRAは、複数ラウンド探索探索を単一のコーパス識別検索アクションに圧縮することができる。
解釈可能で、トレーニング不要で、効率的でありながら、より高価なマルチラウンドサーチを超えることができる。
論文 参考訳(メタデータ) (2026-05-07T17:54:29Z) - Leveraging LLMs to Enable Natural Language Search on Go-to-market Platforms [0.23301643766310368]
販売者向けのZoominfo製品向けのソリューションの実装と評価を行い、自然言語による大規模言語モデルの実現を促す。
中間検索フィールドは、構文エラーの除去など、クエリ毎に多くの利点を提供する。
提案手法の有効性を実証するために, クローズド, オープンソース, 微調整 LLM モデルを用いた総合実験を行った。
論文 参考訳(メタデータ) (2024-11-07T03:58:38Z) - BRIGHT: A Realistic and Challenging Benchmark for Reasoning-Intensive Retrieval [54.54576644403115]
BRIGHTは、関係する文書を検索するために、集中的推論を必要とする最初のテキスト検索ベンチマークである。
私たちのデータセットは、経済学、心理学、数学、コーディングなど、さまざまな領域にまたがる1,384の現実世界のクエリで構成されています。
クエリに関する明示的な推論を取り入れることで、検索性能が最大12.2ポイント向上することを示す。
論文 参考訳(メタデータ) (2024-07-16T17:58:27Z) - Large Language Models are Strong Zero-Shot Retriever [89.16756291653371]
ゼロショットシナリオにおける大規模検索に大規模言語モデル(LLM)を適用するための簡単な手法を提案する。
我々の手法であるRetriever(LameR)は,LLM以外のニューラルモデルに基づいて構築された言語モデルである。
論文 参考訳(メタデータ) (2023-04-27T14:45:55Z) - Acoustic span embeddings for multilingual query-by-example search [20.141444548841047]
低リソースまたはゼロリソース設定では、QbE検索は動的時間ワープ(DTW)に基づくアプローチで対処されることが多い。
近年の研究では、音響単語埋め込み(AWE)に基づく手法は、性能と探索速度の両方を改善することが判明している。
我々は、AWEトレーニングを単語のスパンに一般化し、音響スパン埋め込み(ASE)を生成し、複数の未知言語における任意の長さのクエリへのAWEの適用について検討する。
論文 参考訳(メタデータ) (2020-11-24T00:28:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。