論文の概要: Guardian Crawler: Retrieval-First Knowledge Discovery with Bounded LLM Augmentation for Noisy Web Intelligence
- arxiv url: http://arxiv.org/abs/2608.08994v1
- Date: Mon, 10 Aug 2026 01:28:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.030803
- Title: Guardian Crawler: Retrieval-First Knowledge Discovery with Bounded LLM Augmentation for Noisy Web Intelligence
- Title(参考訳): Guardian Crawler: ノイズの多いWebインテリジェンスのための境界付きLLM拡張による検索ファースト知識発見
- Authors: Joshua Castillo, Santosh Nukavarapu, Ravi Mukkamala,
- Abstract要約: 本稿では, 合成ウェブ型コーパスに対する知識発見とエビデンスに基づく要約に関する制御実験のための再現可能な検索ファーストテストベッドであるGuardianを提案する。
このアーキテクチャは、BM25検索とリスク認識、埋め込み強化、ハイブリッドリランクを組み合わせ、制約付き文書検索拡張生成と明示的な引用を併用する。
- 参考スコア(独自算出の注目度): 0.688204255655161
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Retrieving relevant evidence from noisy web data is challenging, particularly in sensitive domains containing incomplete reports, heterogeneous language, and irrelevant content. We present Guardian Crawler, a reproducible retrieval-first testbed for controlled experiments on knowledge discovery and evidence-grounded summarization over synthetic web-like corpora. The architecture combines BM25 retrieval with risk-aware, embedding-augmented, and hybrid reranking, followed by constrained retrieval-augmented generation with explicit document citations. Experiments on a synthetic 900-document corpus and 10 queries produced the highest descriptive retrieval scores under risk-based reranking, with P@10 = 1.00 and NDCG@10 = 0.94, compared with 0.94 and 0.81 for BM25. The best hybrid and BM25+Semantic configurations reached NDCG@10 values of 0.94 and 0.88, respectively. All 41 evaluable generated bullets passed the lexical coverage threshold; an automated LLM judge classified 36 as supported, one as partially supported, and four as unsupported. These results demonstrate the feasibility of Guardian Crawler as a controlled testbed but do not establish statistical superiority, human-validated faithfulness, or transfer to live-web investigative environments.
- Abstract(参考訳): ノイズの多いWebデータから関連する証拠を取得することは、特に不完全なレポート、異種言語、無関係コンテンツを含むセンシティブなドメインでは困難である。
合成ウェブのようなコーパス上での知識発見とエビデンスに基づく要約に関する制御実験のための再現可能な検索ファーストテストベッドであるGuardian Crawlerを提案する。
このアーキテクチャは、BM25検索とリスク認識、埋め込み強化、ハイブリッドリランクを組み合わせ、続いて明示的な文書引用を伴う制約付き検索拡張生成を行う。
P@10 = 1.00, NDCG@10 = 0.94, BM25は 0.94, 0.81 であった。
最高のハイブリッドとBM25+セマンティック構成はそれぞれ0.94と0.88のNDCG@10値に達した。
41発の弾頭は、レキシカル・カバー・しきい値に合格し、自動LLM判事は36発が支持され、1発が部分的に支持され、4発が支持された。
これらの結果は、Guardian Crawlerが制御テストベッドとして実現可能であることを示しているが、統計的優越性、人間公認の忠実性、ライブウェブ調査環境への移行は確立していない。
関連論文リスト
- SynCred-Bench: Benchmarking Synthetic Credibility in AI-Generated Visual Misinformation [82.22252244442744]
SynCRED-Benchは、信頼できる6つのカテゴリと7つのきめ細かい循環スタイルでバランスをとる、600個のAI生成の誤情報画像のベンチマークである。
5%の偽陽性レートの制約の下で、15個のMLLMは10.5%の真正レート(TPR)しか達成せず、オープンソースのAIGC検出器は5%以下である。
また、ヒトのアノテーターは合成信頼性の同定にも苦労し、TPRはわずか63%に達した。
論文 参考訳(メタデータ) (2026-06-02T08:57:38Z) - SPECTRA: Synthetic IR Test Collections with Relevance Oracles and Controlled Distractor Diagnostics [0.8557392136621891]
本稿では,合成テキストコーパスと検索テストコレクションを生成するための再現可能なフレームワークであるSPECTRAを紹介する。
シングルプロセスのPythonプロトタイプは、最大6万のドキュメントと9.61万のトークンをコーパス生成し、制御可能な長尾語彙の成長を保存する。
その結果,軽量合成コーパスは,コストのかかるコレクション構築を開始する前に,検索システムスケーリングと障害モードを公開することができることがわかった。
論文 参考訳(メタデータ) (2026-05-29T17:44:15Z) - SilentRetrieval: Hijacking Retrieval-Augmented Generation via Semantically-Preserving Adversarial Data Poisoning [1.0998907972211756]
SilentRetrievalは2段階のデータ中毒攻撃で、RAGシステムを敵対的な文書でハイジャックする。
SilentRetrievalは84.6%/81.3% HR@10、57.5%/54.8% ASR-LLM on Natural QuestionsとMS MARCOを達成している。
論文 参考訳(メタデータ) (2026-05-27T07:30:30Z) - Benchmarking Patent Embeddings: A Multi-Task Evaluation of 22 Models Across Retrieval, Classification, and Clustering [0.0]
我々は,情報検索,分類,クラスタリングという3つのタスクに対して,事前学習した22の埋め込みモデルを評価する。
2つの結果は、一般的な知恵に疑問を投げかけている。
論文 参考訳(メタデータ) (2026-05-22T23:51:13Z) - Benchmarking Retrieval Strategies for Biomedical Retrieval-Augmented Generation: A Controlled Empirical Study [0.0]
本稿では,生物医学的質問応答RAGパイプラインにおける5つの検索戦略の体系的比較について述べる。
すべての戦略は固定生成モデル(GPT-4o-mini)、共通ベクトルストア(ChromaDB)、OpenAIのテキスト-em-3-小埋め込みを共有している。
BioASQベンチマークの前処理部分集合から抽出した250の質問応答対について評価を行った。
論文 参考訳(メタデータ) (2026-05-04T12:21:46Z) - SAGE: Benchmarking and Improving Retrieval for Deep Research Agents [60.53966065867568]
SAGEは4つの科学領域にわたる1200のクエリからなる科学文献検索のためのベンチマークであり、20万の論文検索コーパスを備える。
6つのディープ・リサーチ・エージェントを評価し,全てのシステムが推論集約的な検索に苦しむことを発見した。
BM25は、既存のエージェントがキーワード指向のサブクエリを生成するため、LLMベースのレトリバーを約30%上回っている。
論文 参考訳(メタデータ) (2026-02-05T18:25:24Z) - How Far Are We from Genuinely Useful Deep Research Agents? [48.596990593729]
Deep Research Agents (DRA) は、反復的な情報検索と合成によってアナリストレベルのレポートを自動的に生成することを目的としている。
レポート合成の現在のベンチマークは、タスクの複雑さと主観的なメトリクスに悩まされている。
我々は,100個の人為的な研究タスクからなる改良されたベンチマークであるFINDER(FinDER)について述べる。
論文 参考訳(メタデータ) (2025-12-01T17:58:59Z) - BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent [74.10138164281618]
BrowseComp-Plus(BrowseComp-Plus)は、BrowseCompから派生したベンチマークである。
このベンチマークは、ディープリサーチエージェントと検索方法の総合的な評価とアンタングル解析を可能にする。
論文 参考訳(メタデータ) (2025-08-08T17:55:11Z) - HySemRAG: A Hybrid Semantic Retrieval-Augmented Generation Framework for Automated Literature Synthesis and Methodological Gap Analysis [55.2480439325792]
HySemRAGは、Extract, Transform, Load (ETL)パイプラインとRetrieval-Augmented Generation (RAG)を組み合わせたフレームワークである。
システムは、マルチ層アプローチを通じて既存のRAGアーキテクチャの制限に対処する。
論文 参考訳(メタデータ) (2025-08-01T20:30:42Z) - Evaluating Hybrid Retrieval Augmented Generation using Dynamic Test Sets: LiveRAG Challenge [8.680958290253914]
本稿では,動的テストセット上での検索強化生成システム(RAG)の評価を行うLiveRAG Challenge 2025を提案する。
我々の最後のハイブリッドアプローチはスパース (BM25) と高密度 (E5) の検索手法を組み合わせたものである。
RankLLaMA を用いたニューラルリランクでは MAP は0.523 から 0.797 に向上するが,計算コストは禁忌である。
論文 参考訳(メタデータ) (2025-06-27T21:20:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。