論文の概要: Search, Inspect, Fetch: Exploiting Structure-Aware Boolean Retrieval for Deep-Research Agents
- arxiv url: http://arxiv.org/abs/2608.02751v2
- Date: Wed, 05 Aug 2026 02:06:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.220185
- Title: Search, Inspect, Fetch: Exploiting Structure-Aware Boolean Retrieval for Deep-Research Agents
- Title(参考訳): 検索, 検査, フェッチ: 深部検索エージェントのための構造対応ブール検索
- Authors: Shuai Wang, Haodong Chen, Yu Yin, Shengyao Zhuang, Bevan Koopman, Guido Zuccon,
- Abstract要約: 既存のDeep-ResearchエージェントはSearch-Visitワークフローを使用して、タイトル、見出し、セクション、メタデータを通じて公開する構造を考慮せずに、Webページ全体を検索する。
Boolean Query Language (BQL) によって駆動される検索-インスペクション-フェッチ戦略である textscSieve を導入する。
ウェブページのフィールドを検索して候補をフィルタリングし、インターチェンジ可能なランク付け器を使ってそれらを注文し、構造に富んだ結果カードを検査し、選択したセクションのみを取得する。
- 参考スコア(独自算出の注目度): 50.35041517085015
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing deep-research agents use a Search--Visit workflow that retrieves whole webpages without considering the structure they expose through titles, headings, sections, and metadata. This prevents agents from directly constraining retrieval to parts of a webpage and often carries irrelevant content into their context. We introduce \textsc{Sieve}, a search--inspect--fetch strategy driven by a Boolean Query Language (BQL): it searches webpage fields to filter candidates, uses an interchangeable ranker to order them, presents structure-rich result cards for inspection, and fetches only selected sections. Across three QA collections, \textsc{Sieve} is more accurate than the strongest conventional Search--Visit configuration on each collection while using $20.7$--$50.6\%$ fewer tokens. Boolean filtering improves every tested ranker, and the accuracy--context advantage persists across retriever choices and agent backbones. Our implementation is included in the SkimSearchAgent library at https://github.com/ielab/skim-search-agent.
- Abstract(参考訳): 既存のDeep-Researchエージェントは、検索-Visitワークフローを使用して、タイトル、見出し、セクション、メタデータを通して公開する構造を考慮せずにWebページ全体を検索する。これにより、エージェントは、Webページの一部に直接検索を制約せず、しばしばコンテキストに関連のないコンテンツを運ぶことができる。我々は、Boolean Query Language(BQL)によって駆動される検索-inspect-fetch戦略である \textsc{Sieve}を紹介します。
3つのQAコレクション全体において、 \textsc{Sieve} は、各コレクションにおいて最強の Search-Visit 構成よりも正確であり、20.7$--$50.6\% より少ないトークンを使用する。
ブールフィルタリングはテスト対象のローダを改善し、精度-コンテキストの優位性はレトリバーの選択とエージェントのバックボーン間で持続する。
私たちの実装は、https://github.com/ielab/skim-search-agent.comのSkimSearchAgentライブラリに含まれています。
関連論文リスト
- GrepSeek: Training Search Agents for Direct Corpus Interaction [66.69568141699311]
GrepSeekは、コンパクトな検索エージェントを訓練し、大きなテキストコーパスから証拠を見つけ、フィルタリングし、構成する、最適化された直接コーパスインタラクション(DCI)検索エージェントである。
DCIを大規模に実用化するためには、シェルコマンドのシーケンシャルな実行とバイトエクササイズ等価性を保ちながら、シェルベースの検索を最大7.6タイムで高速化するセマンティックス保存のシャード並列実行エンジンを使用する。
論文 参考訳(メタデータ) (2026-05-28T03:37:33Z) - Deep-Research Agents Can Be Poisoned via User-Generated Content [8.098290223993954]
ディープリサーチエージェントは、単一の研究セッション中に多くの関連するクエリを発行する。
多くの一般的な検索トピックにおいて、RedditやWikipediaのようなプラットフォームから、同じユーザ生成コンテンツ(UGC)ページを何度も取得していることを示す。
この重なり合いは集中攻撃面を生成する。
我々はこの攻撃を3つの代表的なディープリサーチシステムに対して評価する。
論文 参考訳(メタデータ) (2026-05-22T21:46:32Z) - Revisiting Text Ranking in Deep Research [24.324221566628125]
Black-box Web Search APIは、検索コンポーネントの体系的な分析を妨げる。
我々は、深い研究環境において、IRテキストランキング手法における重要な発見とベストプラクティスの選択を再現する。
論文 参考訳(メタデータ) (2026-02-25T00:18:07Z) - Chain of Retrieval: Multi-Aspect Iterative Search Expansion and Post-Order Search Aggregation for Full Paper Retrieval [68.71038700559195]
The Chain of Retrieval (COR) is a novel repeaterative framework for full-paper search。
SCIBENCH(SCIBENCH)は、クエリと候補のための全論文の完全なコンテキストとセグメント化されたコンテキストを提供するベンチマークである。
論文 参考訳(メタデータ) (2025-07-14T08:41:53Z) - Database-Augmented Query Representation for Information Retrieval [71.41745087624528]
データベース拡張クエリ表現(DAQu)と呼ばれる新しい検索フレームワークを提案する。
DAQuは、元のクエリを複数のテーブルにまたがるさまざまな(クエリ関連の)メタデータで拡張する。
我々はDAQuを多様な検索シナリオで検証し、全体の検索性能を大幅に向上させることを示した。
論文 参考訳(メタデータ) (2024-06-23T05:02:21Z) - Integrating connection search in graph queries [6.948362325254044]
SPARQLやCypherといったグラフクエリ言語に接続ツリーパターン(CTP)を統合する方法を示す。
非常に大きな探索空間に対処するため,我々は効率的な刈り込み手法を提案し,我々のアルゴリズムMOLESPがプルーニングでも完備しているケースの集合を正式に確立する。
論文 参考訳(メタデータ) (2022-08-09T14:27:57Z) - Graph Enhanced BERT for Query Understanding [55.90334539898102]
クエリ理解は、ユーザの検索意図を探索し、ユーザが最も望まれる情報を発見できるようにする上で、重要な役割を果たす。
近年、プレトレーニング言語モデル (PLM) は様々な自然言語処理タスクを進歩させてきた。
本稿では,クエリコンテンツとクエリグラフの両方を活用可能な,グラフ強化事前学習フレームワークGE-BERTを提案する。
論文 参考訳(メタデータ) (2022-04-03T16:50:30Z) - Improving Candidate Retrieval with Entity Profile Generation for
Wikidata Entity Linking [76.00737707718795]
本稿では,エンティティ・プロファイリングに基づく新しい候補探索パラダイムを提案する。
我々は、このプロファイルを使用してインデックス付き検索エンジンに問い合わせ、候補エンティティを検索する。
本手法は,ウィキペディアのアンカーテキスト辞書を用いた従来の手法を補完するものである。
論文 参考訳(メタデータ) (2022-02-27T17:38:53Z) - CSFCube -- A Test Collection of Computer Science Research Articles for
Faceted Query by Example [43.01717754418893]
例によるフェーステッドクエリのタスクを紹介します。
ユーザは、入力クエリドキュメントに加えて、より細かいアスペクトを指定することもできる。
我々は,クエリ科学論文に類似した科学的論文を検索できるモデルを構想する。
論文 参考訳(メタデータ) (2021-03-24T01:02:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。