論文の概要: SimpleWikiSearch: A Clean Offline Wikipedia Environment for Agentic Search
- arxiv url: http://arxiv.org/abs/2607.26070v1
- Date: Fri, 10 Jul 2026 13:05:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.096758
- Title: SimpleWikiSearch: A Clean Offline Wikipedia Environment for Agentic Search
- Title(参考訳): SimpleWikiSearch: エージェント検索のためのクリーンなオフラインWikipedia環境
- Authors: Guanming Xiong, Penghui Zhang,
- Abstract要約: コーパス構築,検索スタック,ツール契約,評価プロトコルが明確で実行可能であるSimpleWikiSearchを提案する。
環境は、完全なウィキペディアダンプから始まり、コーパスを掃除してチャンクし、キーワードと密度の高い検索インデックスを構築し、最小限のツールインターフェースを公開する。
オープンソースLCMを用いた6つのQAデータセットのベースライン結果と、クローズドソース商用モデルとの比較のためのランダム300サブセットについて報告する。
- 参考スコア(独自算出の注目度): 2.1542644686007173
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model (LLM)-based agentic search systems are often evaluated as if the underlying LLM were the only component that matters, yet their measured performance also depends on the surrounding search environment: the Wikipedia snapshot, preprocessing pipeline, chunking policy, retrieval backend, tool schema, observation format, and answer submission rule. These details are frequently under-specified, making it difficult to compare results or reproduce reported baselines. We present SimpleWikiSearch, whose corpus construction, retrieval stack, tool contract, and evaluation protocol are explicit and runnable. The environment starts from a full English Wikipedia dump, cleans and chunks the corpus, builds keyword and dense retrieval indexes, and exposes a minimal tool interface consisting of \texttt{search}, \texttt{open\_url}, and \texttt{submit\_answer}. We report baseline results on six QA datasets using open-source LLMs and provide a random-300 subset for comparisons with closed-source commercial models. SimpleWikiSearch provides a domain-specific agent harness and a controlled offline environment for reproducible agentic-search evaluation. Its contribution is this specified reference setup, rather than a new agent algorithm. Code and data will be available at: https://github.com/JimXiongGM/simple_wiki_search.
- Abstract(参考訳): 大規模言語モデル(LLM)ベースのエージェント検索システムは、基礎となるLLMが重要なコンポーネントであるかのように評価されることが多いが、その測定性能は、ウィキペディアのスナップショット、前処理パイプライン、チャンキングポリシー、検索バックエンド、ツールスキーマ、観察フォーマット、回答の提出規則など、周辺の検索環境にも依存する。
これらの詳細は、しばしば不特定であり、結果の比較や報告されたベースラインの再現が困難である。
コーパス構築,検索スタック,ツール契約,評価プロトコルが明確で実行可能であるSimpleWikiSearchを提案する。
環境は完全なウィキペディアダンプから始まり、コーパスをきれいにし、キーワードと密集した検索インデックスを構築し、最小限のツールインターフェースを公開し、 \texttt{search}、 \texttt{open\_url}、 \texttt{submit\_answer} である。
オープンソースLCMを用いた6つのQAデータセットのベースライン結果と、クローズドソース商用モデルとの比較のためのランダム300サブセットについて報告する。
SimpleWikiSearchはドメイン固有のエージェントハーネスと、再現可能なエージェント検索評価のための制御されたオフライン環境を提供する。
その貢献は、新しいエージェントアルゴリズムではなく、この特定の参照設定である。
コードとデータは、https://github.com/JimXiongGM/simple_wiki_search.comで入手できる。
関連論文リスト
- SAGA: Schema-Aware Grounding for Agentic Text-to-SPARQL Generation [3.01421775057336]
複雑な知識ベース質問応答(KBQA)は、質問固有のサブグラフ上の情報検索か、あるいは意味解析によって実行可能な論理形式にアプローチすることが一般的である。
最近の大規模言語モデルエージェントは、セマンティックパースをインタラクティブにする。推論、知識ベースへのクエリ、部分的なSPARQLクエリの拡張を交互に行う。
本稿では,SAGA(UnderlineSchema-underlineAware UnderlineGrounding for UnderlineAgentic Text-to-SPARQL Generation)を提案する。
論文 参考訳(メタデータ) (2026-07-16T02:17:21Z) - Towards Retrieving Interaction Spaces for Agentic Search [62.666902610940525]
最近の直接コーパス(DCI)の研究は、エージェントが5.4のインタラクションやファイル読み取りといったシェルツールを通じて生コーパスと対話できることを示している。
エージェント検索における検索の役割は, LLMコンテキストウィンドウに適合する文書を選択することだけではなく, インタラクション空間を構築することにある。
論文 参考訳(メタデータ) (2026-06-05T03:47:40Z) - GrepSeek: Training Search Agents for Direct Corpus Interaction [66.69568141699311]
GrepSeekは、コンパクトな検索エージェントを訓練し、大きなテキストコーパスから証拠を見つけ、フィルタリングし、構成する、最適化された直接コーパスインタラクション(DCI)検索エージェントである。
DCIを大規模に実用化するためには、シェルコマンドのシーケンシャルな実行とバイトエクササイズ等価性を保ちながら、シェルベースの検索を最大7.6タイムで高速化するセマンティックス保存のシャード並列実行エンジンを使用する。
論文 参考訳(メタデータ) (2026-05-28T03:37:33Z) - Retrieval as Reasoning: Self-Evolving Agent-Native Retrieval via LLM-Wiki [6.956097396264084]
LLMエージェントは、検索をワンショットのコンテキストフェッチのように振る舞うのではなく、推論のように振る舞う必要がある。
現在、RAG(Retrieval-Augmented Generation)システムは、類似性を埋め込んだフラットチャンクとして外部知識を整理している。
本稿では,外部知識をコンパイル可能,構成可能,自己進化的構造として扱うことにより,検索パラダイムを運用するエージェントネイティブ検索システム LLM-Wiki を提案する。
論文 参考訳(メタデータ) (2026-05-25T06:36:14Z) - Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction [127.64173950476702]
エージェントが直接、汎用端末ツールを用いて、生コーパスを直接検索する直接コーパス間相互作用(DCI)について検討する。
このアプローチではオフラインインデックスを必要とせず、ローカルコーパスの進化に自然に適応する。
IRベンチマークとエンドツーエンドのエージェント検索タスク全体にわたって、この単純なセットアップは、強いスパース、密度、リランクベースラインよりも大幅に優れています。
論文 参考訳(メタデータ) (2026-05-03T19:13:11Z) - FS-Researcher: Test-Time Scaling for Long-Horizon Research Tasks with File-System-Based Agents [53.03492387564392]
我々はFS-Researcherを紹介した。FS-Researcherはファイルシステムベースのフレームワークで、永続的なワークスペースを通じてコンテキストウィンドウを超えて深い研究をスケールする。
Context Builderエージェントはインターネットを閲覧し、構造化されたノートを書き、ソースを階層的な知識ベースにアーカイブする。
その後、レポートライターエージェントが最終レポートセクションをセクションごとに構成し、知識ベースを事実のソースとして扱う。
論文 参考訳(メタデータ) (2026-02-02T03:00:19Z) - Description-Based Text Similarity [59.552704474862004]
我々は、その内容の抽象的な記述に基づいて、テキストを検索する必要性を特定する。
そこで本研究では,近隣の標準探索で使用する場合の精度を大幅に向上する代替モデルを提案する。
論文 参考訳(メタデータ) (2023-05-21T17:14:31Z) - Improving Candidate Retrieval with Entity Profile Generation for
Wikidata Entity Linking [76.00737707718795]
本稿では,エンティティ・プロファイリングに基づく新しい候補探索パラダイムを提案する。
我々は、このプロファイルを使用してインデックス付き検索エンジンに問い合わせ、候補エンティティを検索する。
本手法は,ウィキペディアのアンカーテキスト辞書を用いた従来の手法を補完するものである。
論文 参考訳(メタデータ) (2022-02-27T17:38:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。