論文の概要: As We May Search
- arxiv url: http://arxiv.org/abs/2606.29652v1
- Date: Sun, 28 Jun 2026 23:46:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.998594
- Title: As We May Search
- Title(参考訳): さすがに検索
- Abstract要約: ローカルファーストIRは、インデックス、モデル、推論がユーザデバイスに存在し、リモートサービスをオプションとして扱う設計哲学である。
デンス検索では、最大で91%のnDCG@10ドキュメントが100Kまで保持され、およそ1Mまで拡張され、品質損失はわずか2%である。
- 参考スコア(独自算出の注目度): 3.0395818832071697
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The sensitive information in personal documents, legal files, and medical records is among the most valuable things to search, yet current retrieval-augmented generation systems still require sending content to remote servers. We propose local-first IR, a design philosophy where indexes, models, and inference reside on user devices, treating remote services as optional. This paper makes four contributions: (1) a framework organizing retrieval architectures along three dimensions: privacy and control, capability, and accessibility, (2) experiments on consumer hardware across five benchmarks, scaling from 1K to 1M documents with dense retrieval, BM25, and hybrid fusion. Dense retrieval keeps over 91% nDCG@10 up to 100K documents, with approximate HNSW indexes extending this to 1M with only 2% quality loss; a 7B local language model reaches within 4 points of a cloud baseline on answer quality, (3) competing perspectives for and against local-first IR, informed by experimental evidence, and (4) a research agenda identifying open problems. The real tradeoff is scope rather than quality: what matters is what you can search, not how well you can search it.
- Abstract(参考訳): 個人情報、法的ファイル、医療記録などの機密情報は、検索にとって最も価値のあるものの1つだが、現在の検索強化された生成システムは、リモートサーバーにコンテンツを送信する必要がある。
本稿では、ユーザデバイス上にインデックス、モデル、推論を配置し、リモートサービスをオプションとして扱う設計哲学であるローカルファーストIRを提案する。
本論文は,(1)プライバシとコントロール,能力,アクセシビリティの3つの側面に沿って検索アーキテクチャを編成するフレームワーク,(2)高密度検索を伴う1Kから100Mドキュメントへのスケーリング,BM25,ハイブリッドフュージョンの3つのベンチマークによるコンシューマハードウェアの実験を行う。
7Bのローカル言語モデルは、応答品質のクラウドベースラインの4ポイント以内に到達し、(3)実験的な証拠によって情報を得たローカルファーストIRと競合する視点、(4)オープンな問題を特定する研究課題である。
本当のトレードオフは、品質よりもスコープにある — 重要なのは、検索できるものであって、検索できるものではありません。
関連論文リスト
- Scientific Code Search at Scale: A Multi-Domain Dataset and Benchmark [1.5641443078984256]
我々は、NASAの5つのミッション・ディレクター・ディビジョンにまたがる、高品質でドメイン分類された5,264の科学リポジトリをキュレートしたコーパスを提示する。
1)ドメイン科学者が設計した219のエキスパートキュレートクエリを備えたリポジトリ検索ベンチマーク,2)117,950のコードスニペットと7つのプログラミング言語にわたる119,720のクエリを含む大規模コードスニペット検索ベンチマークを紹介する。
論文 参考訳(メタデータ) (2026-07-03T19:30:06Z) - Intelligent Multimodal Retrieval and Reasoning for Geospatial Knowledge Discovery on the I-GUIDE Platform [40.027921235408215]
本稿では, I-GUIDEプラットフォームに組み込み, マルチモーダルな地理空間検索拡張生成(RAG)システムであるI-GUIDE Smart Searchを提案する。
このシステムは、OpenSearchキーワード、ベクトル、空間インデックスをNeo4jナレッジグラフとメモリ対応クエリ拡張のための反復RAGパイプラインと組み合わせる。
シングルA100 RAGデプロイメントでは、I-GUIDE Smart Searchは100人の同時シミュレートされたユーザに対してインタラクティブな利用をサポートし、クエリ毎の20-50 LLMコールにもかかわらず、p50レイテンシが25秒近くで毎秒4.4リクエストに達した。
論文 参考訳(メタデータ) (2026-06-14T14:39:29Z) - AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery [55.70879973230979]
AutoResearchBenchは、自律的な科学文献発見のためのベンチマークである。
エージェントWebブラウジングに関する以前のベンチマークと比較すると、AutoResearchBenchは研究指向である。
最も強力なLCMでさえ、BrowseCompのような一般的なエージェントによるWebブラウジングベンチマークをほとんど征服したにもかかわらず、Deep Researchでは9.39%、Wide Researchでは9.31%の精度しか達成していない。
論文 参考訳(メタデータ) (2026-04-28T06:05:17Z) - PaperSearchQA: Learning to Search and Reason over Scientific Papers with RLVR [64.22412492998754]
我々は,1600万件のバイオメディカルペーパーを要約した検索コーパスを公開し,PaperSearchQAと呼ばれるファクトイックなQAデータセットを構築した。
我々は,この環境における検索エージェントを訓練し,非RL検索ベースラインを上回ります。
我々のデータ生成方法はスケーラブルで、他の科学領域にも容易に拡張できます。
論文 参考訳(メタデータ) (2026-01-26T06:46:16Z) - BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent [74.10138164281618]
BrowseComp-Plus(BrowseComp-Plus)は、BrowseCompから派生したベンチマークである。
このベンチマークは、ディープリサーチエージェントと検索方法の総合的な評価とアンタングル解析を可能にする。
論文 参考訳(メタデータ) (2025-08-08T17:55:11Z) - ManuSearch: Democratizing Deep Search in Large Language Models with a Transparent and Open Multi-Agent Framework [73.91207117772291]
ManuSearchは,大規模言語モデル(LLM)の深層検索を民主化するために設計された,透明でモジュール化されたマルチエージェントフレームワークである。
ManuSearchは検索と推論のプロセスを,(1)サブクエリを反復的に定式化するソリューション計画エージェント,(2)リアルタイムWeb検索を通じて関連文書を検索するインターネット検索エージェント,(3)生のWebコンテンツから重要な証拠を抽出する構造化Webページ読取エージェントの3つに分解する。
論文 参考訳(メタデータ) (2025-05-23T17:02:02Z) - BRIGHT: A Realistic and Challenging Benchmark for Reasoning-Intensive Retrieval [54.54576644403115]
BRIGHTは、関係する文書を検索するために、集中的推論を必要とする最初のテキスト検索ベンチマークである。
私たちのデータセットは、経済学、心理学、数学、コーディングなど、さまざまな領域にまたがる1,384の現実世界のクエリで構成されています。
クエリに関する明示的な推論を取り入れることで、検索性能が最大12.2ポイント向上することを示す。
論文 参考訳(メタデータ) (2024-07-16T17:58:27Z) - Improving Content Retrievability in Search with Controllable Query
Generation [5.450798147045502]
マシンが学習した検索エンジンは高い検索可能性バイアスを持ち、クエリの大部分が同じエンティティを返す。
そこで我々はCtrlQGenを提案する。CtrlQGenは、選択したインテントナローあるいは広義のクエリを生成する方法である。
音楽,ポッドキャスト,書籍の各分野のデータセットから得られた結果から,高密度検索モデルの検索可能性バイアスを著しく低減できることがわかった。
論文 参考訳(メタデータ) (2023-03-21T07:46:57Z) - Exposing Query Identification for Search Transparency [69.06545074617685]
本稿では,検索システムの2つのクラスにおいて,クエリとドキュメントの役割を逆転させることにより,検索タスクとしてのEQIの実現可能性について検討する。
本研究では,クエリのランク付けの質を評価するための評価基準を導出するとともに,近似EQIの様々な実践的側面に着目した経験的分析を行う。
論文 参考訳(メタデータ) (2021-10-14T20:19:27Z) - Fine-Grained Stochastic Architecture Search [6.277767522867666]
Fine-Grained Architecture Search (FiGS) は、より大きな候補アーキテクチャの集合を探索する微分可能な検索手法である。
FiGSは、構造化スパース正規化ペナルティを適用して、検索空間内の演算子を同時に選択・変更する。
既存の3つの検索空間にまたがって結果を示し、元の検索アルゴリズムのマッチングや性能を向上する。
論文 参考訳(メタデータ) (2020-06-17T01:04:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。