論文の概要: When Search Agents Should Ask: DiscoBench for Clarification-Aware Deep Search
- arxiv url: http://arxiv.org/abs/2606.27669v2
- Date: Wed, 01 Jul 2026 06:56:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 15:15:53.051969
- Title: When Search Agents Should Ask: DiscoBench for Clarification-Aware Deep Search
- Title(参考訳): 検索エージェントが尋ねるべき時:DiscoBenchは、明確化を意識したディープサーチ
- Authors: Yiling Tao, Shihan Deng, Meiling Tao, Pengzhi Wei, Zhichao Hu, Zhihao Zhu,
- Abstract要約: 本稿では,DecoBenchについて紹介する。
探索エージェントが曖昧さを積極的に識別し、効果的な明確化の質問をし、ユーザインタラクションを通じて正しい推論経路を復元できるかどうかを評価するように設計されている。
実験により、あいまいさの検出と効果的な明確化は異なる能力であり、明確化を求める代わりに繰り返し検索することが直接推測よりも悪いことが示されている。
- 参考スコア(独自算出の注目度): 6.384441153713447
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Search agents powered by large language models (LLMs) are increasingly used to solve complex information-seeking tasks, requiring multi-step retrieval and reasoning to fulfill user goals. However, existing benchmarks often assume that user queries are complete and explicit, overlooking the fact that real-world search requests are frequently vague, underspecified, or even factually incorrect. In deep search scenarios, such ambiguity can propagate along multi-step reasoning chains and lead agents toward incorrect search trajectories. To address this gap, we introduce DiscoBench, a benchmark for clarification-aware deep search, designed to evaluate whether search agents can proactively identify ambiguity, ask effective clarification questions, and recover correct reasoning paths through user interaction. DiscoBench contains 211 samples and 463 ambiguity instances across 11 real-world domains, covering four ambiguity types. We further design a user simulator for multi-turn interaction and evaluate model performance from four perspectives: task utility, ambiguity detection, interaction strategy, and cost efficiency. Experiments on representative LLMs show that ambiguity detection and effective clarification are distinct capabilities, and that repeatedly searching instead of asking for clarification often performs worse than direct guessing, highlighting a critical gap between retrieval ability and interactive problem-solving in current search agents.
- Abstract(参考訳): 大規模言語モデル(LLM)を利用した検索エージェントは、ユーザ目標を達成するために多段階の検索と推論を必要とする複雑な情報探索タスクの解決にますます利用されている。
しかし、既存のベンチマークでは、ユーザクエリが完全で明示的であると仮定され、現実の検索要求がしばしばあいまいで、仕様が不明確で、事実的にも誤りであるという事実を見落としている。
ディープ・サーチのシナリオでは、そのような曖昧さは多段階の推論連鎖に沿って伝播し、間違ったサーチ・トラジェクトリーに向かってリードエージェントを導くことができる。
このギャップに対処するために,探索エージェントが曖昧さを積極的に識別し,効果的な明確化質問をし,ユーザインタラクションを通じて正しい推論経路を復元できるかどうかを評価するために設計されたディープサーチのベンチマークであるDiscoBenchを紹介した。
DiscoBenchには、11の現実世界ドメインにわたる211のサンプルと463のあいまいさインスタンスが含まれており、4つのあいまいさタイプを含んでいる。
さらに,マルチターンインタラクションのためのユーザシミュレータを設計し,タスクユーティリティ,あいまいさ検出,インタラクション戦略,コスト効率の4点からモデル性能を評価する。
代表的LSM実験では、曖昧さの検出と効果的な明確化は別個の能力であり、明確化を求める代わりに繰り返し検索することが、検索能力と現在の検索エージェントにおける対話的問題解決との重大なギャップを浮き彫りにすることで、直接推測よりも悪い結果をもたらすことが示されている。
関連論文リスト
- Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction [127.64173950476702]
エージェントが直接、汎用端末ツールを用いて、生コーパスを直接検索する直接コーパス間相互作用(DCI)について検討する。
このアプローチではオフラインインデックスを必要とせず、ローカルコーパスの進化に自然に適応する。
IRベンチマークとエンドツーエンドのエージェント検索タスク全体にわたって、この単純なセットアップは、強いスパース、密度、リランクベースラインよりも大幅に優れています。
論文 参考訳(メタデータ) (2026-05-03T19:13:11Z) - AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement Learning [52.305422887002656]
本稿では,自己生成中間回答を用いて各探索ステップを評価する強化学習フレームワークを提案する。
自己回答機構により、AutoSearchは最小限の検索深度を特定し、効率的な検索を促進する。
実験の結果、AutoSearchは検索品質を維持しながら過剰検索を軽減し、精度と効率のトレードオフが優れていることがわかった。
論文 参考訳(メタデータ) (2026-04-19T09:05:48Z) - HotelQuEST: Balancing Quality and Efficiency in Agentic Search [6.1626572270420334]
エージェント検索は,大規模言語モデル(LLM)を利用した適応検索システムにおいて,有望なパラダイムとして登場した。
ホテルクエスト(HotelQuEST)は、214のホテル検索クエリからなるベンチマークで、単純な事実要求から複雑なクエリまで様々である。
LLMをベースとしたエージェントは,従来のレトリバーよりも精度が高いが,冗長なツールコールや準最適ルーティングによるコストが著しく高いことがわかった。
論文 参考訳(メタデータ) (2026-02-27T11:50:57Z) - Over-Searching in Search-Augmented Large Language Models [22.821710825732563]
検索強化された大言語モデル(LLM)は、外部検索を統合することで知識集約的なタスクに優れる。
過剰探索は、無関係な文脈を取り入れることで、計算の非効率性と幻覚をもたらす。
以上の結果から, (i) 解答可能な問合せに対する解答精度は向上するが, 解答不可能な問合せに対する棄却を損なうこと, (ii) 過剰探索が複雑な推論モデルや深層研究システムにおいてより顕著であること, (iii) 否定的証拠の存在が棄却を改善していることが示唆された。
論文 参考訳(メタデータ) (2026-01-09T03:24:46Z) - Beyond Monolithic Architectures: A Multi-Agent Search and Knowledge Optimization Framework for Agentic Search [56.78490647843876]
エージェント検索は、大規模言語モデル(LLM)が推論とツールの使用をインターリーブできるようにすることによって、複雑な情報を探すための有望なパラダイムとして登場した。
本稿では,bfM-ASKを提案する。bfM-ASK,bfM-ASK,bfM-ASK,bfM-ASK,bfM-ASK,bfM-ASK,bfM-ASK,bfM-ASK。
論文 参考訳(メタデータ) (2026-01-08T08:13:27Z) - AdaSearch: Balancing Parametric Knowledge and Search in Large Language Models via Reinforcement Learning [61.974530499621274]
検索への過度な依存は、ノイズや悪意のあるコンテンツに対する不必要なコストとリスクをもたらす。
本稿では,探索を起動するか否かの判断から問題を解き放つ2段階の結果駆動型RLフレームワークを提案する。
AdaSearchは知識境界認識を大幅に改善し、不要な検索コールを削減し、タスクパフォーマンスを強く保ち、透明性と解釈可能な意思決定行動を提供する。
論文 参考訳(メタデータ) (2025-12-18T18:50:01Z) - InteractComp: Evaluating Search Agents With Ambiguous Queries [36.05005463045869]
検索エージェントがクエリのあいまいさを認識でき、検索中に積極的に対話できるかどうかを評価するためのベンチマークであるInteractCompを紹介する。
最高のモデルでは71.50%の完全コンテキストにもかかわらず、13.73%の精度しか達成していない。
この停滞は、検索タスク固有の即時フィードバックと相まって、InteractCompは、検索エージェントのインタラクション機能の評価とトレーニングの両方に有用なリソースとなる。
論文 参考訳(メタデータ) (2025-10-28T17:35:54Z) - Sherlock Your Queries: Learning to Ask the Right Questions for Dialogue-Based Retrieval [0.0]
SherlockLLMは、Reinforcement Learning (RL)を通じて最適な質問戦略を学ぶ対話駆動検索フレームワークである。
本フレームワークでは,探索空間を効率的に絞り込むために,エージェントが2次質問列を生成するように訓練する。
実験の結果,SherlockLLMは堅牢で効率的な解であることがわかった。
論文 参考訳(メタデータ) (2025-10-21T14:10:42Z) - RE-Searcher: Robust Agentic Search with Goal-oriented Planning and Self-reflection [55.125987985864896]
環境の複雑さが脆弱な探索行動をいかに引き起こすかを定量的に分析する。
本稿では,検索エージェントRE-Searcherのインスタンス化をシンプルかつ効果的に行う手法を提案する。
この目標指向計画と自己回帰の組み合わせにより、RE-Searcherは複雑な検索環境における急激な手がかりに抵抗することができる。
論文 参考訳(メタデータ) (2025-09-30T10:25:27Z) - CLEAR-KGQA: Clarification-Enhanced Ambiguity Resolution for Knowledge Graph Question Answering [13.624962763072899]
KGQAシステムは通常、ユーザクエリは曖昧であると仮定するが、これは現実世界のアプリケーションではめったに行われない仮定である。
本稿では,対話的明確化を通じて,エンティティのあいまいさ(類似した名前を持つエンティティの区別など)と意図のあいまいさ(ユーザクエリの異なる解釈を明確にするなど)を動的に扱う新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-04-13T17:34:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。