論文の概要: Explore Before Committing: Hypothesis-Guided Search for Deep Research Agents
- arxiv url: http://arxiv.org/abs/2609.01294v1
- Date: Tue, 01 Sep 2026 14:27:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.7636
- Title: Explore Before Committing: Hypothesis-Guided Search for Deep Research Agents
- Title(参考訳): 深層研究エージェントの仮説ガイドによる探索
- Authors: Ruochen Zhou, Zhengyu Chen, Luan Zhang, Siyang Gao, Yee Whye Teh, Shiqi Chen,
- Abstract要約: Deep-Researchエージェントは、検索やブラウジングツールと対話することで、複雑な質問に答える。
我々の軌道レベルの分析では、エージェントがいくつかの可能な方向を持つ早期探索状態に遭遇する共通の故障モードが明らかである。
ソフト検索ヒントとして軽量な仮説を生成するPhySearchを提案する。
- 参考スコア(独自算出の注目度): 31.422069133506696
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deep-research agents answer complex questions by interacting with search and browsing tools, yet they often search along a single evolving trajectory. Our trajectory-level analysis reveals a common failure mode in which the agent may encounter an early search state with several plausible directions, but follow one direction before collecting enough comparative evidence. Once this happens, subsequent tool calls tend to reinforce the same path, increasing the chance of failure when the initial direction is misleading. We further find that successful trajectories reduce this risk through two behaviors: grounding vague exploration in concrete candidates and shifting directions when the current path is weak or incomplete. Based on these findings, we propose HypoSearch, which generates lightweight hypotheses as soft search hints, explores them through bounded independent branches, and compares branch-level evidence before commitment. Across four deep-research benchmarks and three backbone models, HypoSearch consistently outperforms single-trajectory search and standard parallel baselines, improving Qwen3.5-122B from 46.7 to 60.0 on BC-small while using fewer tool calls than five independent trajectories. A pilot supervised fine-tuning study further shows that these behavioral signals can curate compact training trajectories and reduce degradation from unfiltered data.
- Abstract(参考訳): Deep-Researchエージェントは、検索やブラウジングツールと対話することで複雑な質問に答えるが、彼らはしばしば、単一の進化軌道に沿って検索する。
我々の軌道レベルの分析では、エージェントがいくつかの妥当な方向の早期探索状態に遭遇するが、十分な比較証拠を収集する前に一つの方向をたどる共通の障害モードが示される。
これが起こると、後続のツールコールが同じパスを補強する傾向にあり、最初の方向が誤解を招く場合に失敗する確率が増加する。
さらに, 軌道軌道を成功させることによって, 具体的な候補の曖昧な探索と, 現在の経路が弱い場合や不完全である場合の方向転換という2つの行動によって, このリスクを低減できることが判明した。
これらの知見に基づいて,ソフトな探索ヒントとして軽量な仮説を生成し,それらを有界な独立ブランチを通して探索し,コミット前の分岐レベルの証拠と比較するHypoSearchを提案する。
4つのDeep-Researchベンチマークと3つのバックボーンモデルで、PhyseSearchはシングルトラック検索と標準並列ベースラインを一貫して上回り、Qwen3.5-122BをBC小で46.7から60.0に改善し、5つの独立したトラジェクトリよりも少ないツールコールを使用した。
さらに、パイロットによる微調整研究により、これらの行動信号は、コンパクトな訓練軌跡を硬化させ、フィルタされていないデータからの劣化を低減できることが示された。
関連論文リスト
- How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks [6.001213285107465]
AutoResearchEvalは、7つの科学領域にまたがるフロンティア科学に根ざした100のタスクを特徴としている。
8つのハーネスモデルの組み合わせを評価すると、800個のオート検索剤の軌道が得られる。
我々は,人間のキャリブレーションしたエージェント・アズ・ア・ジャッジ・パイプラインを利用して,完全な軌道や中間成果物を検査する。
論文 参考訳(メタデータ) (2026-08-14T21:39:38Z) - SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents [56.400332595452966]
我々は、監査人が検索エージェントの障害をローカライズ、属性付け、修復できるかどうかを評価するベンチマークであるSearchAuditBenchを紹介する。
SearchAuditBenchは1,243の障害トラックで構成され、平均73.1メッセージと65.1Kトークンを5つのディープサーチベンチマークで8つのオープンウェイトモデルから収集している。
本稿では,検索エージェントの障害を効果的にローカライズ,属性,修復するマルチパースペクティブ監査フレームワークであるSearchAuditorを提案する。
論文 参考訳(メタデータ) (2026-08-05T09:09:00Z) - Diagnosing Search Behavior and Failure Modes in Long-Horizon Search Agents [63.2133766267587]
ディープサーチエージェントは、証拠収集のために検索クエリを反復的に発行することで、難解な情報検索質問に答える。
本研究では,長軸探索エージェントの軌跡レベル診断を用いてこれらの質問について検討する。
我々は,各探索ステップで得られた証拠を評価し,エージェントの行動の2つの段階を分離する。
論文 参考訳(メタデータ) (2026-08-03T08:46:48Z) - AREX: Towards a Recursively Self-Improving Agent for Deep Research [75.96468303743958]
本稿では,再帰的自己改善型ディープリサーチエージェントであるAREXを紹介する。
AREXは、証拠を集め、暫定的な回答を構築する内部研究ループを交互に構成する。
我々は,エージェント学習と長期強化学習を通じて,AREXを検証済みの合成タスクと高品質な軌道上で訓練する。
論文 参考訳(メタデータ) (2026-07-23T16:05:46Z) - Silent Failures in Multimodal Agentic Search:A Diagnostic Taxonomy and Cross-Judge Evaluation [7.095219140870008]
既存の評価は主に最終回答の精度に重点を置いており、探索軌道の失敗を見逃す可能性がある。
本報告では,ショートカット,ファントム接地,不正証拠権訴訟,オーバー・レトリーバル・ロンダリング,クロス・モーダル・コンフリクション,証明を対象とする6カテゴリーの分類を紹介した。
統合されたReActスタイルの足場の下で,回答の正しさと証拠地上品質の両方を評価する軌道レベルの診断パイプラインを構築した。
論文 参考訳(メタデータ) (2026-07-22T06:19:06Z) - Learning the ARTS of Search for Automated Discovery [62.89970162621959]
本稿では, 木探索のためのエージェント推論を提案し, 科学的発見を誘導する。
このスペースをナビゲートするために、推論言語モデルをデプロイします。
我々は、ARTSが主要なアルゴリズムより優れていることを示す。
論文 参考訳(メタデータ) (2026-06-20T05:47:37Z) - FORT-Searcher: Synthesizing Shortcut-Resistant Search Tasks for Training Deep Search Agents [79.32220873172078]
ディープ・サーチ・エージェントの訓練には、十分な証拠が検索を通じて取得されるまで回答が得られない検証可能な質問が必要である。
このギャップをショートカット対応の難易度フレームワークで形式化し、4つの実行可能なショートカットリスクを特定する。
このフレームワークによってガイドされたFORTは、ショートカット耐性トレーニングデータ合成のフレームワークである。
論文 参考訳(メタデータ) (2026-06-10T13:49:11Z) - Learning to Retrieve from Agent Trajectories [72.8923565916533]
我々はエージェント間相互作用データから直接エージェント探索のための検索モデルを訓練すべきであると主張している。
エージェント・トラジェクトリからの学習を新たな訓練パラダイムとして導入し,マルチステップエージェントのインタラクションから指導を導出する。
本研究は,エージェント探索時代における検索の方向性を示すとともに,エージェントトラジェクトリを実用的でスケーラブルな監視源として強調するものである。
論文 参考訳(メタデータ) (2026-03-30T17:59:02Z) - Beneficial Reasoning Behaviors in Agentic Search and Effective Post-training to Obtain Them [23.986035712600657]
エージェント探索における効果的な推論行動パターンを研究するための推論駆動パイプラインを提案する。
我々は,情報検証,権限評価,適応探索,エラー回復の4つの有益な推論行動を特定する。
Llama3.2-3B と Qwen3-1.7B では, RL を用いたエージェントサーチモデルを直接訓練した場合と比較して, 行動プライミングが 35% 以上の利得を示す。
論文 参考訳(メタデータ) (2025-10-08T00:20:35Z) - Adversarial Search and Tracking with Multiagent Reinforcement Learning
in Sparsely Observable Environment [7.195547595036644]
本研究では,探索・追跡(S&T)問題として,動的探索エージェントのチームが協調して,敵対的,回避的エージェントを追跡することを提案する。
この問題は, モデルベース探索・強化学習(RL)手法の両手法において, 探索エージェントのスパース検出に繋がる大規模な空間において, 反抗的かつ詐欺的回避行動を示すため, 課題となる。
本稿では,学習可能なフィルタリングモデルから推定逆位置を利用する新しいMulti-Agent RL(MARL)フレームワークを提案する。
論文 参考訳(メタデータ) (2023-06-20T05:31:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。