論文の概要: DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment
- arxiv url: http://arxiv.org/abs/2607.07820v2
- Date: Mon, 13 Jul 2026 12:09:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.266839
- Title: DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment
- Title(参考訳): DeepSearch-World: 検証可能な環境におけるディープ検索エージェントの自己蒸留
- Abstract要約: DeepSearch-Evolveは、DeepSearch-World上に構築されたWebエージェントのための自己蒸留フレームワークである。
DeepSearch-Evolveは、トラジェクトリ生成、フィルタリング、データミキシング、より強力なエージェントをトレーニングするための微調整を反復的に実行する。
環境, 420Kトレーニングプール, 検証セット, モデル, コードをリリースし, 自己改善型ディープサーチエージェントの今後の研究を促進する。
- 参考スコア(独自算出の注目度): 40.48626828756898
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Training tool-use agents to improve from their own experience remains challenging, as supervised fine-tuning relies on fixed teacher-distilled trajectories, while sparse-reward reinforcement learning provides weak supervision for long-horizon interactions. We present DeepSearch-Evolve, a self-distillation framework for web agents built on DeepSearch-World, a deterministic and verifiable environment with reproducible search and page-reading tools. DeepSearch-World contains 420K multi-hop QA tasks constructed from entity-level random walks and supports key agentic cognitive behaviors useful for self-evolving, including progress verification, grounded reflection, and failure recovery. DeepSearch-Evolve iteratively performs trajectory generation, filtering, data mixing, and fine-tuning to train stronger agents. Without distillation from more capable models, DeepSearch-World-9B achieves competitive performance compared with open-source agents, reaching 31.2% on BrowseComp, 61.5% on GAIA, and 93.4% on HotpotQA, showing that verifiable environments enable scalable self-evolution for long-horizon web agents. We will release the environment, 420K training pool, validation set, model, and code to facilitate future research on self-improving deep search agents.
- Abstract(参考訳): 教師による微調整は固定された教師の足跡に頼っているのに対し、スパース・リワード強化学習は長期的相互作用の監督に弱い。
DeepSearch-Evolveは、DeepSearch-World上に構築されたWebエージェントのための自己蒸留フレームワークであり、再現可能な検索とページ読み取りツールを備えた決定論的で検証可能な環境である。
DeepSearch-Worldには、エンティティレベルのランダムウォークから構築された420万のマルチホップQAタスクが含まれており、進捗検証、接地反射、障害復旧など、自己進化に有用な主要なエージェント認知行動をサポートしている。
DeepSearch-Evolveは、トラジェクトリ生成、フィルタリング、データミキシング、より強力なエージェントをトレーニングするための微調整を反復的に実行する。
より有能なモデルの蒸留なしでは、DeepSearch-World-9Bはオープンソースのエージェントに比べて競争力があり、BrowseCompでは31.2%、GAIAでは61.5%、HotpotQAでは93.4%に達した。
環境, 420Kトレーニングプール, 検証セット, モデル, コードをリリースし, 自己改善型ディープサーチエージェントの今後の研究を促進する。
関連論文リスト
- Tongyi DeepResearch Technical Report [111.78446943571782]
Tongyi DeepResearchは、自律的な深層研究機関にインセンティブを与えるため、エンドツーエンドのトレーニングフレームワークを通じて開発されている。
Tongyi DeepResearchは合計35億のパラメータを達成している。
私たちは、コミュニティを強化するためのモデル、フレームワーク、完全なソリューションをオープンソースにしています。
論文 参考訳(メタデータ) (2025-10-28T17:53:02Z) - WebSeer: Training Deeper Search Agents through Reinforcement Learning with Self-Reflection [51.10348385624784]
本稿では,自己回帰機構によって強化された強化学習によって訓練された,よりインテリジェントな検索エージェントであるWebSeerを紹介する。
提案手法はツール使用チェーンを大幅に拡張し,回答精度を向上する。
論文 参考訳(メタデータ) (2025-10-21T16:52:00Z) - Beyond Turn Limits: Training Deep Search Agents with Dynamic Context Window [88.85901839023803]
DeepMinerは、高機能なトレーニングタスクと動的コンテキストウィンドウを導入することで、そのような能力を引き出す新しいフレームワークである。
We developed DeepMiner-32B, which is a significant performance improvements across multiple search agent benchmarks。
論文 参考訳(メタデータ) (2025-10-09T14:31:39Z) - InfoAgent: Advancing Autonomous Information-Seeking Agents [143.15973604285304]
本稿では,革新的なデータ合成パイプラインとWeb検索ツールを駆使したディープリサーチエージェントInfoAgentを紹介する。
我々の方法では、InfoAgentはBrowseCompで15.3%、BrowseComp-ZHで29.2%、Xbench-DSで40.4%の精度を達成した。
論文 参考訳(メタデータ) (2025-09-29T17:59:57Z) - Fathom-DeepResearch: Unlocking Long Horizon Information Retrieval and Synthesis for SLMs [7.3517692707289415]
本稿では2つの特殊モデルからなるエージェントシステムであるFathom-DeepResearchを紹介する。
ひとつは、ライブWeb検索とターゲットWebページクエリによるエビデンスベースの調査に最適化された、DeepSearchモデルであるFathom-Search-4Bである。
2つ目は、Qwen3-4Bから訓練されたFathom-Synthesizer-4Bである。
論文 参考訳(メタデータ) (2025-09-28T22:58:11Z) - DeepDive: Advancing Deep Search Agents with Knowledge Graphs and Multi-Turn RL [60.47878242100153]
我々は、ディープサーチエージェントを進化させるためにDeepDiveを提示する。
オープンな知識グラフから複雑で難解な質問を自動的に合成する戦略を提案する。
深層探索によるLLMの長距離推論を強化するために, エンドツーエンドのマルチターン強化学習を適用した。
論文 参考訳(メタデータ) (2025-09-12T17:52:35Z) - Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous RL [22.8456317506762]
ASearcherは、検索エージェントの大規模RLトレーニングのためのオープンソースプロジェクトである。
ASearcher-Web-QwQは、xBenchで51.1、GAIAで58.7のAvg@4スコアを獲得し、既存のオープンソース32Bエージェントを上回っている。
論文 参考訳(メタデータ) (2025-08-11T13:36:57Z) - DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments [20.498100965239818]
我々は、LLMベースのディープリサーチエージェントのエンドツーエンドトレーニングのための、初の総合的なフレームワークであるDeepResearcherを紹介する。
固定コーパス内にすべての必要な情報が存在すると仮定するRAGベースのアプローチとは異なり、我々の手法はオープンウェブのノイズ、非構造化、動的性質をナビゲートするエージェントを訓練する。
オープンドメインの研究タスクに関する大規模な実験は、DeepResearcherがエンジニアリングベースの素早いベースラインよりも最大28.9ポイントの大幅な改善を達成していることを示している。
論文 参考訳(メタデータ) (2025-04-04T04:41:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。