論文の概要: SearchMaster: Grounded and Regulated Self-Play for Search Agents
- arxiv url: http://arxiv.org/abs/2608.01822v1
- Date: Mon, 03 Aug 2026 07:29:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.381647
- Title: SearchMaster: Grounded and Regulated Self-Play for Search Agents
- Title(参考訳): SearchMaster: 検索エージェントのためのグラウンドドとレギュレーションされたセルフプレイ
- Abstract要約: 検索エージェントの訓練には高品質な検索データが必要である。
既存のパイプラインは、人手によるタスクや専門家によるデモンストレーション、より強力な教師モデルに依存していることが多い。
本稿では,ローカル検索環境における検索タスクから,単一のLLMをトレーニングするセルフプレイフレームワークであるSearchMasterを提案する。
- 参考スコア(独自算出の注目度): 57.537666863340284
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Training LLM-based search agents requires high-quality search data: tasks that demand genuine multi-hop retrieval and trajectories that use search tools effectively. Existing pipelines often depend on human-written tasks, expert demonstrations, or stronger teacher models. We present SearchMaster, a self-play framework that trains a single LLM from search tasks it generates, solves, and verifies in a local search environment. The key challenge is that self-generated tasks and rollouts can yield misleading signals: pseudo multi-hop questions, success-rate difficulty estimates that ignore search depth, and rollouts with excessive opening but little targeted evidence acquisition. SearchMaster addresses these failure modes with three controls. An Evidence-Chain Generator (ECG) grounds task generation in explicit cross-document evidence chains to reduce pseudo multi-hop questions. A Search-Depth Reward (SDR) scores task difficulty by the search depth of successful rollouts rather than success rate alone, keeping retained tasks search-intensive. An Over-Opening Penalty (OOP) regulates tool use by discouraging excessive document opening, avoiding long but shallow browsing. Verified Proposer and Solver rollouts are then jointly optimized with GRPO. Across six deep-search benchmarks, SearchMaster improves a Qwen3.5-9B backbone from 38.19% to 51.52% average accuracy, with a 30.1-point gain on BrowseComp-Plus. These results show that grounded and regulated self-play can provide effective search-agent training data without human-labeled QA pairs or expert demonstrations. The code is available at https://github.com/WentaoTan/SearchMaster.
- Abstract(参考訳): LLMベースの検索エージェントの訓練には高品質な検索データが必要である。
既存のパイプラインは、人手によるタスクや専門家によるデモンストレーション、より強力な教師モデルに依存していることが多い。
本稿では,ローカル検索環境における検索タスクから,単一のLLMをトレーニングするセルフプレイフレームワークであるSearchMasterを提案する。
重要な課題は、自己生成タスクやロールアウトが誤解を招くシグナルを生み出すことだ。擬似マルチホップ質問、検索深度を無視した成功率の難易度推定、過剰なオープニングを伴うロールアウト。
SearchMasterは3つのコントロールでこれらの障害モードに対処する。
エビデンス・チェーン・ジェネレータ(ECG)は、偽のマルチホップ質問を減らすために、明示的なクロスドキュメントエビデンス・チェーンにタスク生成を基盤とする。
Search-Depth Reward (SDR) は、成功率のみでなく、成功度の高いロールアウトの検索深度によってタスクの難易度をスコアし、維持されたタスクを検索集約的に保持する。
OOP(Over-Opening Penalty)は、過剰なドキュメントのオープンを回避し、長いが浅いブラウジングを避けることで、ツールの使用を規制する。
検証プロポーラとソルバーのロールアウトはGRPOと共同で最適化される。
6つのディープ検索ベンチマークで、検索マスターはQwen3.5-9Bのバックボーンを38.19%から51.52%に改善し、BrowseComp-Plusでは30.1ポイントのアップとなった。
これらの結果から,人間ラベル付きQAペアや専門家によるデモンストレーションを使わずに,グラウンドドと規制されたセルフプレイが効果的な検索エージェントトレーニングデータを提供する可能性が示唆された。
コードはhttps://github.com/WentaoTan/SearchMasterで入手できる。
関連論文リスト
- SearchArt: Training Long-Horizon Search Agent with Scalable Synthetic and Verified Task [28.244711705405056]
有能な検索エージェントの訓練は、スケーラブルで長期にわたるタスクが欠如しているため、依然として困難である。
本稿では,長距離検索エージェントを訓練するためのフレームワークであるSearchArtを紹介する。
SearchArtは、複雑な検索、研究、ユーザ指向タスクのための大規模なデータセットを構築する。
論文 参考訳(メタデータ) (2026-07-25T06:47:46Z) - OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents [50.79529228477821]
エージェント強化学習を用いたフロンティアマルチモーダルディープサーチエージェントの完全オープンソースレシピであるOpenSearch-VLを紹介した。
まず、ウィキペディアパスのサンプリング、ファジィエンティティの書き換え、ソース・アンカーの視覚的グラウンドリングを通じて、高品質なトレーニングデータを構築するための専用パイプラインをキュレートした。
さらに,テキスト検索,画像検索,OCR,収穫,研削,超解像,視点補正を統一する多様なツール環境を設計する。
論文 参考訳(メタデータ) (2026-05-06T17:50:38Z) - AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement Learning [52.305422887002656]
本稿では,自己生成中間回答を用いて各探索ステップを評価する強化学習フレームワークを提案する。
自己回答機構により、AutoSearchは最小限の検索深度を特定し、効率的な検索を促進する。
実験の結果、AutoSearchは検索品質を維持しながら過剰検索を軽減し、精度と効率のトレードオフが優れていることがわかった。
論文 参考訳(メタデータ) (2026-04-19T09:05:48Z) - MM-DeepResearch: A Simple and Effective Multimodal Agentic Search Baseline [26.19213349415094]
マルチモーダル・リサーチ・エージェントの開発を目標とし, 明示的な推論と計画, マルチツール・呼び出し, クロスモーダル・インフォメーション・シンセサイザーの実現を目指す。
1)検索集約型マルチモーダルQAデータの不足,(2)効果的な検索トラジェクトリの欠如,(3)オンライン検索APIによるトレーニングの禁止コストの3つの主な課題を考察する。
この3つの設計により,強力なマルチモーダルディープリサーチエージェントであるMM-DeepResearchを開発した。
論文 参考訳(メタデータ) (2026-03-01T11:13:22Z) - SE-Search: Self-Evolving Search Agent via Memory and Dense Reward [87.79131676521656]
Retrieval augmented generation (RAG)は、検索した外部知識を条件づけることにより、大規模言語モデル(LLM)における幻覚や事実エラーを低減する。
既存の手法は、無関係または騒々しい文書を蓄積し、希少な強化学習信号に依存することが多い。
我々は,3つのコンポーネントによるオンライン検索行動を改善するセルフ進化検索エージェントであるtextbfSelf-textbfEvolving textbfSearchを提案する。
論文 参考訳(メタデータ) (2026-02-06T09:14:07Z) - SAGE: Steerable Agentic Data Generation for Deep Search with Execution Feedback [68.60326181052658]
本稿では,高品質で難易度の高い探索問合せを自動生成するエージェントパイプラインを提案する。
我々のパイプラインであるSAGEは、QAペアを提案するデータジェネレータと、生成された質問を解決するための検索エージェントで構成される。
我々の本質的な評価は、SAGEが様々な推論戦略を必要とする質問を生成する一方で、生成したデータの正確性や難易度を著しく高めていることを示している。
論文 参考訳(メタデータ) (2026-01-26T06:37:56Z) - Search Self-play: Pushing the Frontier of Agent Capability without Supervision [14.889394507446477]
本稿では,ディープサーチエージェントのためのセルフプレイトレーニングを提案する。
探索セルフプレイ(SSP)ゲームにおいて、提案者と解決者は、競争と協力の両面からエージェント能力を共同開発する。
SSPは、様々なベンチマークにおいて、いかなる監督も受けずに、検索エージェントのパフォーマンスを均一に向上させることができる。
論文 参考訳(メタデータ) (2025-10-21T17:19:35Z) - Beyond the limitation of a single query: Train your LLM for query expansion with Reinforcement Learning [23.104182075898297]
Reasoning-augmented search agent, such as Search-R1, are trained to reason, search, and generate the final answer repeateratively。
我々は、強化学習によるクエリ拡張のネイティブ機能を備えたLLMベースの検索エージェントを訓練する。
シュレッシャーモデルの助けを借りて,小型の3B LLMでもクエリ拡張の強力な能力を実証できることが判明した。
論文 参考訳(メタデータ) (2025-10-11T04:23:30Z) - DeepDive: Advancing Deep Search Agents with Knowledge Graphs and Multi-Turn RL [60.47878242100153]
我々は、ディープサーチエージェントを進化させるためにDeepDiveを提示する。
オープンな知識グラフから複雑で難解な質問を自動的に合成する戦略を提案する。
深層探索によるLLMの長距離推論を強化するために, エンドツーエンドのマルチターン強化学習を適用した。
論文 参考訳(メタデータ) (2025-09-12T17:52:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。