論文の概要: Deep Research Pretraining via Predictive Navigation
- arxiv url: http://arxiv.org/abs/2608.00432v1
- Date: Sat, 01 Aug 2026 04:17:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.659318
- Title: Deep Research Pretraining via Predictive Navigation
- Title(参考訳): 予測ナビゲーションによる深層学習
- Authors: Jiang Zhou, Zhiyuan Fan, Xing Wu, Tinghao Yu, Feng Zhang, Lilin Wang,
- Abstract要約: Deep Research Pretrainingは、自然に発生するエビデンス構造から予測ナビゲーションの監督を導くオフラインフレームワークである。
モデルに何を検索するか、どの文書を検査するか、どのように証拠を合成するかを教える。
- 参考スコア(独自算出の注目度): 14.408072671638779
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Deep research agents are often trained on expensive, environment-grounded tool-use trajectories that require repeated retrieval, document inspection, and report evaluation. We introduce Deep Research Pretraining (DRP), an offline framework that derives predictive navigation supervision from naturally occurring evidence structures. Given a citation-bearing or hyperlinked passage, DRP constructs a proxy research objective, recovers linked evidence and graph-related alternatives, and converts them into search-open-write trajectories. This teaches models what to search for, which documents to inspect, and how to synthesize evidence, without a live retrieval environment or executed policy rollout. We instantiate DRP on scholarly citation graphs (DRP-Paper) and Wikipedia hyperlinks (DRP-Web), continually pretrain separate Qwen3-14B-Base models on 1B tokens, and fine-tune them on controlled fractions of 13K agent trajectories. Across five independently sampled subsets at each low-data budget, both variants consistently outperform matched no-DRP models on DeepResearch Bench. With one quarter of the SFT data, DRP-Web even surpasses a fixed no-DRP full-data checkpoint, with gains transferring to ResearchQA, WebWalkerQA, and SimpleQA. Starting from matched low-data SFT checkpoints, the DRP-Web advantage also persists through subsequent agentic RL. Source-matched and evidence-mismatch controls indicate that these improvements arise from evidence-conditioned navigation rather than domain exposure or agent-format imitation. DRP thus provides a promising complementary approach to trajectory-based agent training.
- Abstract(参考訳): ディープリサーチエージェントは、しばしば、繰り返し検索、文書検査、レポート評価を必要とする、高価な、環境に根ざしたツール使用軌跡で訓練される。
本稿では,自然発生のエビデンス構造から予測ナビゲーションを誘導するオフラインフレームワークであるDeep Research Pretraining(DRP)を紹介する。
DRPは、引用付きまたはハイパーリンクされたパスを与えられた後、プロキシ研究の目標を構築し、リンクされたエビデンスとグラフ関連の代替品を復元し、それらを検索オープンなトラジェクトリに変換する。
これは、ライブ検索環境やポリシーのロールアウトなしで、何を探すか、どの文書を検査するか、証拠をどのように合成するかをモデルに教える。
学術引用グラフ (DRP-Paper) とウィキペディアハイパーリンク (DRP-Web) で DRP をインスタンス化し、1B トークンで Qwen3-14B-Base モデルを事前訓練し、13K エージェントトラジェクトリの制御された分数でそれらを微調整する。
それぞれの低データ予算で5つの独立したサブセットをサンプリングし、両バージョンはDeepResearch Benchの非DRPモデルと一貫して比較した。
SFTデータの4分の1で、DRP-Webは固定された非DRP完全データチェックポイントを超え、ResearchQA、WebWalkerQA、SimpleQAに転送される。
一致した低データ SFT チェックポイントから始めると、DRP-Web のアドバンテージはその後のエージェント RL を通して持続する。
ソースマッチングおよびエビデンスミスマッチ制御は、これらの改善がエビデンス条件付きナビゲーションから生じることを示している。
DRPは、軌道に基づくエージェントトレーニングに有望な補完的アプローチを提供する。
関連論文リスト
- VeriTrace: Evolving Mental Models for Deep Research Agents [43.43659414477917]
ディープリサーチエージェントは、膨大な、相互依存的で広範囲に不確実な情報に直面します。
既存のシステムは、進化する中間表現がどのようなものになるべきかを探索するが、その進化は暗黙の推論に任せる。
エージェントのメンタルモデルは、タスク理解と現実を継続的に整合させる明示的なフィードバックを通じて進化すべきである、と我々は主張する。
論文 参考訳(メタデータ) (2026-05-25T17:46:57Z) - Process Reward Agents for Steering Knowledge-Intensive Reasoning [18.184546182516225]
本稿では,ドメインベースでオンライン,ステップワイドな報酬を凍結ポリシに提供するテストタイム手法であるProcess Reward Agents(PRA)を紹介する。
PRAは強いベースラインを一貫して上回り、Qwen3-4BでMedQAで80.8%の精度を達成した。
PRAは0.5Bから8Bまでの凍結ポリシーモデルを一般化し、ポリシーモデルを更新することなく、その精度を最大25.7%向上させる。
論文 参考訳(メタデータ) (2026-04-10T16:45:44Z) - AgentIR: Reasoning-Aware Retrieval for Deep Research Agents [76.29382561831105]
ディープリサーチエージェントは、各検索の前に明示的な自然言語推論を生成する。
Reasoning-Aware Retrievalは、クエリと一緒にエージェントの推論トレースを埋め込む。
DR-Synthは、標準的なQAデータセットからDeep Researchレトリバーのトレーニングデータを生成する。
AgentIR-4Bは、オープンウェイトエージェントであるTongyi-DeepResearchで68%の精度を達成する。
論文 参考訳(メタデータ) (2026-03-04T18:47:26Z) - TreePS-RAG: Tree-based Process Supervision for Reinforcement Learning in Agentic RAG [71.06073770344732]
エージェント検索強化生成(RAG)は、推論と情報検索の多段階的な相互作用として質問応答を定式化する。
エージェントRAGのためのオンラインツリーベースRLフレームワークであるTreePS-RAGについて述べる。
論文 参考訳(メタデータ) (2026-01-11T14:07:30Z) - Step-DeepResearch Technical Report [90.50586290399683]
コスト効率のよいエンドツーエンドエージェントである Step-DeepResearch を紹介する。
我々は、計画とレポート作成を強化するために、アトミック能力に基づくデータ合成戦略を提案する。
中国における評価ギャップを埋めるため,現実的な深層研究シナリオのためのADR-Benchを構築した。
論文 参考訳(メタデータ) (2025-12-23T16:32:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。