論文の概要: F$^{2}$DR: A Fine-Grained Full-Pipeline Reward Framework for DeepSearch Workflows
- arxiv url: http://arxiv.org/abs/2609.19827v2
- Date: Sat, 19 Sep 2026 04:33:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:00.106141
- Title: F$^{2}$DR: A Fine-Grained Full-Pipeline Reward Framework for DeepSearch Workflows
- Title(参考訳): F$^{2}$DR:DeepSearchワークフローのための細粒度フルパイプリワードフレームワーク
- Abstract要約: DeepSearchは複雑なユーザクエリを解決するための主要なパラダイムです。
既存の報酬モデル(RM)と評価ベンチマークは、主に静的な単一ターンタスクのために設計されている。
本稿では,F2DRを提案する。
- 参考スコア(独自算出の注目度): 52.956196605392876
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: With the widespread industrial deployment of Large Language Models (LLMs), DeepSearch has emerged as the dominant paradigm for resolving complex user queries. It typically operates through an iterative closed-loop workflow consisting of planning and reflection, information retrieval, and answer generation. However, existing reward models (RMs) and evaluation benchmarks are primarily designed for static single-turn tasks, failing to capture the full-pipeline complexity of DeepSearch workflows. To address this limitation, we propose F2DR, a fine-grained full-pipeline DeepSearch reward framework. F2DR evaluates DeepSearch workflows across three dimensions: Content, Trajectory, and Answer, enabling comprehensive process-level assessment. We further construct DeepSearch RM-Bench, a dedicated benchmark for evaluating RMs in DeepSearch scenarios. Extensive experiments demonstrate that F2DR achieves significantly higher evaluation consistency than self-evaluation-based baselines, while DeepSearch RM-Bench exhibits strong discriminative capability across existing open-source RMs. We will publicly release the complete DeepSearch RM-Bench dataset soon.
- Abstract(参考訳): LLM(Large Language Models)の広範な産業展開により、DeepSearchは複雑なユーザクエリを解決する主要なパラダイムとして登場した。
通常、計画とリフレクション、情報検索、回答生成からなる反復的なクローズドループワークフローを介して動作する。
しかし、既存の報酬モデル(RM)と評価ベンチマークは、主に静的な単一ターンタスクのために設計されており、DeepSearchワークフローの完全なパイプラインの複雑さを捉えていない。
この制限に対処するため,F2DRを提案する。
F2DRは、コンテンツ、トラジェクトリ、Answerの3つの次元にわたるDeepSearchワークフローを評価し、包括的なプロセスレベルのアセスメントを可能にしている。
さらに、DeepSearchシナリオでRMを評価するための専用のベンチマークであるDeepSearch RM-Benchを構築します。
大規模な実験では、F2DRは自己評価ベースラインよりもはるかに高い評価一貫性を達成し、DeepSearch RM-Benchは既存のオープンソースRMに対して強力な識別能力を示す。
間もなく完全なDeepSearch RM-Benchデータセットを公開します。
関連論文リスト
- DuMate-DeepResearch: An Auditable Multi-Agent System with Recursive Search and Rubric-Grounded Reasoning [58.09293442211248]
Deep Research(DR)は、複雑でオープンな研究課題に取り組むための新しいエージェントパラダイムとして登場した。
本稿では,Qianfan Agent Foundry上に構築されたマルチエージェントDRフレームワークであるDuMate-DeepResearchを紹介する。
論文 参考訳(メタデータ) (2026-06-05T14:10:48Z) - DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent [63.52637950356965]
DeepResearch-9Kは、Deep-Researchシナリオのための大規模で挑戦的なデータセットである。
DeepResearch-R1は、Deep-Researchエージェントのためのオープンソースのトレーニングフレームワークである。
論文 参考訳(メタデータ) (2026-03-01T15:36:10Z) - Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models [79.77807330964576]
Vision-DeepResearchシステムは複雑なビジュアルテキストのファクトフィンディングに検索エンジンを使用する。
既存のベンチマークはビジュアル検索中心ではない。
2,000のVQAインスタンスからなるVision-DeepResearchベンチマーク(VDR-Bench)を構築した。
論文 参考訳(メタデータ) (2026-02-02T14:53:11Z) - A Hierarchical Tree-based approach for creating Configurable and Static Deep Research Agent (Static-DRA) [0.0]
本稿では,階層木に基づく静的ワークフローに基づく新しいソリューションである静的ディープリサーチエージェント(Static-DRA)を紹介する。
コアコントリビューションは、DepthとBreadthという2つのユーザチューニング可能なパラメータの統合である。
エージェントのアーキテクチャは、スーパーバイザ、インディペンデント、およびWorkerエージェントで構成され、効果的なマルチホップ情報検索を促進する。
論文 参考訳(メタデータ) (2025-12-03T15:37:13Z) - DeepWideSearch: Benchmarking Depth and Width in Agentic Information Seeking [42.413184411326164]
DeepWideSearchは、情報検索の深さと幅を統合するエージェントを評価するために設計された最初のベンチマークである。
DeepWideSearchでは、エージェントは大量のデータを処理し、それぞれがマルチホップ検索パスに対して深い推論を必要とする。
実験の結果、最先端のエージェントでさえ平均的な成功率は2.39%に過ぎなかった。
論文 参考訳(メタデータ) (2025-10-23T03:28:45Z) - Fathom-DeepResearch: Unlocking Long Horizon Information Retrieval and Synthesis for SLMs [7.3517692707289415]
本稿では2つの特殊モデルからなるエージェントシステムであるFathom-DeepResearchを紹介する。
ひとつは、ライブWeb検索とターゲットWebページクエリによるエビデンスベースの調査に最適化された、DeepSearchモデルであるFathom-Search-4Bである。
2つ目は、Qwen3-4Bから訓練されたFathom-Synthesizer-4Bである。
論文 参考訳(メタデータ) (2025-09-28T22:58:11Z) - Benchmarking Deep Search over Heterogeneous Enterprise Data [73.55304268238474]
検索強化生成(RAG)の形式を評価するための新しいベンチマークを提案する。
RAGは、多種多様な、しかし関連するソースに対して、ソースを意識したマルチホップ推論を必要とする。
製品計画、開発、サポートステージをまたいだビジネスをシミュレートする合成データパイプラインを使用して構築します。
論文 参考訳(メタデータ) (2025-06-29T08:34:59Z) - ManuSearch: Democratizing Deep Search in Large Language Models with a Transparent and Open Multi-Agent Framework [73.91207117772291]
ManuSearchは,大規模言語モデル(LLM)の深層検索を民主化するために設計された,透明でモジュール化されたマルチエージェントフレームワークである。
ManuSearchは検索と推論のプロセスを,(1)サブクエリを反復的に定式化するソリューション計画エージェント,(2)リアルタイムWeb検索を通じて関連文書を検索するインターネット検索エージェント,(3)生のWebコンテンツから重要な証拠を抽出する構造化Webページ読取エージェントの3つに分解する。
論文 参考訳(メタデータ) (2025-05-23T17:02:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。