論文の概要: Learning Query-Specific Rubrics from Human Preferences for DeepResearch Report Generation
- arxiv url: http://arxiv.org/abs/2602.03619v1
- Date: Tue, 03 Feb 2026 15:09:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-04 18:37:15.530676
- Title: Learning Query-Specific Rubrics from Human Preferences for DeepResearch Report Generation
- Title(参考訳): DeepResearch レポート生成のための人間の選好からのクエリー特化ルーブリックの学習
- Abstract要約: 本稿では,DeepResearchレポート生成に適した,人間の参照型クエリ専用ルーリックジェネレータを訓練するためのパイプラインを提案する。
まず,DeepResearchスタイルのアノテートクエリのデータセットを,ペアレポートよりも人間の好みで構築し,強化学習を通じてルーリックジェネレータを訓練する。
提案したルーリック・ジェネレータは既存のルーリック・デザイン・ストラテジーよりも、より差別的で優れたヒューマン・アライメント・インテリジェンスを実現することを実証的に示す。
- 参考スコア(独自算出の注目度): 80.12435680651488
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Nowadays, training and evaluating DeepResearch-generated reports remain challenging due to the lack of verifiable reward signals. Accordingly, rubric-based evaluation has become a common practice. However, existing approaches either rely on coarse, pre-defined rubrics that lack sufficient granularity, or depend on manually constructed query-specific rubrics that are costly and difficult to scale. In this paper, we propose a pipeline to train human-preference-aligned query-specific rubric generators tailored for DeepResearch report generation. We first construct a dataset of DeepResearch-style queries annotated with human preferences over paired reports, and train rubric generators via reinforcement learning with a hybrid reward combining human preference supervision and LLM-based rubric evaluation. To better handle long-horizon reasoning, we further introduce a Multi-agent Markov-state (MaMs) workflow for report generation. We empirically show that our proposed rubric generators deliver more discriminative and better human-aligned supervision than existing rubric design strategies. Moreover, when integrated into the MaMs training framework, DeepResearch systems equipped with our rubric generators consistently outperform all open-source baselines on the DeepResearch Bench and achieve performance comparable to that of leading closed-source models.
- Abstract(参考訳): 現在、DeepResearchが生成したレポートのトレーニングと評価は、検証可能な報酬信号が欠如しているため、難しいままである。
そのため、ルーブリックに基づく評価が一般的な慣行となっている。
しかし、既存のアプローチは、十分な粒度を持たない粗大で定義済みのルーブリックに依存するか、手動で構築されたクエリ固有のルーブリックに依存する。
本稿では,DeepResearchレポート生成に適した人為的なクエリ専用ルーリックジェネレータを学習するためのパイプラインを提案する。
まず,2つのレポートに対して人間の嗜好を付加したDeepResearchスタイルのクエリのデータセットを構築し,人間の選好監督とLLMに基づくルーリック評価を組み合わせたハイブリッド報酬を用いた強化学習によるルーリックジェネレータの訓練を行った。
長距離推論をよりうまく処理するために,レポート生成のためのマルチエージェントマルコフ状態(MaMs)ワークフローを導入する。
提案したルーリック・ジェネレータは既存のルーリック・デザイン・ストラテジーよりも、より差別的で優れたヒューマン・アライメント・インテリジェンスを実現できることを実証的に示す。
さらに、MaMsトレーニングフレームワークに統合されると、私たちのルーリックジェネレータを備えたDeepResearchシステムは、DeepResearch Benchのすべてのオープンソースベースラインを一貫して上回り、主要なクローズドソースモデルに匹敵するパフォーマンスを達成する。
関連論文リスト
- GenRubric: Self-Evolving Rubric Generation for Scalable LLM Evaluation [74.44235943118994]
GenRubricは、ラベルのないクエリからルーブリック生成を改善する自己進化フレームワークである。
我々はこの原理を強化学習により実現し、ルーブリック間の包括性信号とグループレベルの報酬と基準レベルの報酬を組み合わせる。
人間の注釈付きルーブリックベンチマークの実験では、自己進化は生成されたルーブリックと専門家によるルーブリックによる評価の一致を改善することが示されている。
論文 参考訳(メタデータ) (2026-08-30T15:39:39Z) - DEEPRUBRIC: Evidence-Tree Rubric Supervision for Efficient Reinforcement Learning of Deep Research Agents [17.420077157633852]
報奨に基づく強化学習は、レポート品質を報奨信号に変換するチェック可能な基準に最適化することにより、ディープリサーチエージェントを改善する。
既存の研究の多くは、LLMに与えられたクエリに対してルーリックを生成するよう求めているが、モデルが基盤となる情報要求を推測できない場合、生成されたルーリックは不完全であり、RL効率を低下させる可能性がある。
より信頼性の高いクエリ-ルーブリックの監視を得るために、このプロセスを逆転するデータ構築フレームワークであるDeepRubricを紹介します。
論文 参考訳(メタデータ) (2026-06-15T17:52:27Z) - RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards [76.17893114021757]
長い形式のレポートを計画し、調査し、エビデンスを評価し、合成する深層研究システムには、根本的な答えがなく、多くのツール強化された決定にまたがる。
本研究では,ルーブリックは最終回答評価者だけでなく,ポリシーの実行,判断フィードバック,エージェントメモリを構成する共有インターフェースとして機能すべきである,と論じる。
我々は、段階的な政策分解とリフレクションに基づくメタ政治進化を組み合わせたルーリック誘導強化学習フレームワークEMを導入する。
論文 参考訳(メタデータ) (2026-05-11T17:40:38Z) - Personalized Deep Research: A User-Centric Framework, Dataset, and Hybrid Evaluation for Knowledge Discovery [36.57361069825463]
動的ユーザコンテキストをコア検索・推論ループに統合するPDR(Personalized Deep Research)を導入する。
PDRは、ユーザープロファイルモデリングを反復的なクエリ開発、二重ステージ(プライベート/パブリック)検索、コンテキスト認識合成と統合する。
これにより、研究サブゴールとユーザの意図を自律的に調整し、エビデンス収集の停止基準を最適化することができる。
論文 参考訳(メタデータ) (2026-05-11T13:14:54Z) - RubricRAG: Towards Interpretable and Reliable LLM Evaluation via Domain Knowledge Retrieval for Rubric Generation [11.21565372620296]
大規模言語モデル(LLM)は、スカラースコアや選好を出力する自動グレーダを使用して、ますます評価され、時には訓練される。
この解釈可能性の欠如は、モデル開発、データセットキュレーション、高レベルのデプロイメントに対する有用性を制限している。
本稿では,関連するクエリから推論時にルーリックからドメイン知識を抽出するシンプルな戦略RAGを紹介する。
論文 参考訳(メタデータ) (2026-03-21T17:10:14Z) - SimGR: Escaping the Pitfalls of Generative Decoding in LLM-based Recommendation [68.00727783181289]
推薦システムの中核的な目的は、パーソナライズされたレコメンデーションを可能にするために、アイテムよりもユーザの好みの分布を正確にモデル化することである。
アイテムレベルの嗜好分布を推定する際に,既存の手法が必然的に系統的バイアスを生じさせることを観察する。
textbfSimply textbfGenerative textbfRecommendation (textbfSimGR)を提案する。
論文 参考訳(メタデータ) (2026-02-08T07:26:52Z) - AgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep Research [85.51475655916026]
AgentCPM-Reportは軽量だが高性能なローカルソリューションで、人間の記述プロセスを反映したフレームワークで構成されている。
我々のフレームワークは、モデルがアウトラインを動的に修正できるWARP(Writeing As Reasoning Policy)を使用している。
DeepResearch Bench、DeepConsult、DeepResearch Gymの実験は、AgentCPM-Reportが主要なクローズドソースシステムより優れていることを示した。
論文 参考訳(メタデータ) (2026-02-06T09:45:04Z) - MSRS: Evaluating Multi-Source Retrieval-Augmented Generation [51.717139132190574]
多くの現実世界のアプリケーションは、複数のソースにまたがる情報を統合して要約する能力を必要としている。
本稿では、RAGシステムに対して異なるソース間で情報を統合するための評価ベンチマークを構築するためのスケーラブルなフレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-28T14:59:55Z) - Test-time Corpus Feedback: From Retrieval to RAG [21.517949407443453]
Retrieval-Augmented Generation (RAG) は知識集約型NLPタスクの標準フレームワークとして登場した。
ほとんどのRAGパイプラインは、検索と推論を独立したコンポーネントとして扱い、ドキュメントを一度取り出し、さらに相互作用することなく回答を生成する。
情報検索(IR)とNLPのコミュニティにおける最近の研究は、フィードバックを取り入れた適応的検索とランキング手法を導入して、このギャップを埋め始めている。
論文 参考訳(メタデータ) (2025-08-21T10:57:38Z) - Retrieval-Augmented Recommendation Explanation Generation with Hierarchical Aggregation [5.656477996187559]
Explainable Recommender System (ExRec)は、レコメンデーションプロセスへの透明性を提供し、ユーザの信頼を高め、オンラインサービスの運用を促進する。
既存のLLMベースのExRecモデルは、プロファイルの偏りと高い検索オーバーヘッドに悩まされ、デプロイメントを妨げている。
階層的集約(REXHA)を用いた検索拡張レコメンデーション記述生成を提案する。
論文 参考訳(メタデータ) (2025-07-12T08:15:05Z) - Benchmarking Deep Search over Heterogeneous Enterprise Data [73.55304268238474]
検索強化生成(RAG)の形式を評価するための新しいベンチマークを提案する。
RAGは、多種多様な、しかし関連するソースに対して、ソースを意識したマルチホップ推論を必要とする。
製品計画、開発、サポートステージをまたいだビジネスをシミュレートする合成データパイプラインを使用して構築します。
論文 参考訳(メタデータ) (2025-06-29T08:34:59Z) - BERGEN: A Benchmarking Library for Retrieval-Augmented Generation [26.158785168036662]
Retrieval-Augmented Generationは、外部知識による大規模言語モデルの拡張を可能にする。
一貫性のないベンチマークは、アプローチを比較し、パイプライン内の各コンポーネントの影響を理解する上で大きな課題となる。
本研究では,RAGを体系的に評価するための基礎となるベストプラクティスと,RAG実験を標準化した再現可能な研究用ライブラリであるBERGENについて検討する。
論文 参考訳(メタデータ) (2024-07-01T09:09:27Z) - RichRAG: Crafting Rich Responses for Multi-faceted Queries in Retrieval-Augmented Generation [35.981443744108255]
本稿ではRichRAGという新しいRAGフレームワークを提案する。
これには、入力された質問の潜在的なサブアスペクトを特定するサブアスペクトエクスプローラー、これらのサブアスペクトに関連する多様な外部文書の候補プールを構築するレトリバー、および生成リストワイズローダが含まれる。
2つの公開データセットの実験結果から,我々のフレームワークがユーザに対して包括的かつ満足な応答を効果的に提供できることが証明された。
論文 参考訳(メタデータ) (2024-06-18T12:52:51Z) - STaRK: Benchmarking LLM Retrieval on Textual and Relational Knowledge Bases [93.96463520716759]
テキストと知識ベースを用いた大規模半構造検索ベンチマークSTARKを開発した。
本ベンチマークでは, 製品検索, 学術論文検索, 精密医療におけるクエリの3分野について検討した。
多様なリレーショナル情報と複雑なテキスト特性を統合した,現実的なユーザクエリを合成する,新しいパイプラインを設計する。
論文 参考訳(メタデータ) (2024-04-19T22:54:54Z) - AugTriever: Unsupervised Dense Retrieval and Domain Adaptation by Scalable Data Augmentation [44.93777271276723]
擬似クエリドキュメントペアを作成することにより,アノテーションフリーでスケーラブルなトレーニングを可能にする2つのアプローチを提案する。
クエリ抽出方法は、元のドキュメントから有能なスパンを選択して擬似クエリを生成する。
転送クエリ生成方法は、要約などの他のNLPタスクのために訓練された生成モデルを使用して、擬似クエリを生成する。
論文 参考訳(メタデータ) (2022-12-17T10:43:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。