論文の概要: FinResearchBench II: A Deep Research Benchmark with Consensus-Derived Gold Rubrics for Distinguishing Financial Report Quality
- arxiv url: http://arxiv.org/abs/2607.12252v2
- Date: Wed, 15 Jul 2026 01:47:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 12:21:59.513319
- Title: FinResearchBench II: A Deep Research Benchmark with Consensus-Derived Gold Rubrics for Distinguishing Financial Report Quality
- Title(参考訳): FinResearchBench II:ファイナンシャルレポートの質を損なうための金ルーブリックの深層調査ベンチマーク
- Abstract要約: 最終ループで人間の専門家がいなくても高品質なルーブリックを生成するスケーラブルなパイプラインを提案する。
我々は、104の現実世界のユーザクエリから財務的なディープ・リサーチ・ベンチマークを構築し、14450のクエリ固有の候補ルーリックを自動的に合成する。
10のディープ・リサーチ・システムにおいて、アイテムレベルのパスレートは58.58%から22.23%と明確に区別されている。
- 参考スコア(独自算出の注目度): 11.187958235756279
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Deep research agents are increasingly used to produce long-form financial reports, yet large-scale evaluation remains bottlenecked by the need for human experts to define and execute high-quality rubrics. We address this problem by proposing a scalable pipeline for generating high-quality rubrics without human experts in the final loop. We build a financial deep research benchmark from 104 real-world user queries and automatically synthesize 14,450 query-specific candidate rubrics from model-generated reports. To justify removing human experts from rubric execution, we compare rubric judgments from three human experts with those from a three-LLM judge panel on a sampled subset, and show that LLM-based evaluation is sufficiently consistent with human evaluation to replace it for large-scale rubric screening, including 98.67\% label-level agreement on jointly unanimous items. We then derive consensus-derived gold rubrics through two filters: a strict consistency filter, which keeps a rubric only if the three LLM judges unanimously agree on every report under the same query, and a distinguishability filter, which keeps a rubric only if it assigns at least one majority-yes and at least one majority-no label across the evaluated systems. This process retains 3,687 consistency-passed rubrics, of which 2,600 remain distinguishable and form the final set of consensus-derived gold rubrics. Using this final rubric set, we obtain clearly differentiated rankings across 10 deep research systems, with item-level pass rates ranging from 58.58\% to 22.23\%. More broadly, because the pipeline removes human-expert execution from rubric generation and evaluation, it is naturally scalable for benchmark evaluation, automatic system comparison, and future studies of evaluation-driven system improvement.
- Abstract(参考訳): ディープ・リサーチ・エージェントは、長期にわたる財務報告の作成にますます利用されているが、人間の専門家が高品質のルーリックを定義し実行する必要があるため、大規模な評価はいまだにボトルネックとなっている。
最終ループに人間の専門家がいない高品質のルーリックを生成するためのスケーラブルなパイプラインを提案することで、この問題に対処する。
我々は、104の現実世界のユーザクエリから財務的なディープ・リサーチ・ベンチマークを構築し、モデル生成レポートから14450のクエリ固有の候補ルーブリックを自動的に合成する。
本研究の目的は, 3人の専門家によるルーブリック検定と, サンプルサブセット上の3つのLLM審査パネルからのルーブリック検定を比較し, LLMに基づく評価が人間の評価と十分に一致していることを示し, 98.67 %のラベルレベルの一致を含む大規模ルーブリック検定に置き換えることである。
厳密な整合性フィルタは、3つのLCM判事が同じクエリの全てのレポートに対して全会一致で合意する場合にのみルーブリックを保持するフィルタと、評価されたシステムに少なくとも1つの多数派yeと少なくとも1つの多数派noラベルを割り当てる場合にのみ、ルーブリックを保持する識別可能性フィルタである。
このプロセスは3,687個の整合性を有するルーリックを保持しており、そのうち2,600個は区別可能であり、コンセンサス由来のゴールドルーリックの最終的な集合を形成している。
この最終ルーリックセットを用いて、アイテムレベルのパスレートが58.58\%から22.23\%の範囲で、10のディープリサーチシステムで明確に区別されたランクを得る。
より広義には、パイプラインはルーブリック生成と評価から人為的な実行を取り除くため、ベンチマーク評価、自動システム比較、評価駆動システム改善の今後の研究に自然にスケーラブルである。
関連論文リスト
- Q2D-Web: A Large-Scale Benchmark for Retrieval in Agentic RAG Systems [5.118312084290873]
Q2D-Webは,10言語で190MのドキュメントWebコーパスと70kのエージェント検索クエリからなる大規模エージェント検索ベンチマークである。
我々は,語彙モデル,密度モデル,遅延相互作用モデルを含む13のレトリバーをベンチマークし,相対的順序付けが判定セットの選択に大きく影響しないことを確認した。
論文 参考訳(メタデータ) (2026-09-08T15:26:05Z) - Small Language Models as Judges for Rubric-Based Reinforcement Learning [57.707881387886516]
より小型の言語モデルが,より効率的かつ信頼性の高いルーリック・ベース・ジャッジとして機能するかどうかを考察する。
生成的評定,Yes/No Logprobマージン,Probe judgesの3つの基準レベルの判断を,小モデルから抽出する方法を比較した。
どちらのデータセットでも、Qwen3-1.7B Probeの審査員はこれらの方法の中で最強の基準レベルの合意を達成している。
論文 参考訳(メタデータ) (2026-08-30T20:00:17Z) - GenRubric: Self-Evolving Rubric Generation for Scalable LLM Evaluation [74.44235943118994]
GenRubricは、ラベルのないクエリからルーブリック生成を改善する自己進化フレームワークである。
我々はこの原理を強化学習により実現し、ルーブリック間の包括性信号とグループレベルの報酬と基準レベルの報酬を組み合わせる。
人間の注釈付きルーブリックベンチマークの実験では、自己進化は生成されたルーブリックと専門家によるルーブリックによる評価の一致を改善することが示されている。
論文 参考訳(メタデータ) (2026-08-30T15:39:39Z) - JudgmentBench: Comparing Rubric and Preference Evaluation for Quality Assessment [2.961401607740788]
JudgmentBenchは、実世界の30の法的タスクのベンチマークで、1,539のルーリックスコアと1,530のペアの選好判断を組み合わせたものです。
アノテーションは、両方の監視信号が同じ専門家から引き出される、高度なドメインで利用可能な最初のデータセットである。
論文 参考訳(メタデータ) (2026-05-24T19:52:39Z) - RubricRAG: Towards Interpretable and Reliable LLM Evaluation via Domain Knowledge Retrieval for Rubric Generation [11.21565372620296]
大規模言語モデル(LLM)は、スカラースコアや選好を出力する自動グレーダを使用して、ますます評価され、時には訓練される。
この解釈可能性の欠如は、モデル開発、データセットキュレーション、高レベルのデプロイメントに対する有用性を制限している。
本稿では,関連するクエリから推論時にルーリックからドメイン知識を抽出するシンプルな戦略RAGを紹介する。
論文 参考訳(メタデータ) (2026-03-21T17:10:14Z) - Autorubric: A Unified Framework for Rubric-Based LLM Evaluation [34.429649156970015]
大規模言語モデル(LLM)を評価するための統一フレームワークを提案する。
この論文で提案されているオープンソースのPythonフレームワークであるAutorubricで、それぞれのテクニックが実現されている。
Autorubricは、重み付き二分、順序、および名目基準をサポートしており、多数派、重み付き、一対一、無投票のアグリゲーションによるシングルジャッジとマルチジャッジのアンサンブルの評価である。
論文 参考訳(メタデータ) (2026-02-13T02:26:30Z) - Learning Query-Specific Rubrics from Human Preferences for DeepResearch Report Generation [80.12435680651488]
本稿では,DeepResearchレポート生成に適した,人間の参照型クエリ専用ルーリックジェネレータを訓練するためのパイプラインを提案する。
まず,DeepResearchスタイルのアノテートクエリのデータセットを,ペアレポートよりも人間の好みで構築し,強化学習を通じてルーリックジェネレータを訓練する。
提案したルーリック・ジェネレータは既存のルーリック・デザイン・ストラテジーよりも、より差別的で優れたヒューマン・アライメント・インテリジェンスを実現することを実証的に示す。
論文 参考訳(メタデータ) (2026-02-03T15:09:56Z) - Can Deep Research Agents Find and Organize? Evaluating the Synthesis Gap with Expert Taxonomies [57.11324429385405]
72のコンピュータサイエンスサーベイから得られた診断ベンチマークであるTaxoBenchを紹介する。
我々は,3,815個の引用を根本的真理として正確に分類した分類木を手作業で抽出した。
ベストエージェントは、専門家が選択した論文の20.9%しかリコールせず、完璧なインプットであっても、最高のモデルは組織の0.31 ARIしか達成していない。
論文 参考訳(メタデータ) (2026-01-18T11:57:09Z) - DeepResearch Bench II: Diagnosing Deep Research Agents via Rubrics from Expert Report [36.25273583677749]
我々は、ディープリサーチシステムを評価するための新しいベンチマークであるDeep Research Bench IIを紹介する。
各タスクに対して、システムは9430個の微細なバイナリルーブリックによって評価される長期の研究レポートを生成する必要がある。
我々は、Deep Research Bench IIにおける最先端のディープリサーチシステムを評価し、最強のモデルでさえ、ルーリックの50%以下を満たすことを発見した。
論文 参考訳(メタデータ) (2026-01-13T13:18:39Z) - BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent [74.10138164281618]
BrowseComp-Plus(BrowseComp-Plus)は、BrowseCompから派生したベンチマークである。
このベンチマークは、ディープリサーチエージェントと検索方法の総合的な評価とアンタングル解析を可能にする。
論文 参考訳(メタデータ) (2025-08-08T17:55:11Z) - JudgeRank: Leveraging Large Language Models for Reasoning-Intensive Reranking [81.88787401178378]
本稿では,文書関連性を評価する際に,人間の認知過程をエミュレートする新しいエージェント・リランカであるJiceRankを紹介する。
我々は,推論集約型BRIGHTベンチマークを用いて判定Rankを評価し,第1段階の検索手法よりも性能が大幅に向上したことを示す。
さらに、JiceRankは、人気の高いBEIRベンチマークの細調整された最先端リランカと同等に動作し、ゼロショットの一般化能力を検証している。
論文 参考訳(メタデータ) (2024-10-31T18:43:12Z) - Large Language Models are not Fair Evaluators [60.27164804083752]
候補回答の品質ランキングは,文脈の出現順序を変えることで容易にハックできることがわかった。
この操作により、評価結果をスキューし、一方のモデルを他方よりもかなり優れているようにすることができる。
この問題を緩和するための3つのシンプルかつ効果的な戦略を持つフレームワークを提案する。
論文 参考訳(メタデータ) (2023-05-29T07:41:03Z) - Revisiting the Gold Standard: Grounding Summarization Evaluation with
Robust Human Evaluation [136.16507050034755]
要約のための既存の人間の評価研究は、アノテータ間の合意が低かったり、スケールが不十分だったりしている。
細粒度セマンティック・ユニットをベースとした改良された要約サリエンス・プロトコルであるAtomic Content Units (ACUs)を提案する。
ロバスト・サムライゼーション・アセスメント(RoSE)ベンチマークは,28の上位性能システム上で22,000の要約レベルのアノテーションからなる大規模な人的評価データセットである。
論文 参考訳(メタデータ) (2022-12-15T17:26:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。