論文の概要: DeepFact: Co-Evolving Benchmarks and Agents for Deep Research Factuality
- arxiv url: http://arxiv.org/abs/2603.05912v1
- Date: Fri, 06 Mar 2026 05:05:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-09 13:17:45.098567
- Title: DeepFact: Co-Evolving Benchmarks and Agents for Deep Research Factuality
- Title(参考訳): DeepFact:Deep Research Factualityのためのベンチマークとエージェントの共同開発
- Abstract要約: 既存のファクトチェッカーは主に汎用ドメイン、ファクトイドスタイルの原子クレーム用に設計されている。
本稿では,ベンチマークラベルと有理値が明示的に変更可能なAudit-then-Score (AtS)を提案する。
我々は、AtSを、監査可能な有理量を持つDRR事実性ベンチマークであるDeepFact-Benchとしてインスタンス化する。
- 参考スコア(独自算出の注目度): 49.62610727661819
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Search-augmented LLM agents can produce deep research reports (DRRs), but verifying claim-level factuality remains challenging. Existing fact-checkers are primarily designed for general-domain, factoid-style atomic claims, and there is no benchmark to test whether such verifiers transfer to DRRs. Yet building such a benchmark is itself difficult. We first show that static expert-labeled benchmarks are brittle in this setting: in a controlled study with PhD-level specialists, unassisted experts achieve only 60.8% accuracy on a hidden micro-gold set of verifiable claims. We propose Evolving Benchmarking via Audit-then-Score (AtS), where benchmark labels and rationales are explicitly revisable: when a verifier disagrees with the current benchmark, it must submit evidence; an auditor adjudicates the dispute; and accepted revisions update the benchmark before models are scored. Across four AtS rounds, expert micro-gold accuracy rises to 90.9%, indicating experts are substantially more reliable as auditors than as one-shot labelers. We instantiate AtS as DeepFact-Bench, a versioned DRR factuality benchmark with auditable rationales, and DeepFact-Eval, a document-level verification agent (with a grouped lite variant) that outperforms existing verifiers on DeepFact-Bench and transfers well to external factuality datasets.
- Abstract(参考訳): 検索強化LDMエージェントは、深い研究報告(DRR)を作成できるが、クレームレベルの事実性を検証することは依然として困難である。
既存のファクトチェックは、主に汎用ドメイン、ファクトイドスタイルの原子クレームのために設計されており、そのような検証者がDRRに移行するかどうかをテストするためのベンチマークはない。
しかし、そのようなベンチマークを構築することは、それ自体が難しい。
博士レベルの専門家による制御された研究では、未支援の専門家は隠れたマイクロゴールドのクレームに対してわずか60.8%の精度しか達成していない。
我々は,AtS(Audit-then-Score)によるベンチマークの展開を提案する。ベンチマークラベルと合理性は,検証者が現在のベンチマークに異を唱える場合には証拠を提出しなければならない。
4回のAtSラウンドで、エキスパートのマイクロゴールドの精度は90.9%に上昇し、専門家はワンショットラベルよりもオーディエンスとしてかなり信頼性が高いことを示している。
我々は、AtSを、監査可能な有理性を持つDRRファクトリティベンチマークであるDeepFact-Benchと、DeepFact-Bench上の既存の検証を上回り、外部のファクトリティデータセットにうまく転送する文書レベルの検証エージェントであるDeepFact-Evalとしてインスタンス化する。
関連論文リスト
- The Double Measurement Confound in Agent Benchmarks: De-Scaffolding, Ground-Truth Scoring, and Reliability Beyond the Mean [2.822987192839875]
エージェントベンチマークは、大規模言語モデル(LLM)の比較やデプロイメント決定のガイドにますます使用されている。
実行クリティカルな決定はモデルの代わりに固定された足場によって行われ、スコアラはタスクの正しさを反映しない基準を用いて出力を評価する。
ベンチマークスコアをモデル能力の証拠として解釈できる場合に特徴付ける測定理論の枠組みでこれらの問題を統一する。
論文 参考訳(メタデータ) (2026-09-06T21:23:11Z) - Benchmarking the Benchmarks: A Validity Audit of Tool-Calling Evaluation [3.079997053226693]
本報告では,4つの主要なツールコール・ベンチマーク・ファミリーの体系的妥当性と評価について述べる。
496人の専門家がレビューしたベンチマークタスクのうち、92人の評価者と人間の意見の不一致が18.5%のミスアライメントレートに対応している。
ツールコール評価失敗、トレースレベルの監査成果物、修正された評価項目の統一分類を導入し、ツールの実行、タスク完了、結果検証を別々に計測する指標について議論する。
論文 参考訳(メタデータ) (2026-06-30T21:10:42Z) - Bayesian control for coding agents [63.64172141184361]
本稿では,コーディングエージェントのためのコスト依存型シーケンシャル仮説テストフレームワークを提案する。
ベイズ管制官は、正確性に対する信念を維持し、より多くの証拠を集め、候補者を精査し、検証し、停止するかを決定する。
本研究では, 信頼状態が, 不確実性定量化のためのトークン確率と生ツール・サクセスベースラインを上回り, 解釈可能な正当性スコアを得ることを示す。
論文 参考訳(メタデータ) (2026-06-23T11:41:32Z) - Automated Benchmark Auditing for AI Agents and Large Language Models [46.03841647776303]
Auto Benchmark Audit (ABA)は、個々のベンチマークタスクを体系的に監査するエージェントフレームワークである。
私たちは、9つのドメインで合計168のベンチマークで、Frontier LLMベンチマークと以前のNeurIPSパブリッシュのコレクションでABAを実行しています。
ABAは、不明瞭なタスク設計、実行環境の矛盾、そして、評価されたタスクの25.7%以上において、誤った根拠の真実を含む重要な問題を特定する。
論文 参考訳(メタデータ) (2026-05-25T17:44:21Z) - Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? [61.49434544687523]
本稿では,エージェント環境におけるきめ細かい故障検出を目的としたメタ評価ベンチマークREFLECTを紹介する。
REFLECTはプロセスレベルの障害モードと結果レベルの障害モードの詳細な分類を定義し、制御および局所的な介入を実行することでインスタンス化する。
私たちの実験では、最高のパフォーマンスモデルでさえ、推論、ツール使用、レポート品質の失敗に対して、全体的なアキュラシーを55%以下に達成しています。
論文 参考訳(メタデータ) (2026-05-18T23:55:08Z) - BenchGuard: Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks [26.58983143152204]
BenchGuardはタスク指向、実行ベースのエージェントベンチマークのための最初の自動監査フレームワークである。
それは、ScienceAgentBenchの12の著者確認問題と、BIXBench Verified-50サブセットのエキスパート特定問題の83.3%を特定している。
USD 15の50の複雑なバイオインフォマティクスタスクの完全な監査により、自動ベンチマーク監査は人間によるレビューの実践的で価値のある補完となる。
論文 参考訳(メタデータ) (2026-04-27T19:51:25Z) - Silicon Bureaucracy and AI Test-Oriented Education: Contamination Sensitivity and Score Confidence in LLM Benchmarks [43.45152572188735]
本稿では,言語モデルにおける汚染感度とスコア信頼度を解析するための監査フレームワークを提案する。
ノイズ条件下では, 広範に不均一なベースラインゲインが得られる。
これらの結果は、類似のベンチマークスコアが、かなり異なる信頼レベルを持つ可能性があることを示唆している。
論文 参考訳(メタデータ) (2026-03-23T07:03:07Z) - Guideline-Grounded Evidence Accumulation for High-Stakes Agent Verification [60.18369393468405]
既存の検証器は通常、ドメイン知識の欠如と限られた校正のために性能が劣る。
GLEANは専門家によって計算されたプロトコルをトラジェクトリインフォームされ、よく校正された正当性信号にコンパイルする。
我々は,MIMIC-IVデータセットから得られた3つの疾患の薬物的臨床診断でGLEANを実証的に検証した。
論文 参考訳(メタデータ) (2026-03-03T09:36:43Z) - FIRE-Bench: Evaluating Agents on the Rediscovery of Scientific Insights [63.32178443510396]
FIRE-Bench (Full-cycle Insight Rediscovery Evaluation) は、確立された発見の再検討を通じてエージェントを評価するベンチマークである。
最強のエージェントでさえ、限られた再発見成功(50 F1)を達成し、実行中に高いばらつきを示し、実験的な設計、実行、エビデンスに基づく推論において繰り返し失敗モードを表示する。
論文 参考訳(メタデータ) (2026-02-02T23:21:13Z) - RULERS: Locked Rubrics and Evidence-Anchored Scoring for Robust LLM Evaluation [15.787947727055611]
本稿では,自然言語ルーブを実行可能な仕様に変換するコンパイラ・エグゼクタフレームワークであるRULERSを紹介する。
RULERSは、基準をバージョニングされた不変バンドルにコンパイルし、決定論的証拠検証による構造化復号を強制し、軽量なワッサーシュタインベースのポストホックキャリブレーションを適用する。
論文 参考訳(メタデータ) (2026-01-13T15:31:42Z) - PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review [54.141490756509306]
本稿では、エラーデータセットであるPaperAudit-Datasetと、自動レビューフレームワークであるPaperAudit-Reviewの2つのコンポーネントからなるPaperAudit-Benchを紹介する。
PaperAudit-Benchの実験では、モデルと検出深さの誤差検出可能性に大きなばらつきが示された。
本研究では,SFTおよびRLによる軽量LLM検出器のトレーニングをサポートし,計算コストの削減による効率的な誤り検出を実現する。
論文 参考訳(メタデータ) (2026-01-07T04:26:12Z) - DEER: A Comprehensive and Reliable Benchmark for Deep-Research Expert Reports [49.217247659479476]
ディープリサーチシステムは、多段階の推論とエビデンスベースの合成を通じて専門家レベルのレポートを生成することができる。
既存のベンチマークは、エキスパートレポートの体系的な基準を欠いていることが多い。
専門家レベルのディープリサーチレポートを評価するためのベンチマークであるDEERを紹介する。
論文 参考訳(メタデータ) (2025-12-19T16:46:20Z) - VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains [19.579511315215424]
大規模な言語モデルは、フィードバックを通じて推論能力を高めるために強化学習に依存している。
既存の研究では、より良い検証器の構築に焦点が当てられているが、異なる種類の検証器の性能の体系的な評価は依然として不十分である。
我々は、数学、物理学、化学、生物学に関する4000のエキスパートレベルの質問を構築した。
各質問には基準回答と多様な応答が備わっている。
論文 参考訳(メタデータ) (2025-07-14T03:45:24Z) - TrendFact: A Benchmark for Explainable Hotspot Perception in Fact-Checking with Natural Language Explanation [9.221637941193606]
ホットスポット認識能力(HPA)とすべてのファクトチェックタスクを評価することができる最初のベンチマークであるTrendFactを紹介する。
TrendFactは、トレンドプラットフォームとプロのファクトチェックデータセットから得られた7,643のキュレートされたサンプルで構成されている。
また、動的エビデンス強化と影響スコアに基づく反復的自己回帰を統合した推論フレームワークであるFactISRを提案する。
論文 参考訳(メタデータ) (2024-10-19T15:25:19Z) - FactCHD: Benchmarking Fact-Conflicting Hallucination Detection [64.4610684475899]
FactCHD は LLM からファクトコンフリクトの幻覚を検出するために設計されたベンチマークである。
FactCHDは、バニラ、マルチホップ、比較、セット操作など、さまざまな事実パターンにまたがる多様なデータセットを備えている。
Llama2 に基づくツール強化 ChatGPT と LoRA-tuning による反射的考察を合成する Truth-Triangulator を提案する。
論文 参考訳(メタデータ) (2023-10-18T16:27:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。