論文の概要: Redesigning and Auditing Deep Research Writing for Faithful Reports
- arxiv url: http://arxiv.org/abs/2608.28643v1
- Date: Wed, 12 Aug 2026 18:01:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-06 19:38:41.462745
- Title: Redesigning and Auditing Deep Research Writing for Faithful Reports
- Title(参考訳): 忠実なレポートのための深層研究書記の再設計と監査
- Abstract要約: CLAIMPROBE(クレームレベル監査)は、DRレポートを、幻覚、誤帰、引用衛生、必要なファクトリコールに分解するクレームレベル監査である。
そこで我々は,階層的なクレームベースライターであるCLAIMWRITERを提案し,ソース事実を抽出し,それらをクエリアウトラインにマップし,ソースリンクされたクレーム表現から各セクションをドラフトする。
- 参考スコア(独自算出の注目度): 35.59245587969539
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Rubric-based evaluations of deep-research (DR) systems often obscure fine-grained factual failures in generated reports. We introduce CLAIMPROBE, a claim-level audit that decomposes DR reports into claims and measures hallucination, misattribution, citation hygiene, and necessary-fact recall against retrieved evidence. Using CLAIMPROBE, we find that strong DR pipelines can omit key evidence and misattribute claims even when their rubric scores remain stable. We then propose CLAIMWRITER, a hierarchical claim-based writer that extracts source facts, maps them to a query-derived outline, and drafts each section from a source-linked claim representation. Across three prior DR frameworks, replacing only the report writer with CLAIMWRITER reduces hallucination by 2.6 to 4.5 times and improves necessary-fact recall by 1.2 to 1.7 times, while largely preserving overall report quality. CLAIMWRITER also enables localized revision: when sources change, it propagates changed source facts into revised reports at the highest rate among update methods, while also being more cost-effective.
- Abstract(参考訳): ディープ・リサーチ(DR)システムのルーブリックに基づく評価は、しばしば生成されたレポートにおいて、きめ細かい事実的失敗を曖昧にする。
CLAIMPROBE(クレームレベル監査)は, DRレポートを, 幻覚, 誤帰, 引用衛生, 回収された証拠に対する必要ファクトリコールに分解するクレームレベル監査である。
CLAIMPROBEを用いることで、強力なDRパイプラインは、ルーリックスコアが安定している場合でも、重要な証拠や誤った主張を省略できることがわかった。
そこで我々は,階層的なクレームベースライターであるCLAIMWRITERを提案し,ソース事実を抽出し,それらをクエリアウトラインにマップし,ソースリンクされたクレーム表現から各セクションをドラフトする。
従来の3つのDRフレームワークで、レポートライターのみをCLAIMWRITERに置き換えることで、幻覚を2.6倍から4.5倍に減らし、必要なファクトリコールを1.2倍から1.7倍改善し、レポート全体の品質をほぼ維持している。
CLAIMWRITERは、ソースが変更されると、更新方法の中で最も高いレートで、変更したソースの事実を修正レポートに伝達すると同時に、よりコスト効率が良いように、ローカライズされたリビジョンも可能にする。
関連論文リスト
- Provenance Before Prose: Claim-Locked Reporting [9.106326969263483]
科学報告のエビデンスを含む内容は、散文生成時にサンプリングされるのではなく、構造化された統計結果によって修正されるべきである。
本稿では,各報告可能なクレームのエビデンスソース,数字,方向,許容言語強度を補正する前処理プロトコルであるクレームロック型レポーティングを提案する。
論文 参考訳(メタデータ) (2026-08-26T03:41:17Z) - DRNOISE: Benchmarking Deep Research Agents in Misleading Evidence Environments [51.049999642138]
誤解を招く証拠の下で、回答回復のための100タスクのベンチマークであるDRNOISEを紹介する。
それぞれのタスクは、2つの間接的レコードチェーンが支持する固有の金の答えを持ち、ペアのノイズ条件は競合する答えを直接記述する1つのもっともらしい文書を付加する。
強いクリーンタスク性能を持つエージェント全体で、この単一の介入は66-88ポイントの精度低下を引き起こす。
論文 参考訳(メタデータ) (2026-07-19T15:20:40Z) - FactReview: Evidence-Grounded Reviews with Literature Positioning and Execution-Based Claim Verification [57.196748998757954]
本稿では,クレーム抽出,文献位置決定,実行に基づくクレーム検証を組み合わせたエビデンスベースレビューシステムであるFactReviewを紹介する。
FactReviewは論文を提出すると、主要なクレームを特定し、その結果を報告し、論文の技術的な位置を明らかにするために近くの作業を取り出し、コードが利用可能であれば、リリースされたリポジトリを実行する。
その後、簡潔なレビューと、主要な請求を5つのラベルのうち1つに割り当てるエビデンスレポートを生成する。
論文 参考訳(メタデータ) (2026-04-05T11:45:22Z) - CiteAudit: You Cited It, But Did You Read It? A Benchmark for Verifying Scientific References in the LLM Era [51.63024682584688]
大規模言語モデル (LLM) は新たなリスクを導入している。
本稿では,科学文献における幻覚的引用のための総合的なベンチマークおよび検出フレームワークについて紹介する。
我々のフレームワークは、精度と解釈可能性の両方において、先行手法を著しく上回っている。
論文 参考訳(メタデータ) (2026-02-26T19:17:39Z) - Beyond Single-shot Writing: Deep Research Agents are Unreliable at Multi-turn Report Revision [31.91310124834185]
Deep Research Agents (DRAs) の既存のベンチマークでは、レポート生成を単一ショットの書き込みタスクとして扱う。
我々は,DRAの新たな評価軸として,マルチターンレポートリビジョンを確立する評価スイートであるMr Dreを紹介する。
論文 参考訳(メタデータ) (2026-01-19T16:48:45Z) - RIGOURATE: Quantifying Scientific Exaggeration with Evidence-Aligned Claim Evaluation [29.44948404858214]
RIGOURATEは、紙の本体から証拠を回収し、各クレームにオーバーステートメントスコアを割り当てる。
このフレームワークは、ICLRとNeurIPSの論文から10K以上のクレームエビデンスセットのデータセットで構成されている。
論文 参考訳(メタデータ) (2026-01-07T19:36:08Z) - From Reviewers' Lens: Understanding Bug Bounty Report Invalid Reasons with LLMs [1.8652189113472575]
私たちは、9,942件のバグ報奨金を公表したデータセットを集めました。
我々は、最先端の大規模言語モデルが無効なレポートを識別できるかどうかを評価する。
我々は情報開示の脆弱性の理由の分類を作成し、それを検索強化された生成フレームワークに組み込む。
論文 参考訳(メタデータ) (2025-11-23T20:27:54Z) - GERE: Generative Evidence Retrieval for Fact Verification [57.78768817972026]
本稿では,ジェネレーション方式で証拠を検索する最初のシステムであるGEREを提案する。
FEVERデータセットの実験結果は、GEREが最先端のベースラインよりも大幅に改善されていることを示している。
論文 参考訳(メタデータ) (2022-04-12T03:49:35Z) - CLARA: Clinical Report Auto-completion [56.206459591367405]
CLARA(CLinicit Al It Report It Auto-Completion)は、医師のアンカーワードと部分的に完成した文に基づいて、文章でレポートを生成するインタラクティブな方法である。
実験では,X線で0.393 CIDEr,0.248 BLEU-4,脳波で0.482 CIDEr,0.491 BLEU-4を得た。
論文 参考訳(メタデータ) (2020-02-26T18:45:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。