論文の概要: ProvenAI: Provenance-Native Traces of Evidence in Generated Answers
- arxiv url: http://arxiv.org/abs/2606.26449v1
- Date: Wed, 24 Jun 2026 23:22:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.099208
- Title: ProvenAI: Provenance-Native Traces of Evidence in Generated Answers
- Title(参考訳): ProvenAI: 発生した回答における証拠の有意な痕跡
- Abstract要約: 本稿では,マルチホップ質問応答における透明性を3つの独立した測定可能なレイヤに分解するフレームワークであるProvenAIを紹介する。
このシステムは平均引用忠実度スコアが71.55%の53.53%の解答精度を達成する。
実装された表面プロキシとトークンレベルのKL偏差ターゲットの関係を,忠実度条件で定式化する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Retrieval-augmented systems routinely present citations alongside generated answers, yet a citation does not confirm that the corresponding source meaningfully shaped the output. This paper introduces ProvenAI, a framework that decomposes transparency in multi-hop question answering into three independently measurable layers: answer correctness, citation fidelity against benchmark supporting evidence, and per-document influence under leave-one-resource-out intervention. Targeting the HotpotQA distractor benchmark through a seven-stage pipeline covering data normalisation, retrieval indexing, citation-aware answer generation, attribution auditing, ablation-based influence estimation, batch evaluation, and interactive inspection, ProvenAI evaluates 7,405 validation examples drawn from a canonical corpus of 509,300 passages. The system achieves 53.53% answer accuracy alongside a mean citation-fidelity score of 71.55%, and a worked example surfaces what we call the citation-influence gap: a clean citation audit co-occurring with a profile in which one cited source registers only weak influence while seven uncited sources demonstrably shift the output. We formalise the relationship between the implemented surface proxy and a token-level KL-divergence target through a stated faithfulness condition, ground the framework in causal-mediation analysis and database-provenance theory, and discuss how the three measurement layers compose with cryptographic provenance architectures emerging in autonomous scientific discovery. ProvenAI establishes that meaningful transparency in retrieval-grounded QA requires traceable links across retrieved, cited, and behaviourally influential evidence as three distinct, independently measured layers.
- Abstract(参考訳): Retrieval-augmentedシステムでは、生成した回答と並行して引用を定期的に提示するが、対応するソースが有意に出力を形作ることは確認されていない。
本稿では,マルチホップ質問における透明性を3つの独立した測定可能なレイヤに分解するフレームワークであるProvenAIを紹介する。
ProvenAIは、データ正規化、検索インデックス、引用対応回答生成、属性監査、アブレーションに基づく影響推定、バッチ評価、インタラクティブインスペクションを含む7段階のパイプラインを通じて、HotpotQAトラクタベンチマークをターゲットとしており、509,300のパスからなる標準コーパスから引き出された7,405の検証例を評価している。
本システムでは, 平均引用忠実度スコア71.55%とともに53.53%の回答精度を達成し, クリーンな引用監査と, 引用ソースが弱い影響のみを登録し、7つの未引用ソースが明らかに出力をシフトするプロファイルを同時生成した。
実装された表面プロキシとトークンレベルのKL分割ターゲットとの関係を,忠実度条件で定式化し,因果緩和分析とデータベース・プロパガンス理論の枠組みを定式化し,これら3つの測定層が,自律科学的発見において出現する暗号的証明アーキテクチャとどのように構成するかを議論する。
ProvenAIは、検索対象のQAにおいて有意義な透明性は、検索、引用、行動に影響を及ぼすエビデンスを3つの異なる、独立に測定されたレイヤとして、トレース可能なリンクを必要とすることを証明している。
関連論文リスト
- HiEviDR-Bench: A Benchmark for Hierarchical Evidence Aggregation in Deep Research [52.87128503345243]
我々は,Deep Researchにおける階層的エビデンス・アグリゲーションを評価するためのベンチマークであるHiEviDR-Benchを紹介する。
HiEviDR-Benchは、エビデンスの選択、クロスソースリンク、アグリゲーションをキャプチャする明示的なエビデンスグラフを持つ各インスタンスを表す。
報告品質,エビデンストレーサビリティ,引用精度,クレーム検証,回答正当性という5次元のトレーサビリティ指向評価フレームワークを開発した。
論文 参考訳(メタデータ) (2026-07-27T23:50:46Z) - Evidence-Grounded Verified Agentic Reasoning: A Path Toward Eliminating LLM Hallucination in Empirical Inference via Tool-Attested Kernel Proofs [0.564046562677526]
リーン4ベースのツールコールアーキテクチャが経験的クレームを管理するのにどのように使用できるかを示します。
検証されたすべての出力は、検査済みのツールコールと、有効な推論のカーネルチェックされたチェーンから構造的に下降する。
正式なサイドカーは、目標命題、ソーススコープ、エビデンス境界、証明義務、棄権条件を監査可能にする。
時間とともに、データセット、API、公開レコード、AI生成ドキュメントの型付きサイドカーは、この形式化の負担を再利用可能なインフラストラクチャに戻すことができる。
論文 参考訳(メタデータ) (2026-07-14T11:33:44Z) - MultAttnAttrib: Training-Free Multimodal Attribution in Long Document Question Answering [73.47440561592556]
トレーニング不要な属性生成手法であるMultAttnAttribを紹介する。
MultAttnAttribは、様々な属性生成方法よりも一貫して優れていることを示す。
提案手法は直接推論遅延の最大7分の1の属性を生成する。
論文 参考訳(メタデータ) (2026-07-01T19:29:19Z) - How Do LLMs Cite? A Mechanistic Interpretation of Attribution in Retrieval-Augmented Generation [3.4562767039451674]
ファクトイドの質問に答えながらインライン・引用を付加するかを,大規模言語モデルがどう判断するかを示す。
以上より,PopQAでは,これらの臨界頭部のみを増幅または減衰させ,解答精度を損なうことなく69%の急激な頭部を除去できることが示唆された。
結果は、モデルが明らかな推論と内部の計算経路を切断する可能性を明らかにした。
論文 参考訳(メタデータ) (2026-06-09T07:06:13Z) - Explicit Evidence Grounding via Structured Inline Citation Generation [22.27784103991804]
FullCiteは、各クレームをソースドキュメントとリンクし、エビデンスをサポートする構造化インライン引用を生成するフレームワークである。
文献レベルの正しさ,証拠の特定範囲,クレームレベルの忠実さの3つの側面に沿って,引用品質と忠実度を評価する。
論文 参考訳(メタデータ) (2026-06-05T10:42:10Z) - Verified Misguidance: Measuring Structural Citation Failures in Search-Augmented LLMs [8.721564756242431]
CITETRACEは、ユーザクエリから取得したソースから生成された回答まで、完全な引用チェーンをトレースするデータセットである。
我々は,意図的アライメント,ソース適合性,回答ソースの忠実度に基づいて各引用をスコアする3次元評価フレームワークを設計する。
プールの向こう側では、引用の30.6%がソースを歪めており、27.1%はドメイン不適切なソースから来ている。
論文 参考訳(メタデータ) (2026-05-27T14:54:05Z) - Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research Agents [0.18762753243053634]
大規模言語モデル(LLM)は、数百のWebソースから情報を引用したレポートに合成するディープリサーチエージェントをパワーアップする。
現在のアプローチでは、信頼モデルが正確な自己引用、バイアスのリスク、あるいはソースアクセシビリティ、関連性、事実整合性を検証しない検索強化世代(RAG)を採用する。
本稿では,再現可能なASTルーブリックを用いてインライン引用を大規模に抽出し,評価する最初の情報源属性評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-07T17:46:45Z) - FactReview: Evidence-Grounded Reviews with Literature Positioning and Execution-Based Claim Verification [57.196748998757954]
本稿では,クレーム抽出,文献位置決定,実行に基づくクレーム検証を組み合わせたエビデンスベースレビューシステムであるFactReviewを紹介する。
FactReviewは論文を提出すると、主要なクレームを特定し、その結果を報告し、論文の技術的な位置を明らかにするために近くの作業を取り出し、コードが利用可能であれば、リリースされたリポジトリを実行する。
その後、簡潔なレビューと、主要な請求を5つのラベルのうち1つに割り当てるエビデンスレポートを生成する。
論文 参考訳(メタデータ) (2026-04-05T11:45:22Z) - PAVE: Premise-Aware Validation and Editing for Retrieval-Augmented LLMs [8.082352336629816]
PAVEは、根拠に基づく質問応答のための推論時検証層である。
検索されたコンテキストを質問条件のアトミックな事実に分解し、回答をドラフトし、抽出された前提によってそのドラフトがどの程度うまくサポートされているかをスコアし、ファイナライズ前に低サポート出力を更新する。
論文 参考訳(メタデータ) (2026-03-21T06:23:21Z) - Look As You Think: Unifying Reasoning and Visual Evidence Attribution for Verifiable Document RAG via Reinforcement Learning [55.232400251303794]
Look As You Think (LAT)は、モデルをトレーニングし、一貫した帰属性を持った検証可能な推論パスを生成するための強化学習フレームワークである。
LATはシングルイメージとマルチイメージの両方でバニラモデルを一貫して改善し、平均ゲインは8.23%、IoU@0.5では47.0%となる。
論文 参考訳(メタデータ) (2025-11-15T02:50:23Z) - VeriCite: Towards Reliable Citations in Retrieval-Augmented Generation via Rigorous Verification [107.75781898355562]
証拠を厳格に検証し,回答の帰属性を高めるために設計された,VeriCiteと呼ばれる新しいフレームワークを紹介する。
我々は,5つのオープンソースLCMと4つのデータセットを対象とした実験を行い,VeriCiteが回答の正しさを維持しつつ,引用品質を大幅に向上できることを実証した。
論文 参考訳(メタデータ) (2025-10-13T13:38:54Z) - GERE: Generative Evidence Retrieval for Fact Verification [57.78768817972026]
本稿では,ジェネレーション方式で証拠を検索する最初のシステムであるGEREを提案する。
FEVERデータセットの実験結果は、GEREが最先端のベースラインよりも大幅に改善されていることを示している。
論文 参考訳(メタデータ) (2022-04-12T03:49:35Z) - AmbiFC: Fact-Checking Ambiguous Claims with Evidence [57.7091560922174]
実世界の情報ニーズから10kクレームを抽出したファクトチェックデータセットであるAmbiFCを提示する。
アンビFCの証拠に対する主張を比較する際に,曖昧さから生じる不一致を分析した。
我々は,このあいまいさをソフトラベルで予測するモデルを開発した。
論文 参考訳(メタデータ) (2021-04-01T17:40:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。