論文の概要: AuthTrace: Diagnosing Evidence Construction in Thematically Dense Single-Author Corpora
- arxiv url: http://arxiv.org/abs/2605.25382v2
- Date: Tue, 26 May 2026 10:32:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-27 17:51:41.09688
- Title: AuthTrace: Diagnosing Evidence Construction in Thematically Dense Single-Author Corpora
- Title(参考訳): AuthTrace: セマンティックなシングルオーセンタコーパスにおけるエビデンス構築の診断
- Abstract要約: AuthTraceは,主題的に密集した単一著者コーパスに基づいて構築された診断ベンチマークである。
AuthTraceは明示的な引用されたエビデンス、正確なファンインアノテーション、エビデンスリコール、エビデンス精度、答えの正当性を測定する統一パックレベルのプロトコルを提供する。
- 参考スコア(独自算出の注目度): 6.956097396264084
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Evidence construction--the stage that determines which passages reach the language model before generation begins--is evaluated paradigm by paradigm, leaving practitioners with no principled way to diagnose which organization strategy fails, where, or why. We introduce AuthTrace, a diagnostic benchmark built on thematically dense single-author corpora where near-miss distractors share style, topic, and vocabulary with the required evidence. AuthTrace provides explicit quoted evidence, exact fan-in annotation, and a unified pack-level protocol measuring evidence recall, evidence precision, and answer correctness. A fan-in gradient--the number of source documents required to support the answer--serves as the primary diagnostic axis, enabling controlled comparison across retrieval, memory, graph, and structured-evidence paradigms. Evaluating eight systems across two QA models, we find that evidence recall is the strongest observed predictor of answer correctness under the primary reader-judge pair (r = 0.96); most failures stem from missing evidence rather than answer synthesis. Fan-in further exposes paradigm-specific collapse patterns: flat retrieval degrades 2-3x faster than thematically organized evidence construction. These results show fan-in decomposition to be a reusable diagnostic lens for identifying where evidence-construction systems fail and which paradigm best serves a given workload.
- Abstract(参考訳): エビデンス・コンストラクション(エビデンス・コンストラクション) - 生成が始まる前にどのパスが言語モデルに達するかを決定するステージは、パラダイムによって評価される。
AuthTraceは、密集したシングルオーサコーパスに基づいて構築された診断ベンチマークで、必要となるエビデンスと、そのスタイル、トピック、語彙を共有する。
AuthTraceは明示的な引用されたエビデンス、正確なファンインアノテーション、エビデンスリコール、エビデンス精度、答えの正当性を測定する統一パックレベルのプロトコルを提供する。
ファンイン勾配(ファンイン勾配) - 主診断軸として回答をサポートするのに必要な情報源文書の数 - 検索、メモリ、グラフ、構造化エビデンスパラダイム間の制御された比較を可能にする。
2つのQAモデルにまたがる8つのシステムを評価すると、エビデンスリコールはプライマリ・ジャッジ・ペア (r = 0.96) の解答正解率の最も強い予測因子であることがわかった。
フラット検索は、数学的に組織されたエビデンス構築よりも2~3倍早く劣化する。
これらの結果から,ファンイン分解はエビデンス・コンストラクションシステムが故障した場所と,どのパラダイムが与えられた作業負荷に最適かを特定するための再利用可能な診断レンズであることが示された。
関連論文リスト
- Navigating Sparse Evidence: Agentic Visual RAG via Explicit Context Selection and Consolidation [50.92223196290564]
明示的な証拠選択と統合のための統一エージェントループを提案する。
探索中、SCoREはクエリ関連観測とソースポインタのみを保守されたテキスト台帳に保持する。
終了時には、参照された元のイメージを再ロードし、答えの視覚的証拠を統合し、論理的なシーケンスにアレンジする。
論文 参考訳(メタデータ) (2026-09-14T16:11:35Z) - Beyond Relevance: Bayesian Evidence Acquisition for Agentic Whole-Slide Image Reasoning [72.86819994769634]
全体スライド画像推論(WSI)では、診断問題に答える前に、エージェントが視覚的証拠を逐次取得する必要がある。
本稿では,WSI推論をベイズ証拠取得問題として再検討する,プラグイン・アンド・プレイのエージェント・フレームワークBEACONを提案する。
論文 参考訳(メタデータ) (2026-08-06T08:40:57Z) - HiEviDR-Bench: A Benchmark for Hierarchical Evidence Aggregation in Deep Research [52.87128503345243]
我々は,Deep Researchにおける階層的エビデンス・アグリゲーションを評価するためのベンチマークであるHiEviDR-Benchを紹介する。
HiEviDR-Benchは、エビデンスの選択、クロスソースリンク、アグリゲーションをキャプチャする明示的なエビデンスグラフを持つ各インスタンスを表す。
報告品質,エビデンストレーサビリティ,引用精度,クレーム検証,回答正当性という5次元のトレーサビリティ指向評価フレームワークを開発した。
論文 参考訳(メタデータ) (2026-07-27T23:50:46Z) - SAAG: Structured Agent Assessment and Grounding [13.62148061055744]
本稿では,エージェント呼び出し評価を3段階に分解するケースケード診断フレームワークを提案する。
このフレームワークは,5,10,15エージェントのレジストリサイズにまたがって,Glaiveの関数呼び出しデータセットから得られたベンチマークで評価する。
論文 参考訳(メタデータ) (2026-04-30T19:33:58Z) - DocSeeker: Structured Visual Reasoning with Evidence Grounding for Long Document Understanding [63.257540233507626]
本稿では、構造化解析、局所化、推論のワークフローを実行するためにモデルを必要とするパラダイムを提案する。
ショートページトレーニングから超長文書への堅牢な一般化を示し、視覚的検索・拡張生成システムと自然に相乗効果を示す。
論文 参考訳(メタデータ) (2026-04-14T14:39:26Z) - Facet-Level Tracing of Evidence Uncertainty and Hallucination in RAG [8.18791900871137]
Retrieval-Augmented Generationは、検索された証拠の回答を根拠にして幻覚を減らすことを目的としている。
既存の評価は回答レベルの精度や通過レベルの正確さに重点を置いており、世代間の証拠の使用方法に関する限られた洞察を与えている。
本稿では、各入力質問を原子推論ファセットに分解するQAのためのファセットレベル診断フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-10T09:59:43Z) - AI-Supervisor: Autonomous AI Research Supervision via a Persistent Research World Model [1.14219428942199]
既存の自動研究システムは、ステートレスでリニアなパイプラインとして動作する。
マルチエージェントオーケストレーションフレームワークである textbfAI-Supervisor を提案する。
エージェントは、人間の関心によって駆動されるエンドツーエンドのAI研究の監督を提供する。
論文 参考訳(メタデータ) (2026-03-25T15:16:51Z) - Logics-Parsing-Omni Technical Report [18.897248420641386]
本稿では,断片化タスク定義の課題とマルチモーダル解析における非構造化データの均一性に対処するOmni Parsingフレームワークを提案する。
このフレームワークの重要な利点は、そのエビデンスアンカー機構であり、ハイレベルなセマンティック記述と低レベルな事実の厳密な一致を強制する。
これにより、エビデンスに基づく'論理的帰納化が可能となり、構造化されていない信号を、位置可能で、エナメル性があり、トレース可能な標準化された知識に変換する。
論文 参考訳(メタデータ) (2026-03-10T13:46:32Z) - Retrieval-Infused Reasoning Sandbox: A Benchmark for Decoupling Retrieval and Reasoning Capabilities [32.76303717104482]
DeR2(DeR2)は、ドキュメント基底推論を分離する制御されたディープ検索サンドボックスである。
DeR2は、推論から4つのレシエーション(命令のみ、概念のみ、関連のみ、フルセット)を通じてアクセスする証拠を分離する。
さまざまな最先端の基礎モデルに対する実験は、かなりのバリエーションと重要なヘッドルームを明らかにしている。
論文 参考訳(メタデータ) (2026-01-29T16:26:19Z) - Demystifying deep search: a holistic evaluation with hint-free multi-hop questions and factorised metrics [89.1999907891494]
We present WebDetective, a benchmark of hint-free multi-hop questions with a control Wikipedia sandbox。
25の最先端モデルに対する我々の評価は、すべてのアーキテクチャにまたがる体系的な弱点を明らかにしている。
私たちはエージェントワークフローであるEvidenceLoopを開発し、ベンチマークが特定する課題を明示的にターゲットしています。
論文 参考訳(メタデータ) (2025-10-01T07:59:03Z) - RealUnify: Do Unified Models Truly Benefit from Unification? A Comprehensive Benchmark [71.3555284685426]
本稿では,双方向機能相乗効果を評価するためのベンチマークであるRealUnifyを紹介する。
RealUnifyは、10のカテゴリと32のサブタスクにまたがる、細心の注意を払ってアノテートされた1000のインスタンスで構成されている。
現在の統一モデルは、効果的な相乗効果を達成するのに依然として苦労しており、アーキテクチャの統一だけでは不十分であることを示している。
論文 参考訳(メタデータ) (2025-09-29T15:07:28Z) - Retrieving Versus Understanding Extractive Evidence in Few-Shot Learning [4.230202411425062]
大規模言語モデルにおける文書内証拠の検索と解釈の関係を解析する。
ラベル予測とエビデンス検索の誤りが関連する証拠の質に起因するかどうかを2つのアブレーション研究により調査する。
論文 参考訳(メタデータ) (2025-02-19T20:48:09Z) - Localizing Factual Inconsistencies in Attributable Text Generation [74.11403803488643]
本稿では,帰属可能なテキスト生成における事実の不整合をローカライズするための新しい形式であるQASemConsistencyを紹介する。
QASemConsistencyは、人間の判断とよく相関する事実整合性スコアを得られることを示す。
論文 参考訳(メタデータ) (2024-10-09T22:53:48Z) - DeepfakeBench: A Comprehensive Benchmark of Deepfake Detection [55.70982767084996]
ディープフェイク検出の分野で見落とされがちな課題は、標準化され、統一され、包括的なベンチマークがないことである。
DeepfakeBenchと呼ばれる,3つの重要なコントリビューションを提供するディープフェイク検出のための,最初の包括的なベンチマークを提示する。
DeepfakeBenchには15の最先端検出方法、9CLデータセット、一連のDeepfake検出評価プロトコルと分析ツール、包括的な評価ツールが含まれている。
論文 参考訳(メタデータ) (2023-07-04T01:34:41Z) - GERE: Generative Evidence Retrieval for Fact Verification [57.78768817972026]
本稿では,ジェネレーション方式で証拠を検索する最初のシステムであるGEREを提案する。
FEVERデータセットの実験結果は、GEREが最先端のベースラインよりも大幅に改善されていることを示している。
論文 参考訳(メタデータ) (2022-04-12T03:49:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。