論文の概要: More Claims, Less Evidence: Bounded Verification of AI-Generated Digital Knowledge Artifacts
- arxiv url: http://arxiv.org/abs/2610.05547v1
- Date: Sun, 04 Oct 2026 21:19:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 13:07:59.912077
- Title: More Claims, Less Evidence: Bounded Verification of AI-Generated Digital Knowledge Artifacts
- Title(参考訳): AI生成したデジタル知識アーティファクトのバウンド検証
- Abstract要約: 本稿では,PVP(Predictive Value of Pass)を中心とした境界検証のベイズモデルを提案する。
FEVEROUSとFEVERの実験では、一定の数の偽りのクレームについてサポートされたクレームを追加することで、パスを情報的でないものにする可能性が高まっている。
さらに、ターゲットPVPを維持するのに必要な最小限の検証予算が得られ、生成された知識オブジェクトを公開またはダウンストリーム使用前にチェックする必要があるAI支援品質保証のための実践的なコンポーネントを提供する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Digital libraries, repositories, and AI-mediated knowledge services increasingly rely on generative systems to produce summaries, descriptions, and other multi-claim knowledge objects. Yet generation can scale far more easily than verification capacity: a reviewer may need to decide whether an object is suitable for publication or downstream use after checking only a small fraction of its claims. This creates a fundamental gap between claim-level verification and confidence in the object as a whole. The central question is therefore what a successful partial check implies about the reliability of the complete artifact when its size grows but the verification budget does not. This paper contributes a Bayesian model of bounded verification centered on the Predictive Value of Pass (PVP). The model predicts that evidentiary value decreases as artifacts grow under fixed verification capacity, improves with larger verification budgets, and is especially fragile when errors are sparse. Controlled experiments on FEVEROUS and FEVER support these predictions and show that adding supported claims around a fixed number of false or unsupported claims can make passing more likely while making a pass less informative. The model further yields the minimum verification budget required to maintain a target PVP, providing a practical component for AI-assisted quality-assurance workflows in which generated knowledge objects must be checked before publication or downstream use.
- Abstract(参考訳): デジタルライブラリ、レポジトリ、AIを介するナレッジサービスは、要約、記述、その他の多言語知識オブジェクトを生成するために、生成システムに依存している。
しかし、生成は検証能力よりもはるかに容易にスケールできる。レビュアーは、クレームのごく一部だけをチェックした後、オブジェクトがパブリッシュに適しているか、下流での使用に適しているかを判断する必要があるかもしれない。
これにより、クレームレベルの検証とオブジェクト全体の信頼性の間に、根本的なギャップが生じます。
したがって、成功している部分的なチェックは、そのサイズが大きくなると、完全なアーティファクトの信頼性について何を意味するのか、という問題である。
本稿では,PVP(Predictive Value of Pass)を中心とした境界検証のベイズモデルを提案する。
このモデルは、アーチファクトが一定の検証能力で成長するにつれて明らかな価値が減少し、より大きな検証予算で改善され、エラーがスパースである場合には特に脆弱である、と予測する。
FEVEROUSとFEVERに関する制御された実験は、これらの予測をサポートし、固定された数の偽またはサポートされたクレームにサポートされたクレームを追加することで、パスを伝達しにくくする可能性があることを示す。
さらに、ターゲットPVPを維持するのに必要な最小限の検証予算が得られ、生成された知識オブジェクトをパブリッシュまたはダウンストリーム使用前にチェックする必要があるAI支援品質保証ワークフローの実践的なコンポーネントを提供する。
関連論文リスト
- AI Evaluation Should Measure Verification Cost, Not Correctness Alone [1.3124513975412253]
私たちは、現在の評価指標が重大な障害モードを見落としていると論じています。
VCEは、出力自体のいかなる特性よりも、予算内での正確な識別の失敗によって、運用的に定義される。
論文 参考訳(メタデータ) (2026-08-09T13:44:26Z) - TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents [54.08846865906602]
ツール強化マルチモーダルサーチエージェントにおいて,クレジットミス割り当てをGRPOの系統的障害モードとして特徴付ける。
本稿では,情報取得ツールのパラメータ決定性を利用したツール・アウェア・ポリシー・オプティマイズ(TAPO)を提案する。
論文 参考訳(メタデータ) (2026-06-04T07:15:43Z) - FIKA-Bench: From Fine-grained Recognition to Fine-Grained Knowledge Acquisition [54.31138496553705]
日常生活におけるきめ細かい認識は、しばしばクローズドブックの分類問題ではない。
既存のベンチマークは主に視覚的認識を評価しており、このアクティブな外部知識獲得能力は過小評価されている。
そこでは,システムが外部の証拠を探し,検証し,利用し,オープンエンドのきめ細かい認識質問に答えなければならない,きめ細かな知識獲得について検討する。
論文 参考訳(メタデータ) (2026-05-13T08:49:51Z) - Seeing the Unseen: Towards Zero-Shot Inspection for Wind Turbine Blades using Knowledge-Augmented Vision Language Models [10.230967860299504]
本稿では,ゼロショット指向の検査フレームワークを提案し,視覚言語モデルとRetrieval-Augmented Generationを統合した。
技術ドキュメント、代表参照画像、ドメイン固有のガイドラインを含むマルチモーダル知識ベースを構築する。
各種損傷カテゴリをカバーする30のラベル付きブレード画像上での枠組みの評価を行った。
論文 参考訳(メタデータ) (2025-10-26T23:19:28Z) - FactLens: Benchmarking Fine-Grained Fact Verification [6.814173254027381]
我々は、複雑なクレームを個別の検証のためにより小さなサブステートに分割する、きめ細かい検証へのシフトを提唱する。
我々は,ファクトレンス(FactLens)という,ファクトレンス(FactLens)という,詳細な事実検証のベンチマークを紹介した。
この結果から,FactLens自動評価器と人的判断との整合性を示し,評価性能に対する準定値特性の影響について考察した。
論文 参考訳(メタデータ) (2024-11-08T21:26:57Z) - From Chaos to Clarity: Claim Normalization to Empower Fact-Checking [57.024192702939736]
Claim Normalization(別名 ClaimNorm)は、複雑でノイズの多いソーシャルメディア投稿を、より単純で分かりやすい形式に分解することを目的としている。
本稿では,チェーン・オブ・ソートとクレーム・チェック・バシネス推定を利用した先駆的アプローチであるCACNを提案する。
実験により, CACNは様々な評価尺度において, いくつかの基準値を上回る性能を示した。
論文 参考訳(メタデータ) (2023-10-22T16:07:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。