論文の概要: When Auditors Fabricate: Batch-Size Degradation and Confident Hallucination in LLM Detection of Planted Document Contamination
- arxiv url: http://arxiv.org/abs/2609.09696v2
- Date: Fri, 11 Sep 2026 08:35:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-15 10:54:53.410857
- Title: When Auditors Fabricate: Batch-Size Degradation and Confident Hallucination in LLM Detection of Planted Document Contamination
- Title(参考訳): LLMによる植物文書汚染検出におけるバッチサイズ劣化と信頼幻覚
- Authors: Karan Parekh, Sanjana Pendyala Ravinder, Sana Mhapsekar, Medina Maloku,
- Abstract要約: 我々はサプライチェーン管理と医学研究を対象とする150の学術論文の汚染されたコーパスを構築した。
タイポグラフィー的腐敗,意味的逆転,不条理的外挿入の3種類の既知の汚染物質450点を注入した。
我々は、Google Gemini 3.0 Proが60文書にわたる180個の汚染された応答キーサブセットを復元する能力を評価した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models are increasingly proposed as automated auditors of document quality, yet their reliability as detectors of planted errors is poorly characterised. We construct a contaminated corpus of 150 academic papers spanning supply chain management and medical research, injecting 450 known contaminants of three types: typographical corruption, semantic reversal, and absurd out-of-context insertion. We then evaluate Google Gemini 3.0 Pro's ability to recover a 180-contaminant answer-key subset across 60 documents under three prompting regimes of increasing scale: single document, small batch, and large batch. Detection is unreliable even at small scale and collapses entirely at large scale: 50% recovery on single documents and 60% on small batches, a difference this sample cannot resolve, against 2.8% on large batches. The failure mode at scale is not abstention but fabrication. Rather than reporting incomplete processing, the model produced confident findings including invented contaminants of its own, absurdities such as "telepathic squirrel" and "quantum-powered toaster" that mimic the style of the planted material but do not appear in any document. Detection also varies by contamination type: absurd insertions were recovered at 75% in completed evaluations, while semantic reversals and typographical corruptions were each recovered at only 50%. The corruptions most likely to occur in the wild, plausible ones, are the ones most often missed. We conclude that LLM document auditing degrades not gracefully but deceptively, and outline the harness such systems require: bounded batch sizes, direct content injection, and mechanical verification of every reported finding against source text.
- Abstract(参考訳): 大規模言語モデルは、文書品質の自動監査者としてますます提案されているが、その信頼性は、植込み誤差の検出方法として不十分である。
我々は,サプライチェーン管理と医学研究を対象とする150の学術論文からなる汚染されたコーパスを構築し,450の既知の汚染物質をタイポグラフィー的腐敗,セマンティック・リバーサル,不条理なアウト・オブ・コンテクスト挿入の3種類に注入した。
次に、単一のドキュメント、小さなバッチ、大規模なバッチという3つの急激な状況下で、60ドキュメントにわたる180個の汚染された応答キーサブセットをリカバリするGoogle Gemini 3.0 Proの能力を評価します。
検出は小規模でも信頼性が低く、完全に大規模に崩壊する:単一の文書で50%の回復、小さなバッチで60%、このサンプルでは解決できない大きなバッチで2.8%の差がある。
スケールでの障害モードは、禁断ではなく、製造である。
不完全な処理を報告するのではなく、このモデルは、発明された独自の汚染物質を含む確実な発見を生み出した。
検出は汚染の種類によっても異なり, 異常な挿入が75%で回収され, セマンティックリバーサルとタイポグラフィーの破損は50%で回収された。
荒れ果てた、もっともらしい汚職は、しばしば見逃されるものである。
結論として,LCM文書監査は優雅に低下するだけでなく,バッチサイズ境界,直接コンテンツ注入,およびソーステキストに対するすべての報告された発見の機械的検証など,その利用方法の概要を述べる。
関連論文リスト
- Watermarks Without Verification: AI Text Watermarking After the EU AI Act [49.51124343181601]
EU AI法第50条では、生成可能なAIプロバイダに対して、システムが生成したコンテンツをマークし、AI生成として検出することを要求している。
Anthropicは、その日後にリリースされたすべてのClaudeモデルが、すべての生成されたテキストにSynthID-Textに基づく透かしを埋め込んでいることを公表した。
我々は、現在、異議や保証は確認できないし、この不信は、それ自体を透かしではなく、実質的なガバナンスの失敗であると論じている。
論文 参考訳(メタデータ) (2026-09-09T01:56:17Z) - In RAG We Trust? Measuring Robustness of Retrieval-Augmented Generation Under Document Poisoning [0.0]
我々は、小さな量子化モデルであるLlama 3.1 8B(Llama 3.1 8B)が、検索された文脈のごく一部が汚染されたときにどれだけ劣化するかを研究する。
清潔な文脈では77.9%から43.5%に減少し、3つの通路が全て崩壊する。
論文 参考訳(メタデータ) (2026-09-08T08:31:57Z) - VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement [57.86962208273888]
テキストのみのプランナが入力された物理義務にプロンプトをコンパイルする監査可能な物理検証システムを提案する。
それぞれのアクションは、ペイロードがタイプされた測定か、明示的にタグ付けされた学習状態である証明付きエビデンスレコードを返す。
我々は, 実発生障害を即時参照, 空間, 時間でローカライズする, 1500クリックの欠陥記録のコーパスにおいて, 評価をアンロックする。
論文 参考訳(メタデータ) (2026-09-02T20:36:45Z) - Who is the Agent to Blame? Localizing Faithfulness and Citation Mistakes in Agentic Deep Research [75.8770212601511]
ディープリサーチ(DR)システムは、Webから情報を検索して合成する複数のエージェントを編成することで、長い形式の引用レポートを生成する。
循環はこれらの報告の忠実さを評価するための主要なメカニズムであるが、現在のDRシステムでは引用のリコールが不十分である。
そこで本稿では,エージェントが各エラーをローカルにテストすることで,各エラーをピンポイントで検出する手法を提案する。
論文 参考訳(メタデータ) (2026-08-25T09:34:18Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Deterministic Integrity Gates for LLM-Assisted Clinical Manuscript Preparation: An Auditable Biomedical Informatics Architecture [0.3823356975862005]
検証を伴うアーキテクチャペア生成を3つの原則に基づいて記述する。
この決定論的な分割は、整合性のある分類として組織化され、中核的な貢献である。
MedSci Skillsは、43のスキルのオープンソースツールキットで、21の決定論的階層を持ち、3つのパブリックデータセットパイプラインで評価されている。
論文 参考訳(メタデータ) (2026-06-08T13:51:04Z) - FIKA-Bench: From Fine-grained Recognition to Fine-Grained Knowledge Acquisition [54.31138496553705]
日常生活におけるきめ細かい認識は、しばしばクローズドブックの分類問題ではない。
既存のベンチマークは主に視覚的認識を評価しており、このアクティブな外部知識獲得能力は過小評価されている。
そこでは,システムが外部の証拠を探し,検証し,利用し,オープンエンドのきめ細かい認識質問に答えなければならない,きめ細かな知識獲得について検討する。
論文 参考訳(メタデータ) (2026-05-13T08:49:51Z) - The Semantic Illusion: Certified Limits of Embedding-Based Hallucination Detection in RAG Systems [0.0]
幻覚予測をRAG検出に適用し、スコアを有限サンプルカバレッジ保証付き決定セットに変換する。
分布尾レンズを用いてこの障害を分析し,NLIモデルが許容可能なAUC(0.81)を達成する一方で,「最も厳しい」幻覚は,忠実な応答と意味的に区別できないことを示した。
論文 参考訳(メタデータ) (2025-12-17T04:22:28Z) - Collapse of Dense Retrievers: Short, Early, and Literal Biases Outranking Factual Evidence [56.09494651178128]
検索モデルは、Retrieval-Augmented Generation (RAG)のような情報検索(IR)アプリケーションで一般的に使用される。
我々は、Dragon+やContrieverのようなリトリーバーに対する、短いドキュメントの好みなどのバイアスの影響を定量化する。
私たちは大きな脆弱性を発見し、リトリバーが短いドキュメント、早い位置、繰り返しのエンティティ、リテラルマッチを好んで、答えの存在を無視しながら表示します。
論文 参考訳(メタデータ) (2025-03-06T23:23:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。