論文の概要: Auditing the Audit: Five Failure Modes in Benchmark-Validity Audits
- arxiv url: http://arxiv.org/abs/2607.02586v1
- Date: Wed, 01 Jul 2026 05:30:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.339648
- Title: Auditing the Audit: Five Failure Modes in Benchmark-Validity Audits
- Title(参考訳): 監査:ベンチマーク検証監査における5つの障害モード
- Abstract要約: パイプライン障害を5つのクラスに分類し、安全ベンチマークとオープンウェイトなインストラクションチューニングモデルによる自己監査を行った。
我々は、ゲートを保証グレードの証拠の保持および開示のプロトコルとして位置づけ、古典的な構成正当性証拠を補足する(置き換えるものではない)。
- 参考スコア(独自算出の注目度): 0.30586855806896046
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Governance frameworks ask AI providers and auditors for documented evaluation evidence, and perturbation-based construct-validity audits are a common form of that evidence. We argue the audits are themselves fragile: their conclusions can be silently manufactured by implementation details that readers cannot see in the reported numbers. We name five classes of pipeline failure and demonstrate each in a self-audit over safety benchmarks and open-weight instruction-tuned models. Under a unified six-point due-diligence gate, every cell lands in a non-confirmatory bucket, and no cell reaches confirmatory. The evidence here is a single two-model, five-benchmark case study, and F1--F5 is an illustrative, deliberately non-exhaustive starting taxonomy -- not a comprehensive partition of audit failures. We position the gate as a withholding and disclosure protocol for assurance-grade evidence, supplementary to (not a replacement for) classical construct-validity evidence, and not as a route to benchmark-validity verdicts.
- Abstract(参考訳): ガバナンスフレームワークは、AIプロバイダや監査官に文書化された評価証拠を求め、摂動に基づく構成妥当性監査は、その証拠の一般的な形式である。
その結論は、読者が報告された数字で見ることができない実装の詳細によって黙秘的に作成することができる。
パイプライン障害を5つのクラスに分類し、安全ベンチマークとオープンウェイトなインストラクションチューニングモデルによる自己監査を行った。
統一された6点デュディリジェンスゲートの下では、すべてのセルが非確認バケットに着陸し、セルが確認されることはない。
F1-F5は、監査失敗の包括的分割ではなく、実証的で故意に抜本的な開始分類である。
我々は、ゲートを保証グレードの証拠の保持および開示プロトコル、古典的な構成正当性証拠の補足(代替ではない)、ベンチマーク正当性判定へのルートとして位置づけている。
関連論文リスト
- Faults in Our Formal Benchmarking: Dataset Defects and Evaluation Failures in Lean Theorem Proving [13.87786274932945]
リーンで証明されたLCM支援定理のベンチマークは、すべての解決されたインスタンスがマシンチェックされた証明を持ってくるため、本質的に信頼できるものとして扱われることが多い。
コーパススケールの静的チェッカーを用いて4,833個の結果を得た。
本稿では,フォールト分類法,自動チェッカーとリコール指向のセマンティック監査プロンプト,および公式な数学データセットの作成を導くための標準リリースを提案する。
論文 参考訳(メタデータ) (2026-06-28T16:46:36Z) - Failure Modes of Large Language Models on Research-Level Mathematics: A Taxonomy and an Empirical Characterisation [0.8594140167290097]
第一証明」ベンチマークでは、研究レベルの数学に関する10の質問が、最も広く公開されている LLM に提示された。
引用作成(F1)、前提密輸(F2)、サイレント問題修正(F3)、ローカル・グローバル互換性ギャップ(F4)の4つの障害モードを特定します。
次に、ベンチマークの質問1、2、5でGemini 2.5 Flashが生成した8つのワンショットの証明を監査します。
論文 参考訳(メタデータ) (2026-06-12T14:58:20Z) - Evidence Absence Is Not Evidence Insufficiency: Diagnosing NEI Construction Artifacts in Fact Verification [6.604874054866016]
不十分な証拠評価のための構築対応診断プロトコルNEI-CAPについて紹介する。
我々は、FEVERとHoVerを境界外部制御として、SciFactスタイルの科学的検証でプロトコルをインスタンス化する。
論文 参考訳(メタデータ) (2026-05-26T07:51:33Z) - Case-Grounded Evidence Verification: A Framework for Constructing Evidence-Sensitive Supervision [1.7044563989708406]
ケースグラウンドによる証拠検証を導入する。
得られたサポートタスクに対して標準検証器をトレーニングする。
結果は、根拠となる証拠の大きなボトルネックは、モデル能力だけでなく、監督の欠如にあることを示唆している。
論文 参考訳(メタデータ) (2026-04-10T17:55:38Z) - DeepFact: Co-Evolving Benchmarks and Agents for Deep Research Factuality [49.62610727661819]
既存のファクトチェッカーは主に汎用ドメイン、ファクトイドスタイルの原子クレーム用に設計されている。
本稿では,ベンチマークラベルと有理値が明示的に変更可能なAudit-then-Score (AtS)を提案する。
我々は、AtSを、監査可能な有理量を持つDRR事実性ベンチマークであるDeepFact-Benchとしてインスタンス化する。
論文 参考訳(メタデータ) (2026-03-06T05:05:57Z) - CausalT5K: Diagnosing and Informing Refusal for Trustworthy Causal Reasoning of Skepticism, Sycophancy, Detection-Correction, and Rung Collapse [1.4608214000864057]
CausalT5Kは10ドメインにわたる5000以上のケースの診断ベンチマークである。
合成ベンチマークとは異なり、CausalT5Kはリアルな物語に因果トラップを埋め込んでいる。
予備的な実験では、静的監査ポリシーが普遍的に失敗する4段階のコントロールランドスケープが示される。
論文 参考訳(メタデータ) (2026-02-09T17:36:56Z) - OpenFactCheck: Building, Benchmarking Customized Fact-Checking Systems and Evaluating the Factuality of Claims and LLMs [59.836774258359945]
OpenFactCheckは、カスタマイズされたファクトチェックシステムを構築するためのフレームワークである。
ユーザーは自動的にファクトチェッカーをカスタマイズし、文書やクレームの事実的正当性を検証できる。
CheckerEVALは、人間の注釈付きデータセットを使用して、自動ファクトチェッカーの検証結果の信頼性を高めるソリューションである。
論文 参考訳(メタデータ) (2024-05-09T07:15:19Z) - The Decisive Power of Indecision: Low-Variance Risk-Limiting Audits and Election Contestation via Marginal Mark Recording [51.82772358241505]
リスクリミット監査(リスクリミット監査、RLA)は、大規模な選挙の結果を検証する技術である。
我々は、効率を改善し、統計力の進歩を提供する監査の新たなファミリーを定めている。
新しい監査は、複数の可能なマーク解釈を宣言できるように、キャストボイトレコードの標準概念を再考することで実現される。
論文 参考訳(メタデータ) (2024-02-09T16:23:54Z) - From Relevance to Utility: Evidence Retrieval with Feedback for Fact Verification [118.03466985807331]
我々は、FVの関連性よりも、クレーム検証者が取得した証拠から導出する実用性に焦点を当てる必要があると論じる。
本稿では,エビデンス検索プロセスの最適化に,クレーム検証器からのフィードバックを取り入れたフィードバックベースのエビデンス検索手法(FER)を提案する。
論文 参考訳(メタデータ) (2023-10-18T02:59:38Z) - QACHECK: A Demonstration System for Question-Guided Multi-Hop
Fact-Checking [68.06355980166053]
本稿では,質問誘導型マルチホップFact-Checking(QACHECK)システムを提案する。
クレームの検証に批判的な一連の質問をすることで、モデルの推論プロセスを導く。
各質問を支持する証拠の源となり、透明で説明可能な、ユーザフレンドリーな事実チェックプロセスが育まれます。
論文 参考訳(メタデータ) (2023-10-11T15:51:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。