論文の概要: Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment
- arxiv url: http://arxiv.org/abs/2608.02786v1
- Date: Mon, 03 Aug 2026 18:33:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.917445
- Title: Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment
- Title(参考訳): 評価ブラインドネス - トレーニングからデプロイメントまでのAIシステムが崩壊する過程
- Authors: Priyanka Bajaj,
- Abstract要約: 障害は、トレーニングループ、評価パイプライン、運用監視スタックを通じて伝播し、下流の害が目に見えるようになるまで続く。
測定関数Mは、システムが実際に故障している間に、健康状態と区別できない読影を発生させる際に、障害クラスFに対する評価盲点を示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI systems can fail silently. The failure propagates through training loops, evaluation pipelines, and production monitoring stacks until downstream harm makes it visible. This paper introduces evaluation blindness: a measurement function M exhibits evaluation blindness with respect to failure class F when it produces readings indistinguishable from a healthy state while the system is actually failing, with no auxiliary signal flagging the gap. The problem surfaces at two lifecycle stages the literature has treated separately. At training time, reward models are gamed, importance-sampling corrections are silently miscalculated, and benchmark contamination inflates fine-tuning evaluations, all while loss curves look healthy and gradient updates proceed normally. At deployment time, monitoring fails to catch six classes of production failure, including an Operational category that is 100% silent by structural definition. We provide a formal detectability predicate unifying both stages. Four training-time case studies trace concrete breakdowns, including a real implementation bug in TRL PR #6594 where gradients are corrupted as loss decreases normally. A six-class taxonomy validated against 50 real-world incidents from court documents and regulatory filings finds that 53% of verifiable public failures were silent. A failure budget framework ties acceptable failure rates to use-case risk class. The implication is direct: measurement infrastructure is a correctness concern across the full AI lifecycle, not just at evaluation time. Data, code, and taxonomy schema are at https://github.com/priyanka25aug/llm-failure-taxonomy.
- Abstract(参考訳): AIシステムは静かに失敗する可能性がある。
障害は、トレーニングループ、評価パイプライン、運用監視スタックを通じて伝播し、下流の害が目に見えるようになるまで続く。
測定関数Mは、システムが実際に故障している間に、正常な状態と区別できない読影を発生させ、ギャップをフラグする補助信号が存在しない場合に、障害クラスFに対する評価盲度を示す。
文学が別々に扱った2つのライフサイクル段階の問題を表面化する。
トレーニング時に報酬モデルがゲームされ、重要度サンプリングの補正が静かに誤計算され、ベンチマーク汚染が微調整評価を膨らませ、損失曲線が正常に見え、勾配が正常に進行する。
デプロイメント時に、監視は、構造的定義によって100%沈黙している運用カテゴリを含む、運用上の失敗の6つのクラスをキャッチできない。
両段階を統一する形式的検出可能性述語を提供する。
TRL PR #6594の実際の実装バグを含む4つの訓練時間ケーススタディでは、損失が正常に減少するにつれて勾配が劣化する。
裁判所文書や規制書類から50件の現実世界の事件に対して6階級の分類が検証され、検証可能な公衆の失敗の53%が沈黙していたことが判明した。
失敗予算フレームワークは、許容できる失敗率とユースケースリスククラスを結びつける。
測定インフラストラクチャは、評価時間だけでなく、AIライフサイクル全体の正確性に関する懸念である。
データ、コード、分類スキーマはhttps://github.com/priyanka25aug/llm-failure-taxonomyにある。
関連論文リスト
- DiagLoop: A Counterfactual Data Flywheel with Stage-Localized Reinforcement for Diagnostic LLMs [5.241146164724621]
DiagLoopは、認知された物理的関係や臨床ガイドラインをトレーニングの監督に変換する、反ファクト的なデータフライホイールである。
訓練のみの教師は様々な原因、文脈、観察によって反現実の世界を提案し、一方独立したハイブリッドチェッカーは有効な世界しか認めない。
非終端障害に対しては、境界付き修復プローブが下流のコンピテンスを探索し、その結果の弱点プロファイルがその後のデータ生成を導く。
論文 参考訳(メタデータ) (2026-08-04T13:49:41Z) - Label-free Industrial Fault Detection via Adversarial Inverse Reinforcement Learning: A System for Run-to-Failure Prognostics [6.350348168407884]
機械故障検出は教師あり学習に大きく依存している。
現在の RL' の MFD 法は、この問題を静的文脈帯域 (CB) の定式化に還元する。
本稿では,MFDをオフラインIRL問題として扱う逆逆強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-25T02:02:22Z) - DriftScope: Measuring The Hidden Effects of Diffusion Model Adaptation [50.584834483403675]
新しい視覚概念を学習するか、望ましくないものを消去するか、事前学習したテキスト・画像拡散モデルに適応させることは、意図した効果だけで日常的に評価される。
適応が意味論的に無関係な概念を、構造的にメトリクスを集約することができない方法で体系的に損なうことを実証する。
DriftScopeは、任意の2つのモデルチェックポイントを取り込み、視覚的概念が最も移行したトークンのランクリストを返す、プロンプトレベルの診断ツールである。
論文 参考訳(メタデータ) (2026-06-30T20:57:51Z) - Auditing Demonstration Curation Metrics: Action-Only Scorers Fail on the Structural Defects That Degrade Imitation Policies [0.0]
模倣学習ポリシーは、訓練されたデモの品質を継承する。
キュレーションメトリクスの集合は、低品質のデモを自動的にスコアとフィルタリングすることを約束します。
デモの欠陥を既知の型で注入する制御されたテストベッドを構築します。
論文 参考訳(メタデータ) (2026-06-04T02:07:27Z) - Causal Label Recovery in Payment Networks [0.0]
支払いネットワークにおける不正検出モデルは、体系的にバイアスのあるチャージバックラベルでトレーニングする。
共用紙 [arXiv05:26.27557] は、これらの4つの障害が検出性能に最小限の上限を課すことを示した。
観測パイプラインを3段階, 破損層を有する逐次欠落データ問題として定式化し, 逐次トリプライロバスト推定器を構築した。
論文 参考訳(メタデータ) (2026-05-28T02:43:34Z) - Position: Early-Stage Quality Assurance in Annotation Pipelines Is More Cost-Effective Than Late-Stage Validation [17.77280120142941]
このポジションペーパーでは、マシンラーニングコミュニティは、後期検証の一般的な実践よりも、アノテーションパイプラインの早期品質保証を優先すべきである、と論じている。
本稿では,事前アノテーション(T0),後アノテーション(T1),後レビュー(T2)の3つのQAトリガポイントの分類法を提案する。
論文 参考訳(メタデータ) (2026-05-15T08:07:01Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - A Granular Study of Safety Pretraining under Model Abliteration [64.24346997570275]
本稿では,リフレクションに敏感な方向を除去する軽量プロジェクション技術であるモデルアブリーブレーションについて検討する。
我々は、バランスのとれた有害かつ無害なケースで100のプロンプトを発行し、複数の判断を用いて**Refusal*または***Non-Refusal*として応答を分類し、判断の忠実さを検証する。
本研究は,データ中心の安全コンポーネントが失語中も頑健であるチェックポイントレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-10-03T07:01:45Z) - Continual Learning for Fake Audio Detection [62.54860236190694]
本論文では,連続学習に基づく手法である忘れずに偽物を検出することで,モデルに新たなスプーフィング攻撃をインクリメンタルに学習させる手法を提案する。
ASVspoof 2019データセットで実験が行われる。
論文 参考訳(メタデータ) (2021-04-15T07:57:05Z) - Detecting Rewards Deterioration in Episodic Reinforcement Learning [63.49923393311052]
多くのRLアプリケーションでは、トレーニングが終了すると、エージェント性能の劣化をできるだけ早く検出することが不可欠である。
我々は,各エピソードにおける報酬が独立でもなく,同一に分散した,マルコフでもない,エピソード的枠組みを考察する。
平均シフトは、時間信号の劣化(報酬など)に対応する方法で定義し、最適な統計的パワーでこの問題の試行を導出する。
論文 参考訳(メタデータ) (2020-10-22T12:45:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。