論文の概要: Confidently Wrong, Silently So: Auditing Undetectable Failures of a Deployed On-Device Language Model
- arxiv url: http://arxiv.org/abs/2608.23663v2
- Date: Wed, 26 Aug 2026 17:45:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.066845
- Title: Confidently Wrong, Silently So: Auditing Undetectable Failures of a Deployed On-Device Language Model
- Title(参考訳): 信頼に反する、沈黙に反する: デプロイされたオンデバイス言語モデルの予期せぬ失敗を調査する
- Abstract要約: 本稿では、開発者が利用できるオンデバイス基盤モデルの再現可能な信頼性監査について述べる。
Emphtask-asymmetric miscalibration: そのガードレールはタスク間で反対方向に失敗する。
我々は,モデルに依存しない監査プロトコル,表面識別性テスト,およびデプロイされたモデルの監査のための再利用可能なインフラとして,コードと凍結した評価項目をリリースする。
- 参考スコア(独自算出の注目度): 0.038379177968040606
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Aligning deployed language models requires knowing when their outputs can be trusted, yet on-device models now ship to hundreds of millions of devices with no server-side moderation, and the configuration developers can actually deploy is rarely audited independently. We present a reproducible reliability audit of the developer-accessible on-device foundation model, framed as an oversight question: can a user or a resource-constrained developer tell when the model is wrong? Red-teaming it on calibration, confident confabulation on false-premise questions, and over-refusal of benign prompts, we find a \emph{task-asymmetric miscalibration}: its guardrails fail in opposite directions across tasks (confabulating on 69\% of false premises while refusing 18\% of entirely benign inputs), atop a self-reported confidence that is saturated and non-discriminative (AUROC 0.47; ECE 70, worst among comparable small models). Crucially, confident-correct and confident-wrong outputs are \emph{surface-indistinguishable}: a classifier over 15 user-visible features separates them at AUROC only 0.55 (equivalence-confirmed), leaving no signal for oversight at inference time. No cheap single-generation signal flags these failures ($\le$0.68 AUROC), whereas a black-box consistency wrapper requiring no model access recovers reliability (confident confabulation 75\%$\to$3\%; selective accuracy 43\%$\to$83\%) at a tunable cost. We contribute a model-agnostic audit protocol, a surface-indistinguishability test, and released code and frozen evaluation items as reusable infrastructure for auditing deployed models.
- Abstract(参考訳): デプロイされた言語モデルの調整には、出力がいつ信頼できるかを知る必要があるが、デバイス上のモデルは、サーバサイドのモデレーションなしで数億台のデバイスに出荷され、実際にデプロイできる構成は、独立して監査されることはめったにない。
我々は、開発者がアクセス可能なオンデバイス基盤モデルの再現可能な信頼性監査を、監視的な質問としてフレーム化します。
キャリブレーション、疑似前提問題に対する自信の折り合い、良心的なプロンプトの過度な拒絶、そして、そのガードレールがタスクをまたいで反対方向に失敗する(疑似前提の69 %、完全に良心的な入力の18 %をリフレッシュする)こと、飽和で差別的でない自己申告された信頼(AUROC 0.47; ECE 70)。
15個のユーザ可視性を持つ特徴の分類器は、AUROCでのみ0.55(等価性確認)を分離し、推論時に監視する信号は残らない。
一方、モデルアクセスを必要としないブラックボックス整合性ラッパーは信頼性を回復させる(信頼度75\%$\to$3\%、選択精度43\%$\to$83\%)。
我々は,モデルに依存しない監査プロトコル,表面識別性テスト,およびデプロイされたモデルを監査するための再利用可能なインフラとして,コードと凍結した評価項目をリリースする。
関連論文リスト
- Recognition Without Enforcement: Configuration-Dependent Failures in LLM Agent Instruction Arbitration and External Control [0.0]
LLMエージェントはシステムプロンプト、ユーザ、メモリ、ツールから命令を仲裁するが、この仲裁は信頼境界を強制するものではない。
ソースフォーマット機能はモデルアクティベーションから線形にデオード可能であり、モデルがトリガーされたときの偽の権威を明示的に識別することができる。
モデル自己配置をセキュリティ境界ではなく機能として扱い、認証されたソースルーティングと機能限定ツールの実行を組み合わせた外部参照モニタを実装します。
論文 参考訳(メタデータ) (2026-08-28T16:34:05Z) - Open-Weight Masked Introspection: Measuring What Language Models Can Report About Their Own Computation [8.970269049715933]
最近の研究は、複雑なモデルが自身の内部を監査し、何を変えたかを呼び出して、自信を持って報告できることを示している。
われわれはこの主張を7家族の8つのオープンウェイトモデルで検証し、そのような能力は見つからなかった。
テストのためにOpen-Weight Masked Introspection (OWMI)というフレームワークを開発しました。
論文 参考訳(メタデータ) (2026-08-20T21:09:50Z) - Cybersecurity Detection Classification with Reasoning-enabled Language Models [50.72675435043546]
セキュリティオペレーションセンター(SOC)の大きな問題は、警告疲労である。
以前の作業では、大きな言語モデル(LLM)がトリアージラベルを直接出力するように促すか、あるいは微調整するが、検出が真の脅威であるかどうかを判断するよう訓練することはない。
我々は、実際の人間ラベルのWindowsエンドポイント検出に対して、推論可能なトリアージ分類器(CoT)を訓練する。
論文 参考訳(メタデータ) (2026-07-30T16:22:13Z) - Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents [5.91817208489443]
検証・受け入れ・デプロイのギャップについて検討する。
このギャップは、エージェントの自己承認された検証信号と封印されたデプロイメント評価との相違を指す。
シーリング型外因性受容ループ(SEAL)について紹介する。
論文 参考訳(メタデータ) (2026-07-27T11:45:14Z) - Calibrated e-CUSUM Decoding for Quantized Reasoning Models: Why Token Log-Probability Is the Wrong Observable for Decoding Monitors [0.6999740786886536]
低ビット量子化により、小さな推論モデルは安価に展開できるが、思考の連鎖を分解することができる。
中心となるトークンのlog-probabilityは$log p(w_t)+H_t$が間違ったオブザーバブルであることを示します。
本稿では,トークンの不確実性と明示的な繰り返しを混在させるデジェネレーションを意識したアラームスコアを組み合わせた,トレーニング不要な復号制御手法を提案する。
論文 参考訳(メタデータ) (2026-07-13T09:34:36Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - What Single-Prompt Accuracy Misses: A Multi-Variant Reliability Audit of Language Models [0.0]
シングルプロンプト精度は、言語モデルをベンチマークする主要な方法であるが、重要な信頼性障害を見逃す可能性がある。
15モデルオープンウェイトコーパスの評価を行い,5つの分類と推論ベンチマークによる10のインストラクトモデルに着目した信頼性解析を行った。
まず、評価設計は結論を根本的に変えることができる。
第2に、信頼信号は脆弱である。MMLU-Proでは、各プライマリモデルは、その精度と同一行上のトークン確率信頼の両方よりもかなり高い信頼度を言語的に報告し、単一のプロンプト変種における単一のモデルに対して、動詞のパースレートが崩壊する可能性がある。
論文 参考訳(メタデータ) (2026-05-03T20:05:08Z) - CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution [52.691495954442985]
CoVerRLは1つのモデルがジェネレータと検証ロールを交換するフレームワークで、各機能が他方をブートストラップする。
Qwen と Llama のモデルファミリーでの実験では、CoVerRL は数理推論のベンチマークで4.7-5.9% でラベルなしのベースラインを上回っている。
自己検証の精度は55%から85%以上改善され、両方の能力が真に共存することを確認した。
論文 参考訳(メタデータ) (2026-03-18T14:38:55Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - Trusted Uncertainty in Large Language Models: A Unified Framework for Confidence Calibration and Risk-Controlled Refusal [31.458406135473805]
異種不確実性証拠を正当性の校正確率に変換する統一フレームワークUniCRを提案する。
UniCRは、温度スケーリングと適切なスコアリングを備えた軽量なキャリブレーションヘッドを学習する。
ショートフォームQA、実行テスト付きコード生成、検索強化ロングフォームQAの実験は、キャリブレーションメトリクスの一貫性のある改善を示している。
論文 参考訳(メタデータ) (2025-09-01T13:14:58Z) - Are You Getting What You Pay For? Auditing Model Substitution in LLM APIs [71.7892165868749]
LLM(Commercial Large Language Model) APIは基本的な信頼の問題を生み出します。
ユーザーは特定のモデルに課金するが、プロバイダが忠実に提供できることを保証することはない。
我々は,このモデル置換問題を定式化し,現実的な逆条件下での検出方法を評価する。
我々は,信頼された実行環境(TEE)を実用的で堅牢なソリューションとして使用し,評価する。
論文 参考訳(メタデータ) (2025-04-07T03:57:41Z) - Conservative Prediction via Data-Driven Confidence Minimization [70.93946578046003]
機械学習の安全性クリティカルな応用においては、モデルが保守的であることが望ましいことが多い。
本研究では,不確実性データセットに対する信頼性を最小化するデータ駆動信頼性最小化フレームワークを提案する。
論文 参考訳(メタデータ) (2023-06-08T07:05:36Z) - RobustBench: a standardized adversarial robustness benchmark [84.50044645539305]
ロバストネスのベンチマークにおける主な課題は、その評価がしばしばエラーを起こし、ロバストネス過大評価につながることである。
我々は,白箱攻撃と黒箱攻撃のアンサンブルであるAutoAttackを用いて,敵対的ロバスト性を評価する。
分散シフト,キャリブレーション,アウト・オブ・ディストリビューション検出,フェアネス,プライバシリーク,スムースネス,転送性に対するロバスト性の影響を解析した。
論文 参考訳(メタデータ) (2020-10-19T17:06:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。