論文の概要: ERRORQUAKE: Heavy-Tailed Error Severity Distributions in Open-Weight Large Language Models
- arxiv url: http://arxiv.org/abs/2606.05170v1
- Date: Wed, 15 Apr 2026 09:22:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-15 07:09:36.619442
- Title: ERRORQUAKE: Heavy-Tailed Error Severity Distributions in Open-Weight Large Language Models
- Title(参考訳): ERRORQUAKE:オープンウェイト大言語モデルにおける重み付き誤り重大度分布
- Authors: Jason Z Wang,
- Abstract要約: 幻覚ベンチマークは、単一のエラーカウントを報告し、すべてのエラーを同等として扱うが、間違った日付と偽の裁判所判決は、桁違いに異なる。
Errorquake-10kは、8つのドメインと5つの難易度からなる連続的な0-4重度尺度で各応答をスコアするベンチマークである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: At matched accuracy, open-weight LLMs differ substantially in the shape of their error severity distribution -- a difference invisible to the scalar error rate. Hallucination benchmarks report a single error count and treat all errors as equivalent, yet a wrong date and a fabricated court ruling differ by orders of magnitude. We introduce Errorquake-10k, a 10,000-query benchmark scoring each response on a continuous 0-4 severity scale across 8 domains and 5 difficulty tiers, and we fit per-model severity distributions for 21 open-weight models. For each model we estimate a severity distribution index (b, the Gutenberg-Richter upper-tail slope) with 95% bootstrap confidence intervals. Headline: across the 210 model pairs, 85 have disjoint 95% b confidence intervals at matched accuracy (|Delta epsilon| < 0.05) on human-consensus scoring, e.g. deepseek-v3.2 vs. ministral-14b at epsilon = 0.586 and Delta b = 0.47. A 519-item three-rater human validation study confirms measurement reliability (ICC(2,k=3) = 0.85), validates the LLM-judge ranking (rho = 0.89), and confirms the dense-model scaling correlation on human data (rho_s = -0.86). We prove a Non-Reducibility Theorem showing that severity profile and error rate are informationally non-redundant (I(b; model | epsilon) = 1.56 bits; 64.5% of cross-model b variance is unexplained by epsilon). A severity mechanism taxonomy (kappa = 0.83) reveals that error type shifts categorically with severity: low-severity errors are retrievals (71%); high-severity errors are fabrications (39%) -- and this composition differs by model size (p < 0.0001). Severity distribution should be reported alongside accuracy; it carries discriminative information that the error rate cannot.
- Abstract(参考訳): 一致した精度で、オープンウェイトLLMは、その誤差重大度分布の形状で大きく異なる。
幻覚ベンチマークは、単一のエラーカウントを報告し、すべてのエラーを同等として扱うが、間違った日付と偽の裁判所判決は、桁違いに異なる。
Errorquake-10kは、8つのドメインと5つの難易度からなる連続的な0-4重度尺度で各応答をスコアし、21個のオープンウェイトモデルに対してモデルごとの重度分布に適合する。
各モデルについて、95%のブートストラップ信頼区間を有する重度分布指数(b,Gutenberg-Richter上尾斜面)を推定する。
見出し: 210モデルペアの85は、一致した精度(|Delta epsilon| < 0.05)で95% bの信頼区間を持ち、eg Deepseek-v3.2 vs. ministral-14b at epsilon = 0.586 and Delta b = 0.47である。
測定信頼性(ICC(2,k=3) = 0.85)を確認し、LLM-judgeランキング(rho = 0.89)を検証し、人間のデータ(rho_s = -0.86)の密度モデルスケーリング相関を検証した。
我々は、重大度プロファイルと誤り率が情報的に非冗長であることを示す非可逆性定理(I(b; model | epsilon) = 1.56ビット;64.5%のクロスモデルb分散はエプシロンでは説明できない)を証明した。
重度メカニズムの分類法 (kappa = 0.83) は、エラーのタイプシフトが重度に分類されることを示した: 低重度エラーは検索(71%)、高重度エラーは製造(39%)、この構成はモデルサイズ(p < 0.0001)によって異なる。
深刻度分布は正確さとともに報告されなければならない。
関連論文リスト
- Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - What Single-Prompt Accuracy Misses: A Multi-Variant Reliability Audit of Language Models [0.0]
シングルプロンプト精度は、言語モデルをベンチマークする主要な方法であるが、重要な信頼性障害を見逃す可能性がある。
15モデルオープンウェイトコーパスの評価を行い,5つの分類と推論ベンチマークによる10のインストラクトモデルに着目した信頼性解析を行った。
まず、評価設計は結論を根本的に変えることができる。
第2に、信頼信号は脆弱である。MMLU-Proでは、各プライマリモデルは、その精度と同一行上のトークン確率信頼の両方よりもかなり高い信頼度を言語的に報告し、単一のプロンプト変種における単一のモデルに対して、動詞のパースレートが崩壊する可能性がある。
論文 参考訳(メタデータ) (2026-05-03T20:05:08Z) - Verbal Confidence Saturation in 3-9B Open-Weight Instruction-Tuned LLMs: A Pre-Registered Psychometric Validity Screen [0.0]
実験では,7つの指導訓練付きオープンウェイトモデルを用いて,最小の妥当性基準を満たす言語的信頼度が得られるかどうかを検証した。
カテゴリー的誘因は有効性には至らなかった。
声道レベルの対数確率は,観察された分散状態下での言語的信頼度を有意に予測しなかった。
論文 参考訳(メタデータ) (2026-04-24T04:45:21Z) - The Rotation Gap Is Not An Error: Ternary Structure in IBM Quantum Hardware [0.0]
量子エラー補正は、すべてのシンドロームアクティベーションが修正を必要とするエラーを表すと仮定する。
756 QEC が IBM Eagle r3 プロセッサを3つに分けて実行していることから,この仮定が間違っているという証拠を提示する。
ハードウェアは、サブ・ポアソン症候群の統計を示し、一部の症候群はランダムノイズではなく、構造化された協調的な遷移であることを示している。
論文 参考訳(メタデータ) (2026-04-13T18:54:39Z) - Decomposing LLM Self-Correction: The Accuracy-Correction Paradox and Error Depth Hypothesis [6.901585308625979]
自己補正を3つのサブ機能に分解する。
本研究は,モデル能力と自己改善に関する線形仮定に挑戦する。
論文 参考訳(メタデータ) (2025-12-24T21:51:24Z) - CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction [11.731590131260424]
CorBenchXは胸部X線レポートにおける自動エラー検出と修正のためのスイートである。
まず,26,326個の胸部X線誤差の大規模データセットを合成した。
オープンソースとクローズドなビジョン言語モデルの両方をベンチマークします。
論文 参考訳(メタデータ) (2025-05-17T15:39:39Z) - Classification Error Bound for Low Bayes Error Conditions in Machine Learning [50.25063912757367]
機械学習における誤りミスマッチとKulback-Leibler分散の関係について検討する。
多くの機械学習タスクにおける低モデルに基づく分類誤差の最近の観測により、低ベイズ誤差条件に対する分類誤差の線形近似を提案する。
論文 参考訳(メタデータ) (2025-01-27T11:57:21Z) - Robust Fine-tuning of Zero-shot Models via Variance Reduction [56.360865951192324]
微調整ゼロショットモデルの場合、このデシドラトゥムは細調整モデルで、分布内(ID)と分布外(OOD)の両方で優れる。
トレードオフを伴わずに最適なIDとOODの精度を同時に達成できるサンプルワイズアンサンブル手法を提案する。
論文 参考訳(メタデータ) (2024-11-11T13:13:39Z) - Proximity-Informed Calibration for Deep Neural Networks [49.330703634912915]
ProCalは、近接性に基づいてサンプル信頼度を調整する理論的保証を持つプラグアンドプレイアルゴリズムである。
ProCalは、近接バイアスに対処し、バランスの取れた、長い、分布シフトの設定の校正を改善するのに有効であることを示す。
論文 参考訳(メタデータ) (2023-06-07T16:40:51Z) - TACRED Revisited: A Thorough Evaluation of the TACRED Relation
Extraction Task [80.38130122127882]
TACREDはリレーショナル抽出(RE)において最も大きく、最も広く使われているクラウドソースデータセットの1つである
パフォーマンスの天井に到達したのか、改善の余地はあるのか?
ラベルエラーは絶対F1テストエラーの8%を占めており、例の50%以上を可逆化する必要がある。
論文 参考訳(メタデータ) (2020-04-30T15:07:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。