論文の概要: Reliability Scales Inversely: Bigger Models Compound Mistakes Faster via a Hidden Auto-Regressive Risk Regime
- arxiv url: http://arxiv.org/abs/2607.18292v1
- Date: Tue, 30 Jun 2026 17:51:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.12051
- Title: Reliability Scales Inversely: Bigger Models Compound Mistakes Faster via a Hidden Auto-Regressive Risk Regime
- Title(参考訳): 信頼性尺度の逆:隠れた自己回帰的リスクレジームにより、より高速なモデル
- Authors: Kushal Chakrabarti,
- Abstract要約: 言語モデルがスケールするにつれて、回答はより真実になるが、より高速に分解される。
i) スケーリングにおいて,知識ギャップは$approx$6times$, 知識劣化は$11$-$39times$, (ii) 製造時に不確実性を感じた$H(p_M)$は急速に緩和され, オラクル関連リスクは最大17times$長く持続する; (iii) この体制は因果関係である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As language models scale, answers start truer but degrade faster: scaling buys capability but erodes reliability. The knowledge-gap account - more data, retrieval, or scale - misses an auto-regressive risk residual that scale sharpens: the model commits to a low-probability token, conditions on it as established, and snowballs. We track this through per-position disagreement $δ= \log p_M - \log p_O$ against a stronger same-family oracle, whose second moment splits exactly into bias$^2$ $\mathrm{KL}(p_M \,\|\, p_O)^2$ and risk $\mathrm{Var}[δ]$. We present four findings: (i) under scaling, the knowledge gap falls $\approx$$6\times$ while knowledge degradation grows $11$-$39\times$; (ii) at a fabrication, felt uncertainty $H(p_M)$ relaxes quickly while oracle-referenced risk persists up to $17\times$ longer, leaving a confident-but-precarious risk regime that bridges consecutive fabrications ($+69\%$ at $14$B); (iii) this regime is causal - an on-policy, fixed-$\mathrm{KL}$ variance contraction cuts web-verified hallucination by $35$-$74\%$ across three model families; and, (iv) it structurally evades self-monitoring, with $p_M$-only detectors (e.g. semantic entropy) firing $\approx$$30\%$ less ($p<10^{-16}$) on the risky branch holding nearly $4\times$ more fabrications. Bigger models snowball mistakes faster, through a failure mode that is dominant, self-perpetuating, causal and invisible to the model itself.
- Abstract(参考訳): 言語モデルがスケールするにつれて、回答はより真に始まり、より早く分解される。
ナレッジギャップアカウント - より多くのデータ、検索、スケール – は、スケールが鋭くなる自動回帰的リスク残差を見逃し、低確率トークン、確立された条件、雪玉にコミットする。
我々は、この2番目のモーメントが正確にバイアス$^2$ $\mathrm{KL}(p_M \,\|\, p_O)^2$とリスク$\mathrm{Var}[δ]$に分割されるような強い同族オラクルに対して、配置ごとの不一致を$δ= \log p_M - \log p_O$で追跡する。
4つの結果が得られます。
(i)スケーリングでは、知識ギャップは$\approx$6\times$となり、知識劣化は$11$-$39\times$になる。
(ii)製造において、不確実な$H(p_M)$は迅速に緩和され、オラクルが参照するリスクは17\times$長く持続し、連続する製造を橋渡しする自信はあるが先例のないリスクレジーム(+69\%$:14$B)を残したままである。
(iii)この体制は因果的であり、オンラインで固定された$\mathrm{KL}$分散収縮は、3つのモデルファミリにわたるWeb検証幻覚を$35$-$74\%で削減します。
(iv) 構造的に自己監視を回避し、$p_M$オンリー検出器(e g セマンティックエントロピー)が$\approx$$30\%$少額(p<10^{-16}$)を発射する。
大きなモデルは、失敗モードを通じて、より速く、より支配的で、自己持続的で、因果関係があり、モデル自体に見えない、雪玉のミスをモデル化する。
関連論文リスト
- Partially Correlated Verifier Cascades in LLM Harnesses: Concave Log-Odds, Polynomial Reliability, and Blind-Spot Ceilings [0.5076419064097734]
シリアル検証ゲートはLLMハーネスのコア信頼性プリミティブである。
候補の答えが返されるのは、$k$検証者が全てそれを受け入れた場合に限られる。
このノートはそのような理論を最小限にしている。
論文 参考訳(メタデータ) (2026-07-15T14:58:37Z) - The Ringelmann Effect in Multi-Agent LLM Systems: A Scaling Law for Effective Team Size [5.51170856062205]
我々は,高密度ピアの影響がサブリニアからハードサイリングへと解答レベル体制を崩壊させることを示した。
30の高密度な議論剤はMMLU-Hardのそれ以上の答えの多様性をもたらす。
自由形式数学において、高密度なピアの影響は、解準線形からハードシーリングへの解準位体制を崩壊させる。
論文 参考訳(メタデータ) (2026-05-31T16:19:54Z) - The Geometry of Forgetting: Temporal Knowledge Drift as an Independent Axis in LLM Representations [50.43168858368539]
大規模言語モデルは自信を持って時代遅れの回答を生成し、既存の方法では検出できない。
これは工学的な失敗ではなく構造的な失敗であり、時間的ドリフトは、幾何的に残留流の方向として、正確性と不確実性の両方に符号化される。
論文 参考訳(メタデータ) (2026-05-09T22:27:31Z) - INC: An Indirect Neural Corrector for Auto-Regressive Hybrid PDE Solvers [61.84396402100827]
本稿では,学習した補正を支配方程式に統合する間接ニューラルコレクタ(mathrmINC$)を提案する。
$mathrmINC$は、$t-1 + L$の順番でエラー増幅を減らし、$t$はタイムステップ、$L$はリプシッツ定数である。
大規模なベンチマークで$mathrmINC$をテストし、1Dカオスシステムから3D乱流まで、多くの異なる解法、神経バックボーン、テストケースをカバーした。
論文 参考訳(メタデータ) (2025-11-16T20:14:28Z) - Computational-Statistical Tradeoffs at the Next-Token Prediction Barrier: Autoregressive and Imitation Learning under Misspecification [50.717692060500696]
対数損失を伴う次のトーケン予測は自己回帰シーケンスモデリングの基盤となる。
次トーケン予測は、適度な誤差増幅を表す$C=tilde O(H)$を達成するために堅牢にすることができる。
C=e(log H)1-Omega(1)$。
論文 参考訳(メタデータ) (2025-02-18T02:52:00Z) - Improved Bound for Robust Causal Bandits with Linear Models [16.60875994745622]
本稿では,時間的モデル変動に直面した因果包帯のロバスト性について検討する。
提案アルゴリズムは,$C$が$o(sqrtT)$の場合に,ほぼ最適な$tildemathcalO(sqrtT)$後悔を達成する。
論文 参考訳(メタデータ) (2024-05-13T14:41:28Z) - Robust Causal Bandits for Linear Models [20.028245872662843]
因果系における報酬関数を最適化するための実験の逐次設計は、因果包帯における介入の逐次設計(CB)により効果的にモデル化できる。
本稿では,このようなモデルゆらぎに対するCBの頑健性について述べる。
累積後悔は設計基準として採用され、その目的は、因果モデル全体とその変動を意識したオラクルに対して最小の累積後悔を引き起こす一連の介入を設計することである。
論文 参考訳(メタデータ) (2023-10-30T17:58:01Z) - Adversarial robustness against multiple $l_p$-threat models at the price
of one and how to quickly fine-tune robust models to another threat model [79.05253587566197]
対向的堅牢性を実現するために, 対向的トレーニング (AT) を単一$l_p$-threatモデルで行うことが広く議論されている。
本稿では,$l_p$-threatモデルの結合に対する対角的ロバスト性を実現するための,シンプルで効率的なトレーニング手法を開発する。
論文 参考訳(メタデータ) (2021-05-26T12:20:47Z) - Risk-Sensitive Reinforcement Learning: Near-Optimal Risk-Sample Tradeoff
in Regret [115.85354306623368]
本研究では,未知の遷移カーネルを持つマルコフ決定過程におけるリスク感応性強化学習について検討する。
確率的に効率的なモデルレスアルゴリズムとして、リスク感性価値反復(RSVI)とリスク感性Q-ラーニング(RSQ)を提案する。
RSVIが $tildeObig(lambda(|beta| H2) cdot sqrtH3 S2AT big) に達したことを証明しています。
論文 参考訳(メタデータ) (2020-06-22T19:28:26Z) - A Brief Prehistory of Double Descent [75.37825440319975]
Belkin et al. は、現代の複雑度学習者の文脈におけるリスク曲線の形状を説明し、議論する。
N$が増加すると、リスクは最初減少し、最小値に達した後、N$が$n$に等しいまで増加し、トレーニングデータが完全に適合する。
論文 参考訳(メタデータ) (2020-04-07T09:41:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。