論文の概要: Spectral Origins of the Self-Correction Blind Spot in Autoregressive Generation
- arxiv url: http://arxiv.org/abs/2607.09803v1
- Date: Thu, 09 Jul 2026 17:52:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.200135
- Title: Spectral Origins of the Self-Correction Blind Spot in Autoregressive Generation
- Title(参考訳): 自己回帰生成における自己補正点のスペクトル源
- Authors: Ingrid Petrova, Luan Vejsiu,
- Abstract要約: 大規模な自己回帰言語モデルは、自己訂正盲点を示す。
自己回帰生成における自己補正のスペクトル代数理論を実証する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large autoregressive language models exhibit a self-correction blind spot: they reliably fix identical errors when attributed to an external source yet fail to fix the same errors in their own outputs. Prior work has documented this phenomenon empirically, through controlled error injection, error-depth decompositions, RL-based verifier-corrector training, and intrinsic self-verification, but offers no formal model of why generating a token suppresses the ability to detect its error, no quantitative activation condition for correction markers, and no convergence guarantee for reinforcement-learning-based self-correction. We close these gaps with SPARC, a spectral-algebraic theory of self-correction in autoregressive generation. We define the error-propagation operator as the product of per-step attention Jacobians on the residual stream and prove that the blind spot arises if and only if the spectral radius of this operator is at least one. We derive a sharp activation threshold, given as a function of the spectral radius, that a correction marker must exceed, recovering the 89.3\% blind-spot reduction observed with a simple ``Wait'' marker. We further prove that RL-based verifier-corrector training converges at a rate proportional to the squared coupling strength over the square root of the number of samples if and only if the verifier-corrector coupling matrix has spectral norm below one, and that this criterion is invariant across residual-stream autoregressive modalities, unifying text LLMs and autoregressive image and video generation. Experiments across four backbones and a visual autoregressive probe validate every theorem, with spectral predictions matching measured blind-spot rates within 3.2\% RMSE.
- Abstract(参考訳): 大きな自己回帰型言語モデルは自己訂正盲点を示しており、外部ソースに起因して同じエラーを確実に修正するが、自身の出力で同じエラーを修正できない。
従来の研究では、制御されたエラー注入、エラー深度分解、RLベースの検証器・コレクター訓練、本質的な自己検証を通じて、この現象を実証的に記録してきたが、トークンの生成がエラーを検出する能力を抑制する理由、補正マーカーの定量的アクティベーション条件、強化学習に基づく自己補正の収束保証は提供されていない。
自己回帰生成における自己補正のスペクトル代数理論であるSPARCでこれらのギャップを閉じる。
我々は、誤差プロパゲーション作用素を、残差ストリーム上のステップ毎の注意ジャコビアンの積として定義し、この作用素のスペクトル半径が少なくとも1である場合に限って、盲点が生じることを証明する。
我々は、スペクトル半径の関数として与えられた鋭いアクティベーション閾値を導出し、補正マーカーを超過し、単純な 'Wait' マーカーで観測された89.3\%の盲点減少を回復する。
さらに、RLに基づく検証器相関学習がサンプルの平方根上の二乗結合強度に比例する速度で収束することが、検証器相関行列がスペクトルノルムを1以下に持つ場合に限り証明され、この基準が残留ストリーム自己回帰モーダル、統一テキストLLM、自己回帰画像およびビデオ生成に不変であることを示す。
4つのバックボーンにわたる実験と視覚的自己回帰プローブは全ての定理を検証し、スペクトル予測は3.2\% RMSEで測定された盲点率と一致する。
関連論文リスト
- Conformal calibration and look-elsewhere effect in anomaly detection for new-physics searches [0.0]
機械学習による異常検出は、新しい物理学の探索を再構築している。
本稿では,共形予測に基づく校正層を提案する。
論文 参考訳(メタデータ) (2026-06-11T18:00:02Z) - When Attribution Patching Lies: Diagnosis and a Second-Order Correction [9.338965648455238]
本研究は, 下流ネットワークの非直線性に起因する誤差が, パッチ成分の局所曲率よりも大きいことを示す。
この洞察は、(i)信頼できない見積もりを検出するための信頼性スコア、(ii)エラー境界がポテンシャル属性の誤特定を定量化すること、(iii)Hessian-vector-product correctが1つの後進パスで先行エラーを除去すること、の3つの実用的なツールをもたらす。
論文 参考訳(メタデータ) (2026-06-05T05:20:32Z) - Correcting Neural Operator Spectral Bias via Diffusion Posterior Sampling with Sparse Observations [0.0]
ニューラル作用素は、数値解法よりも桁違いに高速な近似PDE解を代理する。
磁場のスパースセンサー測定もしばしば利用可能であり、スペクトル歪みを伴わないポイントワイズ精度を提供する。
拡散後サンプリングフレームワークにおけるNO予測を補助観測として扱うことでこの問題に対処する。
論文 参考訳(メタデータ) (2026-06-02T17:26:15Z) - Discovery of Hidden Miscalibration Regimes [52.452902154360565]
モデルは何らかの入力を体系的に過信し、他人を過信することがある。
対応する誤校正分野を定義し,それを推定するための診断フレームワークを提案する。
提案手法は,入力空間のキャリブレーションを意識した表現を学習し,学習幾何学におけるカーネルの平滑化による符号付き局所的誤校正を推定する。
論文 参考訳(メタデータ) (2026-05-13T13:07:50Z) - FACTOR: Counterfactual Training-Free Test-Time Adaptation for Open-Vocabulary Object Detection [63.91351553178842]
FACTORはオープン語彙オブジェクト検出のためのトレーニング不要なテスト時間適応である。
属性依存性の予測を選択的に抑制するために、属性の感度、意味的関連性、予測のバリエーションを定量化する。
PASCAL-C, COCO-C, FoggyCityscapes の実験では、FACTOR が従来の TTA 法より一貫して優れていたことが示されている。
論文 参考訳(メタデータ) (2026-05-05T02:31:18Z) - Decoding the Critique Mechanism in Large Reasoning Models [50.821607345799386]
大規模推論モデル(LRM)は、バックトラックと自己検証メカニズムを示し、中間ステップを修正して正しい解に到達できるようにする。
中間推論ステップに算術ミスを挿入することにより,現在のLEMがエラーからどのように回復するかを検討する。
チェーン・オブ・シークレットを伝播する誤りにもかかわらず、モデルは依然として正しい最終解に達している。
論文 参考訳(メタデータ) (2026-03-17T10:03:30Z) - Information Fidelity in Tool-Using LLM Agents: A Martingale Analysis of the Model Context Protocol [69.11739400975445]
モデルコンテキストプロトコル(MCP)エージェントにおけるエラー蓄積を解析するための最初の理論的枠組みを紹介する。
累積歪みが線形成長と高確率偏差を$O(sqrtT)$で表すことを示す。
主な発見は、意味重み付けは歪みを80%減らし、周期的再接地は、エラー制御の約9ステップごとに十分である。
論文 参考訳(メタデータ) (2026-02-10T21:08:53Z) - Self-Correction Bench: Uncovering and Addressing the Self-Correction Blind Spot in Large Language Models [0.7910367295422812]
大規模言語モデル(LLM)は誤りを犯し、非生産的推論経路を探索することができる。
自己補正機能は、安全クリティカルなアプリケーションにLLMをデプロイするために不可欠である。
LLMは、外部ソースから同一のエラーを修正しながら、自身の出力でエラーを修正することはできない。
論文 参考訳(メタデータ) (2025-07-03T16:41:30Z) - Latent Veracity Inference for Identifying Errors in Stepwise Reasoning [78.29317733206643]
本稿では、精度割当てに対する離散探索アルゴリズムであるVeracity Search(VS)を紹介する。
その他の方法では、後続の精度値よりも後続の分布において難解な推論を行う。
VSを一般化し、新しいコンテキストで正確なゼロショットの精度推論を可能にする。
論文 参考訳(メタデータ) (2025-05-17T04:16:36Z) - Classifier Calibration with ROC-Regularized Isotonic Regression [0.0]
等方性回帰を用いてモノトン変換による校正集合上のクロスエントロピーを最小化する。
IRは適応的なバイナリ処理として機能し、キャリブレーション誤差をゼロにすることができるが、性能への影響は未解決である。
この一般単調な基準は、クロスエントロピー損失の低減と校正セットの過度な適合の回避のバランスを打つのに有効であることを示す。
論文 参考訳(メタデータ) (2023-11-21T08:45:09Z) - Self-Supervised Training with Autoencoders for Visual Anomaly Detection [61.62861063776813]
我々は, 正規サンプルの分布を低次元多様体で支持する異常検出において, 特定のユースケースに焦点を当てた。
我々は、訓練中に識別情報を活用する自己指導型学習体制に適応するが、通常の例のサブ多様体に焦点をあてる。
製造領域における視覚異常検出のための挑戦的なベンチマークであるMVTec ADデータセットで、最先端の新たな結果を達成する。
論文 参考訳(メタデータ) (2022-06-23T14:16:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。