論文の概要: Bayesian Repetition Penalty: A Principled Adjacent-Conditional Framework for Reversing Attention Collapse in Autoregressive Language Models
- arxiv url: http://arxiv.org/abs/2607.22694v1
- Date: Fri, 17 Jul 2026 17:01:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.03039
- Title: Bayesian Repetition Penalty: A Principled Adjacent-Conditional Framework for Reversing Attention Collapse in Autoregressive Language Models
- Title(参考訳): Bayesian Repetition Penalty: 自己回帰型言語モデルにおける注意崩壊を回避するための原則付き随伴型フレームワーク
- Abstract要約: 本稿では, 崩壊した生成パターンから生じる異常な信頼度を解析し, 補償する原理的枠組みを提案する。
結果として生じる自己正規化ペナルティ比$R=f(m,n,p)/f(np,n,p)$は、アドホックな標準化を必要としない。
- 参考スコア(独自算出の注目度): 9.240704665480939
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Attention collapse in autoregressive language models -- manifested as repetitive token loops where the model becomes trapped in self-reinforcing attractors -- is a persistent pathology that existing decoding-time heuristics fail to address at its root cause. We present a principled framework that penalises or compensates anomalous confidence arising from collapsed generation patterns, by comparing a token's observed frequency against its corpus prior through an adjacent-conditional probability construction. The resulting self-normalising penalty ratio $R=f(m,n,p)/f(np,n,p)$ requires no ad hoc standardisation and admits a closed-form logit offset with zero approximation error. The correction is isolated from the loss gradient and accumulated into a frozen output-layer bias via exponential moving average, enabling deployment as a repair mechanism for models that have already collapsed without requiring intrusive modifications to standard training pipelines. Experimental validation on a 1.5B-parameter model demonstrates that the frozen-bias mechanism can rescue a model already trapped in a collapsed attractor, reducing 2-gram repetition from 0.073 to near 0 while preserving generation quality.
- Abstract(参考訳): 自己回帰型言語モデルの注意崩壊 -- モデルが自己回帰型アトラクタに閉じ込められる繰り返しトークンループとして現れる -- は、既存の復号時ヒューリスティックが根本原因で対処できない、永続的な病理である。
本稿では, 隣接する条件付き確率構成により, トークンの観測周波数をコーパスと比較することにより, 故障発生パターンから生じる異常な信頼度を解析または補償する原理的枠組みを提案する。
結果として生じる自己正規化ペナルティ比$R=f(m,n,p)/f(np,n,p)$は、アドホックな標準化を必要としない。
補正は損失勾配から分離され、指数的な移動平均によって凍結した出力層バイアスに蓄積され、標準の訓練パイプラインに侵入的な修正を加えることなく、既に崩壊したモデルの修理機構として展開できる。
1.5Bパラメータモデルの実験的検証により、凍結バイアス機構は崩壊したアトラクションに閉じ込められたモデルを救うことができ、生成品質を維持しながら0.073から0付近まで2グラムの繰り返しを低減できることが示された。
関連論文リスト
- Hacking Generative Perplexity: Why Unconditional Text Evaluation Needs Distributional Metrics [49.443264461057645]
拡散および連続フローベースの言語モデルは、言語モデリングに対する非自己回帰的な主要な代替手段として現れている。
両方のパラダイムの進歩は、生成的複雑度(gen-PPL)によって圧倒的に追跡される。
我々は、この指標は正しくないと主張している。構築により、gen-PPLは、文法性やセマンティックコヒーレンスではなく、スコアARの下でのみ予測可能性を測定する。
論文 参考訳(メタデータ) (2026-06-07T02:35:56Z) - The Need for an External Observer Formalizing the Sufficiency Gap: A Mathematical Extension of Mixture Identifiability and Contextual Grounding in Sequence Models [0.0]
我々は、決定論的テキスト構造と、保存されていない潜在状態によって支配される1つのランダム構造を持つ2元混合登録プロセスを構築した。
結果として生じるエントロピー差は通常の最適化誤差ではない。
補正信号は、その忠実度が誤解を招く状態に割り当てられたテキストのみの後方重みを超えると、テキスト履歴によって引き起こされる後続のオッズを正確に反転させる。
論文 参考訳(メタデータ) (2026-05-26T08:53:11Z) - Gradients Must Earn Their Influence: Unifying SFT with Generalized Entropic Objectives [22.29000001610794]
Supervised Fine-Tuning (SFT) の標準的な負の対数構造は、均一なトークンレベルの重み付けを適用する。
この剛性は2重の障害モードを生成する: (i)低確率目標を過度に強調することは、ノイズの監督の勾配を増幅し、頑健な事前を妨害し、 (ii)一様重み付けは、モデルが既に自信を持っているときに弱いシャープニングを与える。
既存の方法は可塑性の解決に失敗し、不安定なジレンマがしばしば有害なジレンマとともに必要な学習信号を抑圧する。
パラメータ自由度を変調する動的エントロピーファインチューニング(DEFT)を導入する。
論文 参考訳(メタデータ) (2026-02-11T22:56:43Z) - Entropy-Reservoir Bregman Projection: An Information-Geometric Unification of Model Collapse [3.533187668612022]
本稿では,これらの現象を統一する情報幾何学的枠組みであるEntropyReser Bregman Projection- ERBPを提案する。
我々の理論は崩壊に必要な条件、(ii)非言語エントロピーフロアを保証する十分な条件、(iii)サンプルサイズに依存する閉形式率をもたらす。
論文 参考訳(メタデータ) (2025-12-16T19:50:03Z) - Closed-Loop Transformers: Autoregressive Modeling as Iterative Latent Equilibrium [0.6820746164515952]
閉ループ予測の原理を導入し、自己整合平衡に達するまで、モデルが反復的に潜在表現を洗練することを要求する。
この原理をEquilibrium Transformerとしてインスタンス化し,標準トランス層をEquilibrium Refinement Moduleで拡張する。
バイナリパリティタスクに関する予備実験では、チャレンジシーケンスの平均改善率は+3.28%で、標準トランスフォーマーがランダムなパフォーマンスに近づくと+8.07%に達する。
論文 参考訳(メタデータ) (2025-11-26T20:02:59Z) - One-for-More: Continual Diffusion Model for Anomaly Detection [63.50488826645681]
異常検出法は拡散モデルを用いて任意の異常画像が与えられたときの正常サンプルの生成または再構成を行う。
われわれは,拡散モデルが「重度忠実幻覚」と「破滅的な忘れ」に悩まされていることを発見した。
本研究では,安定な連続学習を実現するために勾配予測を用いた連続拡散モデルを提案する。
論文 参考訳(メタデータ) (2025-02-27T07:47:27Z) - A Pseudo-Semantic Loss for Autoregressive Models with Logical
Constraints [87.08677547257733]
ニューロシンボリックAIは、純粋にシンボリックな学習とニューラルな学習のギャップを埋める。
本稿では,ニューラルネットワークの出力分布に対するシンボリック制約の可能性を最大化する方法を示す。
また,スドクと最短経路予測の手法を自己回帰世代として評価した。
論文 参考訳(メタデータ) (2023-12-06T20:58:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。