論文の概要: Attention Sinks Are Provably Necessary in Softmax Transformers: Evidence from Trigger-Conditional Tasks
- arxiv url: http://arxiv.org/abs/2603.11487v2
- Date: Sat, 14 Mar 2026 03:59:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-17 13:51:29.042498
- Title: Attention Sinks Are Provably Necessary in Softmax Transformers: Evidence from Trigger-Conditional Tasks
- Title(参考訳): ソフトマックス変圧器における注意シンクはおそらく必要である:トリガー・コンディショナル・タスクからの証拠
- Abstract要約: 単純なトリガー条件の計算は、必ずしもソフトマックス自己注意モデルにおけるシンクを誘導する。
確率的単純性に対する正規化は、デフォルトの状態を実現するために、安定なアンカーに注意を向ける必要がある。
また、非正規化ReLU注意がシンクなしで同じ課題を解決できることを証明し、正規化制約がシンク動作の基本的な要因であることを確認した。
- 参考スコア(独自算出の注目度): 1.6921396880325779
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Transformers often display an attention sink: probability mass concentrates on a fixed, content-agnostic position. Are sinks a byproduct of the optimization/training regime? Or are they sometimes functionally necessary in softmax Transformers? Are sinks a byproduct of the optimization/training regime? Or are they sometimes functionally necessary in softmax Transformers? We prove that, in some settings, it is the latter: computing a simple trigger-conditional behavior necessarily induces a sink in softmax self-attention models. Our results formalize a familiar intuition: normalization over a probability simplex must force attention to collapse onto a stable anchor to realize a default state (e.g., when the model needs to ignore the input). We instantiate this with a concrete task: when a designated trigger token appears, the model must return the average of all preceding token representations, and otherwise output zero, a task which mirrors the functionality of attention heads in the wild (Barbero et al., 2025; Guo et al., 2024). We also prove that non-normalized ReLU attention can solve the same task without any sink, confirming that the normalization constraint is the fundamental driver of sink behavior. Experiments validate our predictions and demonstrate they extend beyond the theoretically analyzed setting: softmax models develop strong sinks while ReLU attention eliminates them in both single-head and multi-head variants.
- Abstract(参考訳): トランスフォーマーはしばしば注意シンクを表示し、確率質量は固定された内容に依存しない位置に集中する。
シンクは最適化/トレーニング体制の副産物か?
あるいは、ソフトマックス変換器で機能的に必要か?
シンクは最適化/トレーニング体制の副産物か?
あるいは、ソフトマックス変換器で機能的に必要か?
単純なトリガー条件の振る舞いの計算は、ソフトマックス自己注意モデルにおけるシンクを必然的に引き起こす。
確率的単純性に対する正規化は、デフォルトの状態(例えば、モデルが入力を無視する必要がある場合)を実現するために、安定なアンカーに注意を向ける必要がある。
指定されたトリガートークンが現れると、モデルがすべての先行するトークン表現の平均を返さなければならず、そうでなければ、野生の注目ヘッドの機能を反映するタスクであるゼロを出力しなければならない(Barbero et al , 2025; Guo et al , 2024)。
また、非正規化ReLU注意がシンクなしで同じ課題を解決できることを証明し、正規化制約がシンク動作の基本的な要因であることを確認した。
ソフトマックスモデルは強いシンクを発達させ、ReLUはそれらを単頭と多頭の両方の変種で排除する。
関連論文リスト
- Training-Free Universal Approximation by Prompting Random Transformers [48.556633593447465]
ランダムで訓練されていない重みを持つソフトマックスアテンションネットワークは、適切なソフトプロンプトで操るとき、コンパクト多様体上の任意のハルダー関数を近似することができることを示す。
さらに、構築されたソフトプロンプトトークンのノルム、プロンプト長さ、隠された次元のトレードオフを明らかにすることで、プロンプトのコストを定量化する。
論文 参考訳(メタデータ) (2026-08-10T12:57:22Z) - A Unifying View of Attention Sinks: Two Algorithms, Two Solutions [11.81228217746692]
我々は、視覚的に類似したシンクパターンが2つの異なるメカニズムを反映できることを示した。
頭がヌルトークンにルーティングすることで更新を抑圧し、iiブロードキャストし、シンクが集約してグローバル情報を再配布する。
論文 参考訳(メタデータ) (2026-06-06T11:10:54Z) - The Expressive Power of Low Precision Softmax Transformers with (Summarized) Chain-of-Thought [1.9193579706947885]
変圧器の既存の表現結果は通常、ハードマックスの注意、高精度、その他のアーキテクチャの変更に依存し、実際に使用されるモデルからそれらを切り離す。
我々は,このギャップを,トランスフォーマーデコーダをソフトマックスアテンションで解析し,アクティベーションとアテンションウェイトを丸め,深さと幅をコンテキスト長と対数的に成長させることで橋渡しする。
中間段階として、3次アクティベーションを持つハードマックストランスフォーマーと、Chain-of-Thought (CoT) を用いたチューリングマシンをシミュレートした注意スコアを構築する。
論文 参考訳(メタデータ) (2026-05-18T08:57:53Z) - A Unified View of Attention and Residual Sinks: Outlier-Driven Rescaling is Essential for Transformer Training [86.64715217940274]
外接線は正規化と共に機能する。
アウトリーチは、コントリビュータではなく、再スケール要因として役立ちます。
外乱は学習可能なパラメータに吸収されるか、明示的なゲート再スケーリングによって緩和される。
論文 参考訳(メタデータ) (2026-01-30T13:29:45Z) - Attention Projection Mixing with Exogenous Anchors [0.0]
早期注意投影の層間再利用はデータの効率を向上させるが、構造的な衝突を引き起こす。
この衝突は、内部アンカー設計の隠れた制限であることを示す。
逐次レイヤスタックの外でアンカープロジェクションを学習することで競合を解決するExoFormerを提案する。
論文 参考訳(メタデータ) (2026-01-13T01:52:19Z) - Closed-Loop Transformers: Autoregressive Modeling as Iterative Latent Equilibrium [0.6820746164515952]
閉ループ予測の原理を導入し、自己整合平衡に達するまで、モデルが反復的に潜在表現を洗練することを要求する。
この原理をEquilibrium Transformerとしてインスタンス化し,標準トランス層をEquilibrium Refinement Moduleで拡張する。
バイナリパリティタスクに関する予備実験では、チャレンジシーケンスの平均改善率は+3.28%で、標準トランスフォーマーがランダムなパフォーマンスに近づくと+8.07%に達する。
論文 参考訳(メタデータ) (2025-11-26T20:02:59Z) - Transformers Learn Faster with Semantic Focus [57.97235825738412]
学習性と一般化の観点からスパース変圧器について検討する。
入力依存のスパースアテンションモデルは、標準アテンションモデルよりも早く収束し、より一般化しているように見える。
論文 参考訳(メタデータ) (2025-06-17T01:19:28Z) - Two failure modes of deep transformers and how to avoid them: a unified theory of signal propagation at initialisation [8.973965016201822]
ニューラルネットワークの適切な初期化を見つけることは、スムーズなトレーニングと優れたパフォーマンスを保証するために不可欠である。
トランスフォーマーでは、間違った初期化は、ランク崩壊、すべてのトークンが同様の表現に崩壊するランク崩壊、エントロピー崩壊、高度に集中した注意スコアが不安定になる2つの失敗モードの1つにつながる可能性がある。
ここでは、自己アテンション、層正規化、スキップ接続、勾配を有する深層変圧器による信号伝搬の解析理論を提案する。
論文 参考訳(メタデータ) (2025-05-30T08:18:23Z) - Accelerated zero-order SGD under high-order smoothness and overparameterized regime [79.85163929026146]
凸最適化問題を解くための新しい勾配のないアルゴリズムを提案する。
このような問題は医学、物理学、機械学習で発生する。
両種類の雑音下で提案アルゴリズムの収束保証を行う。
論文 参考訳(メタデータ) (2024-11-21T10:26:17Z) - Least Squares and Marginal Log-Likelihood Model Predictive Control using Normalizing Flows [0.0]
本研究は,動的学習のための離散時間モデルとして条件正規化フローを提案する。
原子炉実験において、正規化流MPCは開ループおよび閉ループの場合のセットポイント誤差を名目制御器の半分に低減する。
論文 参考訳(メタデータ) (2024-09-26T08:28:14Z) - When Does Confidence-Based Cascade Deferral Suffice? [69.28314307469381]
カスケードは、推論コストをサンプル毎に適応的に変化させる古典的な戦略である。
deferralルールは、シーケンス内の次の分類子を呼び出すか、または予測を終了するかを決定する。
カスケードの構造に執着しているにもかかわらず、信頼に基づく推論は実際は極めてうまく機能することが多い。
論文 参考訳(メタデータ) (2023-07-06T04:13:57Z) - Stabilizing Transformer Training by Preventing Attention Entropy
Collapse [56.45313891694746]
本研究は,トランスフォーマーのトレーニングダイナミクスについて,注目層の進化について検討する。
我々は、$sigma$Reparamが注意層におけるエントロピー崩壊を防ぎ、より安定したトレーニングを促進することを示す。
画像分類、画像自己教師型学習、機械翻訳、音声認識、言語モデリングタスクについて、$sigma$Reparamで実験を行った。
論文 参考訳(メタデータ) (2023-03-11T03:30:47Z) - Transformers meet Stochastic Block Models: Attention with Data-Adaptive
Sparsity and Cost [53.746169882193456]
最近の研究は、自己注意の二次的コストを克服するために、様々なスパークアテンションモジュールを提案している。
本稿では,それぞれの注意を混合メンバーシップブロックモデルで表現することで,両方の問題を解決するモデルを提案する。
我々のモデルは、以前の効率的な変種とオリジナルのトランスフォーマーより優れており、十分に注目されています。
論文 参考訳(メタデータ) (2022-10-27T15:30:52Z) - Softmax-free Linear Transformers [90.83157268265654]
視覚変換器(ViT)は、視覚知覚タスクの最先端を推し進めている。
既存の手法は理論的に欠陥があるか、視覚認識に経験的に効果がないかのいずれかである。
我々はSoftmax-Free Transformers (SOFT) のファミリーを提案する。
論文 参考訳(メタデータ) (2022-07-05T03:08:27Z) - Sparse Attention with Linear Units [60.399814410157425]
本稿では, ソフトマックスアクティベーションをReLUに置き換えることにより, 注目度を向上する新しい, 簡便な手法を提案する。
我々のモデルはRectified Linear Attention (ReLA)と呼ばれ、以前提案したスパースアテンション機構よりも実装が容易で効率的である。
分析の結果,RELAは高い空間性率と頭部の多様性を達成でき,ソース・ターゲット単語アライメントの精度が向上することがわかった。
論文 参考訳(メタデータ) (2021-04-14T17:52:38Z) - Normalized Attention Without Probability Cage [12.18340575383456]
確率単純度に注意重みを拘束する限界を示す。
自己注意におけるソフトマックスを正規化に置き換えることを提案する。
25,000以上のトレーニングモデルから得られた経験的な結果によって、私たちの洞察を支持します。
論文 参考訳(メタデータ) (2020-05-19T16:26:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。