論文の概要: When Attention Goes Blind: Numerical Failure in ALiBi Positional Encodings
- arxiv url: http://arxiv.org/abs/2608.03994v1
- Date: Tue, 04 Aug 2026 17:54:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 17:47:10.519836
- Title: When Attention Goes Blind: Numerical Failure in ALiBi Positional Encodings
- Title(参考訳): ALiBiの位置エンコーディングにおける数値的故障
- Authors: Christopher Schröder, Lukas Gienapp, Ferdinand Schlatt, Martin Potthast, Gerhard Heyer,
- Abstract要約: 線形バイアススケーリングアンダーフロー 浮動小数点精度は、影響のある注意ヘッドを部分的に失明させる。
ALiBiの障害モードは、標準的なデコーダベンチマークに小さな効果しか与えず、トークンの検索を実質的に損なう可能性がある。
我々は4つのトレーニング時間緩和戦略を提案し、それらを個別に組み合わせて評価し、ログスケール距離がパスキー検索において最も一貫した改善をもたらすことを発見した。
- 参考スコア(独自算出の注目度): 45.771951344635276
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We identify a previously overlooked failure mode of ALiBi positional encoding: its linear bias scaling underflows floating-point precision, which zeroes out a large fraction of attention weights and renders the affected attention heads partially blind. We analyze this failure mode, characterize its impact, and examine four mitigation strategies. We further demonstrate its occurrence in state-of-the-art pretrained models based on ALiBi. Comprehensive pretraining experiments with 148M-parameter decoder models help us to disentangle its effects from out-of-context degradation. We find that ALiBi's failure mode can substantially impair token retrieval while having only a minor effect on standard decoder benchmarks. We propose four training-time mitigation strategies and evaluate them individually and in combinations, finding that log-scaled distances yield the most consistent improvements in passkey retrieval. Despite this problem, default ALiBi slopes remain a surprisingly strong baseline, particularly for needle-in-a-haystack retrieval. Based on these findings we provide concrete recommendations on how to train models with ALiBi.
- Abstract(参考訳): 線形バイアススケーリングは浮動小数点の精度を低下させ、大量の注意重みをゼロにし、損傷した注意ヘッドを部分的に失明させる。
この障害モードを分析し,その影響を特徴付け,4つの緩和策を検討する。
さらに、ALiBiに基づく最先端の事前訓練モデルにおいて、その発生を実証する。
128Mパラメータデコーダモデルによる包括的事前学習実験は、その効果を文脈外劣化から切り離すのに役立つ。
ALiBiの障害モードは、標準デコーダベンチマークに小さな効果しか与えず、トークン検索を著しく損なう可能性がある。
我々は4つのトレーニング時間緩和戦略を提案し、それらを個別に組み合わせて評価し、ログスケール距離がパスキー検索において最も一貫した改善をもたらすことを発見した。
この問題にもかかわらず、デフォルトのALiBiスロープは驚くほど強力なベースラインであり、特にニードル・イン・ア・ヘイシュタック検索に向いている。
これらの知見に基づいて、ALiBiでモデルをトレーニングする方法に関する具体的な勧告を提供する。
関連論文リスト
- Logit-Attention Divergence: Mitigating Position Bias in Multi-Image Retrieval via Attention-Guided Calibration [36.91587844807066]
マルチモーダル言語モデル (MLLM) は, マルチモーダル・クロスモーダル検索において高い性能を示した。
しかし、予測は意味的関連性よりも入力順序に支配される厳しい位置バイアスに悩まされる。
そこで本研究では,本質的な注意信号を利用した学習自由な注意誘導型脱バイアスフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-12T06:17:01Z) - Typicalness-Aware Learning for Failure Detection [26.23185979968123]
ディープニューラルネットワーク(DNN)は、しばしば自信過剰な問題に悩まされる。
そこで本研究では,本問題に対処し,故障検出性能を向上させるために,S typicalness-Aware Learning (TAL) と呼ばれる新しい手法を提案する。
論文 参考訳(メタデータ) (2024-11-04T11:09:47Z) - Is Difficulty Calibration All We Need? Towards More Practical Membership Inference Attacks [16.064233621959538]
我々は,textbfRe-levertextbfA を直接 textbfRe-levertextbfA を用いて mtextbfItigate the error in textbfDifficulty calibration を提案する。
論文 参考訳(メタデータ) (2024-08-31T11:59:42Z) - SINDER: Repairing the Singular Defects of DINOv2 [61.98878352956125]
大規模なデータセットでトレーニングされたビジョントランスフォーマーモデルは、抽出したパッチトークンにアーティファクトを表示することが多い。
本稿では,小さなデータセットのみを用いて構造欠陥を補正するスムーズなスムーズな正規化を提案する。
論文 参考訳(メタデータ) (2024-07-23T20:34:23Z) - Preventing Collapse in Contrastive Learning with Orthonormal Prototypes (CLOP) [0.0]
CLOPは、クラス埋め込み間の線形部分空間の形成を促進することにより、神経崩壊を防止するために設計された、新しい半教師付き損失関数である。
CLOPは性能を向上し,学習速度やバッチサイズにまたがる安定性が向上することを示す。
論文 参考訳(メタデータ) (2024-03-27T15:48:16Z) - XAL: EXplainable Active Learning Makes Classifiers Better Low-resource Learners [71.8257151788923]
低リソーステキスト分類のための新しい説明可能なアクティブラーニングフレームワーク(XAL)を提案する。
XALは分類器に対して、推論を正当化し、合理的な説明ができないラベルのないデータを掘り下げることを推奨している。
6つのデータセットの実験では、XALは9つの強いベースラインに対して一貫した改善を達成している。
論文 参考訳(メタデータ) (2023-10-09T08:07:04Z) - Boosting Differentiable Causal Discovery via Adaptive Sample Reweighting [62.23057729112182]
異なるスコアに基づく因果探索法は観測データから有向非巡回グラフを学習する。
本稿では,Reweighted Score関数ReScoreの適応重みを動的に学習することにより因果発見性能を向上させるためのモデルに依存しないフレームワークを提案する。
論文 参考訳(メタデータ) (2023-03-06T14:49:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。