論文の概要: Multi-Head Self Attention is a Parameter Identification Mechanism
- arxiv url: http://arxiv.org/abs/2609.01231v1
- Date: Tue, 01 Sep 2026 13:32:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.684855
- Title: Multi-Head Self Attention is a Parameter Identification Mechanism
- Title(参考訳): マルチヘッド自己注意はパラメータ同定メカニズムである
- Authors: W. Ross Morrow,
- Abstract要約: マルチヘッドスケールのドット製品に対する注目度をパラメータ識別戦略とみなすことができる。
偏差項によっては, ソフトマックスに基づく注意層に対して, シングルヘッドとマルチヘッドの両方で何の影響も与えないことが示されている。
トランスにおける特定のアーキテクチャ選択がパフォーマンスを向上した理由について議論する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We prove that a multi-head scaled dot product attention can be viewed as a parameter identification strategy. The ratio of unidentified parameters to the total number of parameters scales like the reciprocal of the number of heads ($1/2 \to 1/(2H)$), meaning models with more heads are structurally more identified. A subtle side effect of the mathematics observation that attention can never be fully identified. Similarly we also show that some bias terms can have no effect on softmax-based attention layers in both the single- and multiple-head settings, though this is mostly a curiosity that should have a marginal effect on model size and model training/prediction efficiency. We also touch on modern improvements to transformers including RoPE and GQA from this perspective, illustrating how those as well can improve the ratio of ``meaningful'' parameters to all parameters. Simple numerical examples demonstrate that training can indeed involve updates that overlap model-invariant subspaces that arise from a lack of identification. As part of our experiments we use a ``rebalancing'' approach that can ``fix'' updates that overlap unindentified subspaces but do not try to present evidence this should actually be adopted. Instead we simply view our numerical results as exploring and confirming the theoretical results. As a whole we discuss a purely mathematical/statistical explanation, identification, for why specific architectural choices in transformers may have improved performance.
- Abstract(参考訳): マルチヘッドスケールのドット製品に対する注目度をパラメータ識別戦略とみなすことができる。
パラメータの総数に対する未同定パラメータの比率は、頭部の数(1/2 \to 1/(2H)$)の逆数のようにスケールする。
数学の観察の微妙な副作用は、注意が完全に識別できないことである。
同様に、いくつかのバイアス項は、シングルヘッドとマルチヘッドの両方でソフトマックスベースのアテンション層に影響を与えないことも示していますが、これは主に好奇心であり、モデルサイズとモデルトレーニング/予測効率に限界があるはずです。
また、この観点からは、RoPEやGQAといったトランスフォーマーの近代的な改善にも触れており、それらがすべてのパラメータに対する ` ` meaningful'' パラメータの比率をいかに改善できるかを説明しています。
単純な数値的な例では、識別の欠如から生じるモデル不変部分空間の重なり合う更新にトレーニングが関係していることが示される。
我々の実験では ``rebalancing'' のアプローチを使って、未定義の部分空間に重複する ``fix'' の更新を可能にするが、実際に採用されるべき証拠を示そうとしない。
その代わり、計算結果を理論的結果の探索と確認とみなす。
全体として、トランスフォーマーにおける特定のアーキテクチャ選択がパフォーマンスを改善した理由について、純粋に数学的・統計的に説明し、識別する。
関連論文リスト
- Hyperparameter Transfer with Mixture-of-Expert Layers [51.03005470884366]
現代のニューラルネットワークをスケールアップするための重要なツールとして、Mixture-of-Experts(MoE)層が登場した。
モデル幅,深さ,専門家の数,(隠れた)サイズを拡大する際,MoE層を有するトランスフォーマーモデルのパラメータ化を提案する。
論文 参考訳(メタデータ) (2026-01-28T03:02:30Z) - Scaling Exponents Across Parameterizations and Optimizers [94.54718325264218]
本稿では,先行研究における重要な仮定を考察し,パラメータ化の新たな視点を提案する。
私たちの経験的調査には、3つの組み合わせでトレーニングされた数万のモデルが含まれています。
最高の学習率のスケーリング基準は、以前の作業の仮定から除外されることがよくあります。
論文 参考訳(メタデータ) (2024-07-08T12:32:51Z) - A U-turn on Double Descent: Rethinking Parameter Counting in Statistical
Learning [68.76846801719095]
二重降下がいつどこで起こるのかを正確に示し、その位置が本質的に閾値 p=n に結び付けられていないことを示す。
これは二重降下と統計的直観の間の緊張を解消する。
論文 参考訳(メタデータ) (2023-10-29T12:05:39Z) - Understanding Parameter Sharing in Transformers [53.75988363281843]
トランスフォーマーに関するこれまでの研究は、異なるレイヤでパラメータを共有することに集中しており、モデルの深さを増大させることで、限られたパラメータを持つモデルの性能を向上させることができる。
このアプローチの成功は, モデル複雑性の増加により, ごく一部に過ぎず, 収束性の向上に大きく寄与することを示す。
8つの機械翻訳タスクの実験結果から,パラメータ共有モデルのモデル複雑性を半分に抑えて,我々のモデルが競合性能を達成することが示された。
論文 参考訳(メタデータ) (2023-06-15T10:48:59Z) - Least Squares Regression Can Exhibit Under-Parameterized Double Descent [6.645111950779666]
本研究では,学習データ点数,パラメータ数,モデルの一般化能力の関係について検討する。
ピークの位置は、スペクトルとサンプル共分散の固有ベクトルの両方の技術的性質に依存すると仮定する。
論文 参考訳(メタデータ) (2023-05-24T03:52:48Z) - All Roads Lead to Rome? Exploring the Invariance of Transformers'
Representations [69.3461199976959]
本稿では, ビジェクション仮説を学習するために, 非可逆ニューラルネットワーク BERT-INN に基づくモデルを提案する。
BERT-INNの利点は理論上も広範な実験を通じても明らかである。
論文 参考訳(メタデータ) (2023-05-23T22:30:43Z) - Robust Counterfactual Explanations for Neural Networks With Probabilistic Guarantees [11.841312820944774]
我々は、微分可能なモデルに対する潜在的なモデル変更に対する反ファクトの堅牢性を定量化するために、 $textitStability$ と呼ぶ尺度を提案します。
私たちの主な貢献は、十分高い値のtextitStability$の反ファクトが、高い確率でポテンシャルモデルが変化した後も有効であることを示すことです。
論文 参考訳(メタデータ) (2023-05-19T20:48:05Z) - Achieving Occam's Razor: Deep Learning for Optimal Model Reduction [0.07499722271664146]
オッカムのカミソリは、良いモデルは、表現するシステムを記述するのに必要な最小限のパラメータ以外のパラメータを除外すべきである、という原則を指している。
これは、冗長性がデータからモデルパラメータの誤った推定を導き、したがって不正確なあるいは曖昧な結論をもたらすためである。
我々は,Occamのカミソリに対処するために,ディープラーニングがいかに強力に活用できるかを示す。
論文 参考訳(メタデータ) (2023-03-24T01:58:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。