論文の概要: Conditioned Initialization for Attention
- arxiv url: http://arxiv.org/abs/2609.07086v1
- Date: Mon, 07 Sep 2026 06:17:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.37007
- Title: Conditioned Initialization for Attention
- Title(参考訳): 注意条件付き初期化
- Abstract要約: トランスフォーマーは現代の機械学習において支配的なアーキテクチャであり、視覚、言語などを越えてアプリケーションを動かす。
彼らの成功の核心はアテンション層であり、クエリ、キー、バリューマトリックスがトークンの依存関係をキャプチャする方法を決定する。
かなり多くの作業がTransformerのスケーリングと最適化に重点を置いているが、クエリやキー、値の重み付けにはほとんど注意が払われていない。
- 参考スコア(独自算出の注目度): 32.435722001652174
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Transformers are a dominant architecture in modern machine learning, powering applications across vision, language, and beyond. At the core of their success lies the attention layer, where the query, key, and value matrices determine how token dependencies are captured. While considerable work has focused on scaling and optimizing Transformers, comparatively little attention has been paid to how the weights of the queries, keys and values are initialized. Common practice relies on random initialization or alternatives such as mimetic initialization, which imitates weight patterns from converged models, and weight selection, which transfers weights from a teacher model. In this paper, we argue that initialization can introduce an optimization bias that fundamentally shapes training dynamics. We propose conditioned initialization, a principled scheme that initializes attention weights to improve the spectral properties of the attention layer. Theoretically, we show that conditioned initialization can potentially reduce the condition number of the attention Jacobian, leading to more stable optimization. Empirically, it accelerates convergence and improves generalization across diverse applications, highlighting conditioning as a critical yet underexplored area for advancing Transformer performance. Importantly, conditioned initialization is simple to apply and integrates seamlessly into a wide range of Transformer architectures.
- Abstract(参考訳): トランスフォーマーは現代の機械学習において支配的なアーキテクチャであり、視覚、言語などを越えてアプリケーションを動かす。
彼らの成功の核心はアテンション層であり、クエリ、キー、バリューマトリックスがトークンの依存関係をキャプチャする方法を決定する。
かなり多くの作業がTransformerのスケーリングと最適化に重点を置いているが、クエリ、キー、値の重み付けがどのように初期化されているかについては、比較的注意が払われていない。
一般的なプラクティスは、収束したモデルから重みパターンを模倣する模倣的初期化や、教師モデルから重みを伝達する重み選択といったランダムな初期化や代替手段に依存する。
本稿では、初期化は、トレーニングダイナミクスを根本的に形作る最適化バイアスを導入することができると論じる。
本稿では,注目層のスペクトル特性を改善するために,注意重みを初期化する原理的手法である条件付き初期化を提案する。
理論的には、条件付き初期化は注意点ヤコビアンの条件数を減らす可能性を示し、より安定した最適化をもたらす。
経験的に、コンバージェンスを加速し、様々なアプリケーションにおける一般化を改善し、コンディショニングをトランスフォーマーのパフォーマンス向上のための重要かつ未探索の領域として強調する。
重要なことに、条件付き初期化は簡単に適用でき、広範囲のTransformerアーキテクチャにシームレスに統合できる。
関連論文リスト
- Small Initialization Matters for Large Language Models [28.726627416564842]
パラメータ初期化は訓練の遺伝子様決定因子であり、特にモデル能力の指標であることを示す。
スケールの縮小はプレトレーニングを継続的に改善し、推論要求タスクに最大の利益をもたらす。
小規模な初期化の利点を抑えるために広く使われている2つの経験的設定を同定し、その緩和が適切なスケーリングを回復することを示す。
論文 参考訳(メタデータ) (2026-06-16T13:53:48Z) - A Random-Matrix Criterion for Initializing Gated Recurrent Neural Networks [0.0]
貯水池計算」では、貯水池の重量は線形に学習され、貯水池の重量は固定され、結果として生じる力学の豊かさ、安定性、記憶を決定づける。
無限幅の極限において、有意義な初期化はランダム層モデルの有効臨界点に位置するものであることが示されている。
ここでは,広範囲の繰り返しアーキテクチャに対して臨界$g_c$を推定するための簡単な基準を導出し,ゲート-RNN貯水池がカオス予測タスクにおいてピーク性能を達成する際の利益を密に追跡することを示す。
論文 参考訳(メタデータ) (2026-05-11T14:35:22Z) - ConsNoTrainLoRA: Data-driven Weight Initialization of Low-rank Adapters using Constraints [64.35580479051208]
以前の作品では、ローランクアダプタ (LoRA) はすべてのアタッチメントポイントに対してランダムに固定されたランクである。
本稿では,データ駆動重み初期化法を用いて,LoRAファインチューニングの収束性と最終性能を改善する。
論文 参考訳(メタデータ) (2025-07-09T23:52:31Z) - The Primacy of Magnitude in Low-Rank Adaptation [15.583380841988868]
Low-Rank Adaptation (LoRA) は、大きなモデルをチューニングするためのパラメータ効率のパラダイムを提供する。
非効率なスペクトル法にマッチする等級駆動型Basis & BasisスキームであるLoRAMを提案する。
論文 参考訳(メタデータ) (2025-07-09T05:25:24Z) - Advancing Neural Network Performance through Emergence-Promoting Initialization Scheme [0.0]
機械学習の創発は、トレーニングデータのスケールと構造から生じる能力の自発的な出現を指す。
我々は、出現の可能性を高めることを目的とした、新しい単純なニューラルネットワーク初期化スキームを導入する。
バッチ正規化の有無にかかわらず,モデル精度とトレーニング速度の両面で大幅に向上したことを示す。
論文 参考訳(メタデータ) (2024-07-26T18:56:47Z) - Enhancing Robustness of Vision-Language Models through Orthogonality Learning and Self-Regularization [77.62516752323207]
そこで本研究では,事前訓練した重みを効率よく微調整する直交微調整法を導入し,頑健さと一般化の強化を実現した。
自己正規化戦略は、OrthSRと呼ばれるVLMのゼロショット一般化の観点から安定性を維持するためにさらに活用される。
筆者らはCLIPとCoOpを再検討し,少数の画像のクラスフィシエーションシナリオにおけるモデルの改善を効果的に行う。
論文 参考訳(メタデータ) (2024-07-11T10:35:53Z) - On the Convergence of Encoder-only Shallow Transformers [62.639819460956176]
エンコーダのみの浅部変圧器のグローバル収束理論を現実的な条件下で構築する。
我々の結果は、現代のトランスフォーマー、特にトレーニング力学の理解を深める道を開くことができる。
論文 参考訳(メタデータ) (2023-11-02T20:03:05Z) - Geometry-aware training of factorized layers in tensor Tucker format [6.701651480567394]
重みテンソルのタッカー分解の要因を学習するための新しい手法を提案する。
トレーニングの提案は, 元の非リファクタリング力学を局所的に近似する上で最適であることが証明された。
本稿では,アルゴリズムの理論解析を行い,収束,近似,局所降下保証を示す。
論文 参考訳(メタデータ) (2023-05-30T14:20:51Z) - Towards Theoretically Inspired Neural Initialization Optimization [66.04735385415427]
我々は,ニューラルネットワークの初期状態を評価するための理論的知見を備えた,GradCosineという微分可能な量を提案する。
標準制約下でGradCosineを最大化することにより、ネットワークのトレーニングとテストの両方の性能を向上させることができることを示す。
サンプル分析から実際のバッチ設定に一般化されたNIOは、無視可能なコストで、より優れた初期化を自動で探すことができる。
論文 参考訳(メタデータ) (2022-10-12T06:49:16Z) - Data-driven Weight Initialization with Sylvester Solvers [72.11163104763071]
本稿では,ディープニューラルネットワークのパラメータを初期化するためのデータ駆動方式を提案する。
提案手法は,特にショットや微調整の設定において有効であることを示す。
論文 参考訳(メタデータ) (2021-05-02T07:33:16Z) - GradInit: Learning to Initialize Neural Networks for Stable and
Efficient Training [59.160154997555956]
ニューラルネットワークを初期化するための自動化およびアーキテクチャ手法であるgradinitを提案する。
各ネットワーク層の分散は、SGDまたはAdamの単一ステップが最小の損失値をもたらすように調整される。
また、学習率のウォームアップを伴わずに、オリジナルのPost-LN Transformerを機械翻訳用にトレーニングすることもできる。
論文 参考訳(メタデータ) (2021-02-16T11:45:35Z) - Bayesian Attention Modules [65.52970388117923]
実装や最適化が容易な,スケーラブルな注目バージョンを提案する。
本実験は,提案手法が対応するベースラインに対して一貫した改善をもたらすことを示す。
論文 参考訳(メタデータ) (2020-10-20T20:30:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。