論文の概要: Attention Kernels for Learning Maps Between Heavy-Tailed Measures
- arxiv url: http://arxiv.org/abs/2610.00564v1
- Date: Wed, 30 Sep 2026 18:38:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.709727
- Title: Attention Kernels for Learning Maps Between Heavy-Tailed Measures
- Title(参考訳): 重度尺度間の地図学習のための注意カーネル
- Abstract要約: 確率測度に関する演算子学習は変換器で実現できる。
尾を持つ測度の場合、ソフトマックスの指数重み付けは対応する測度レベルの注意積分を分岐させる。
ポストノーム変圧器におけるカーネルの注意成長とデータ変換について検討する。
- 参考スコア(独自算出の注目度): 5.2239158232523515
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Operator learning on probability measures can be accomplished with transformers. For measures with polynomial tails, the exponential weighting in softmax can make the corresponding measure-level attention integrals diverge. This motivates replacing the exponential with slower-growing functions. We construct two benchmarks for operator learning on measures with closed-form targets. We use these benchmarks to study attention kernel growth and data transformation in post-norm transformers. Without data transformation, the softmax models exhibit ensemble collapse on both heavy-tailed benchmarks, while the three slower-growing kernels avoid collapse. Symlog preprocessing allows softmax to avoid collapse on the matrix inverse task but not on the sheared swap task. On the Gaussian control, all four kernels perform similarly. We also examine how sample size affects the sensitivity of empirical energy and Wasserstein distances to tail differences. These results support slower-growing attention kernels as an effective design choice for post-norm transformers learning from heavy-tailed ensembles.
- Abstract(参考訳): 確率測度に関する演算子学習は変換器で実現できる。
多項式尾を持つ測度の場合、ソフトマックスの指数重み付けは対応する測度レベルの注意積分を分岐させる。
これは指数関数を遅くする関数に置き換える動機となる。
閉形式の目標を持つ測度に対する演算子学習のための2つのベンチマークを構築した。
我々はこれらのベンチマークを用いて、ポストノーム変圧器のカーネル成長とデータ変換について検討する。
データ変換なしでは、ソフトマックスモデルは両方のヘビーテールベンチマークでアンサンブル崩壊を示し、3つの遅く成長するカーネルは崩壊を避ける。
シンログ前処理により、ソフトマックスは行列逆タスクでは崩壊しないが、せん断スワップタスクでは崩壊しない。
ガウス制御では、全ての4つのカーネルも同様に機能する。
また,サンプルサイズが実験エネルギーとワッサーシュタイン距離の感度にどのように影響するかを検討した。
これらの結果は、重み付きアンサンブルから学習したポストノームトランスフォーマーの効果的な設計選択として、注目カーネルの速度が遅いことを支持する。
関連論文リスト
- The Expressive Power of Low Precision Softmax Transformers with (Summarized) Chain-of-Thought [1.9193579706947885]
変圧器の既存の表現結果は通常、ハードマックスの注意、高精度、その他のアーキテクチャの変更に依存し、実際に使用されるモデルからそれらを切り離す。
我々は,このギャップを,トランスフォーマーデコーダをソフトマックスアテンションで解析し,アクティベーションとアテンションウェイトを丸め,深さと幅をコンテキスト長と対数的に成長させることで橋渡しする。
中間段階として、3次アクティベーションを持つハードマックストランスフォーマーと、Chain-of-Thought (CoT) を用いたチューリングマシンをシミュレートした注意スコアを構築する。
論文 参考訳(メタデータ) (2026-05-18T08:57:53Z) - LaplacianFormer:Rethinking Linear Attention with Laplacian Kernel [27.87296519831803]
ソフトマックスアテンションの二次的複雑さは、トランスフォーマーを高解像度の視覚タスクにスケーリングする上で大きな障害となる。
ソフトマックスの代わりにラプラシアンカーネルを用いるトランスフォーマー変種であるラプラシアンフォーマーを提案する。
ImageNetの実験では、LaplacianFormerは高いパフォーマンスと効率のトレードオフを実現し、注意力を高めている。
論文 参考訳(メタデータ) (2026-04-22T09:04:54Z) - Process-Tensor Tomography of SGD: Measuring Non-Markovian Memory via Back-Flow of Distinguishability [1.078600700827543]
我々は,識別可能性のオンフバックフローに基づく学習記憶のモデルに依存しない簡易な目撃者を構築した。
高い運動量下での増幅, よりマイクロステップで, 厳密なブートストラップ信頼区間による一貫した正の逆流を観察した。
我々はこれを、実用的なSGDがマルコフの理想化から逸脱する、原則化された診断および実証的な証拠として位置付ける。
論文 参考訳(メタデータ) (2026-01-23T09:03:25Z) - Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free [81.65559031466452]
我々は、ゲーティング強化ソフトマックスアテンションの変種を調べる実験を行った。
SDPA(Scaled Dot-Product Attention)後の頭部特異的シグモイドゲートを簡易に修正することで,性能が向上することがわかった。
論文 参考訳(メタデータ) (2025-05-10T17:15:49Z) - Winner-Take-All Column Row Sampling for Memory Efficient Adaptation of Language Model [89.8764435351222]
分散を低減した行列生成のために, WTA-CRS と呼ばれる新しい非バイアス推定系を提案する。
我々の研究は、チューニング変換器の文脈において、提案した推定器が既存のものよりも低い分散を示すという理論的および実験的証拠を提供する。
論文 参考訳(メタデータ) (2023-05-24T15:52:08Z) - Transformers meet Stochastic Block Models: Attention with Data-Adaptive
Sparsity and Cost [53.746169882193456]
最近の研究は、自己注意の二次的コストを克服するために、様々なスパークアテンションモジュールを提案している。
本稿では,それぞれの注意を混合メンバーシップブロックモデルで表現することで,両方の問題を解決するモデルを提案する。
我々のモデルは、以前の効率的な変種とオリジナルのトランスフォーマーより優れており、十分に注目されています。
論文 参考訳(メタデータ) (2022-10-27T15:30:52Z) - Softmax-free Linear Transformers [90.83157268265654]
視覚変換器(ViT)は、視覚知覚タスクの最先端を推し進めている。
既存の手法は理論的に欠陥があるか、視覚認識に経験的に効果がないかのいずれかである。
我々はSoftmax-Free Transformers (SOFT) のファミリーを提案する。
論文 参考訳(メタデータ) (2022-07-05T03:08:27Z) - Accelerating Attention through Gradient-Based Learned Runtime Pruning [9.109136535767478]
自己認識は、トランスフォーマーベースの自然言語処理モデルにおいて、最先端の精度を実現する重要な手段である。
本稿では、学習の損失関数に組み込まれたソフトな微分可能正規化器による探索を定式化する。
我々は、ビットレベルの早期終了マイクロアーキテクチャ機構を持つトランスフォーマー言語モデルに対して、LeOPArdと呼ばれるビットシリアルアーキテクチャを考案した。
論文 参考訳(メタデータ) (2022-04-07T05:31:13Z) - Stable, Fast and Accurate: Kernelized Attention with Relative Positional
Encoding [63.539333383965726]
相対的位置符号化(RPE)を用いた変換器の注意計算を高速化する新しい手法を提案する。
相対的な位置符号化がToeplitz行列を形成するという観測に基づいて、Fast Fourier Transform (FFT) を用いて、RPEによるカーネル化された注意を効率的に計算できることを数学的に示す。
論文 参考訳(メタデータ) (2021-06-23T17:51:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。