論文の概要: Gradient Boosting within a Single Attention Layer
- arxiv url: http://arxiv.org/abs/2604.03190v1
- Date: Fri, 03 Apr 2026 17:06:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-06 17:20:24.546304
- Title: Gradient Boosting within a Single Attention Layer
- Title(参考訳): 単一アテンション層内におけるグラディエントブースティング
- Authors: Saleh Sargolzaei,
- Abstract要約: 一つの注意層内での勾配上昇促進の原理を応用したエンファングラディエントブーストアテンションを導入する。
単一のHopfieldスタイルの更新によって、格納されたパターンサブスペースへの全てのクエリ情報が消去されることを示す。
補正パスの別々の投影は、タキーのツイシングの共有射影アプローチに到達できない残留情報を復元することができる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Transformer attention computes a single softmax-weighted average over values -- a one-pass estimate that cannot correct its own errors. We introduce \emph{gradient-boosted attention}, which applies the principle of gradient boosting \emph{within} a single attention layer: a second attention pass, with its own learned projections, attends to the prediction error of the first and applies a gated correction. Under a squared reconstruction objective, the construction maps onto Friedman's gradient boosting machine, with each attention pass as a base learner and the per-dimension gate as the shrinkage parameter. We show that a single Hopfield-style update erases all query information orthogonal to the stored-pattern subspace, and that further iteration under local contraction can collapse distinct queries in the same region to the same fixed point. We also show that separate projections for the correction pass can recover residual information inaccessible to the shared-projection approach of Tukey's twicing. On a 10M-token subset of WikiText-103, gradient-boosted attention achieves a test perplexity of $67.9$ compared to $72.2$ for standard attention, $69.6$ for Twicing Attention, and $69.0$ for a parameter-matched wider baseline, with two rounds capturing most of the benefit.
- Abstract(参考訳): Transformer attentionは、値よりも1つのソフトマックス重み付き平均を計算する。
本稿では,勾配を1つの注意層に高めるという原理を応用した「emph{gradient-boosted attention」を導入し,第2の注意パスを学習した投射とともに第1の予測誤差に適応し,ゲート補正を適用する。
矩形復元目標の下では、建設はフリードマンの勾配昇降機にマップされ、各注意がベース学習者として通過し、各次元ゲートが収縮パラメータとして通過する。
1つのHopfieldスタイルの更新は、格納されたパターンのサブ空間に直交する全てのクエリ情報を消去し、局所的な制約の下でのさらなる反復は、同じ領域の異なるクエリを同じ固定点に分解することを示した。
また、修正パスの別々の投影は、タキーのツイシングの共有射影アプローチに到達できない残余情報を復元できることを示す。
WikiText-103の10万トーケンのサブセットでは、グラデーション付きアテンションは、標準的なアテンションが72.2ドル、ツイシングアテンションが69.6ドル、パラメータマッチングされたより広いベースラインが69.0ドルという、テストの難易度を67.9ドルと達成している。
関連論文リスト
- Attention Projection Mixing with Exogenous Anchors [0.0]
早期注意投影の層間再利用はデータの効率を向上させるが、構造的な衝突を引き起こす。
この衝突は、内部アンカー設計の隠れた制限であることを示す。
逐次レイヤスタックの外でアンカープロジェクションを学習することで競合を解決するExoFormerを提案する。
論文 参考訳(メタデータ) (2026-01-13T01:52:19Z) - Gradient Dynamics of Attention: How Cross-Entropy Sculpts Bayesian Manifolds [0.4779196219827507]
本研究では,トランスフォーマーアテンションヘッドにおいて,クロスエントロピートレーニングがアテンションスコアとバリューベクターをいかに再帰させるかを示す。
私たちの中核的な成果は、注目スコアに対する強調に基づくルーティング法です。
この結合された特殊化は、2時間規模のEMプロシージャのように振る舞うことを示す。
論文 参考訳(メタデータ) (2025-12-27T05:31:44Z) - Binary perceptron computational gap -- a parametric fl RDT view [2.538209532048867]
非対称二元パーセプトロン(ABP)は2つの相転移性制約密度閾値を示す。
本稿では, 高速昇降ランダム双対性理論 (fl RDT) [85] のパラメトリック利用について検討し, その可能性について検討する。
論文 参考訳(メタデータ) (2025-11-02T18:23:49Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - Disentangled Representation Learning with the Gromov-Monge Gap [65.73194652234848]
乱れのないデータから歪んだ表現を学習することは、機械学習における根本的な課題である。
本稿では,2次最適輸送に基づく非交叉表現学習手法を提案する。
提案手法の有効性を4つの標準ベンチマークで示す。
論文 参考訳(メタデータ) (2024-07-10T16:51:32Z) - Gradient Boosting Mapping for Dimensionality Reduction and Feature Extraction [2.778647101651566]
教師あり学習における根本的な問題は、優れた特徴や距離尺度を見つけることである。
本稿では,弱い学習者の出力が埋め込みを定義する,教師付き次元削減手法を提案する。
組込み座標は教師付き学習タスクにより良い機能を提供することを示す。
論文 参考訳(メタデータ) (2024-05-14T10:23:57Z) - Attention Map Guided Transformer Pruning for Edge Device [98.42178656762114]
視覚トランスフォーマー (ViT) は, 全体的かつ隠蔽された人物再識別 (Re-ID) タスクにおいて, 有望な成功を収めた。
本稿では、冗長なトークンとヘッドの両方を除去する新しいアテンションマップガイド(AMG)トランスフォーマープルーニング法を提案する。
Occluded DukeMTMC と Market-1501 に関する総合的な実験により,提案手法の有効性が示された。
論文 参考訳(メタデータ) (2023-04-04T01:51:53Z) - Large Scale Private Learning via Low-rank Reparametrization [77.38947817228656]
本稿では、大規模ニューラルネットワークに微分プライベートSGDを適用する際の課題を解決するために、再パラメータ化方式を提案する。
BERTモデルにディファレンシャルプライバシを適用し、4つの下流タスクで平均精度が8,3.9%に達するのはこれが初めてである。
論文 参考訳(メタデータ) (2021-06-17T10:14:43Z) - Self-Supervised Tuning for Few-Shot Segmentation [82.32143982269892]
Few-shotのセグメンテーションは、アノテートされたサンプルがほとんどない各画像ピクセルにカテゴリラベルを割り当てることを目的としている。
既存のメタラーニング手法では, 画像から抽出した視覚的特徴を埋め込み空間に埋め込むと, カテゴリー別識別記述子の生成に失敗する傾向にある。
本稿では,複数のエピソードにまたがる潜在特徴の分布を,自己分割方式に基づいて動的に調整する適応型フレームワークチューニングを提案する。
論文 参考訳(メタデータ) (2020-04-12T03:53:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。