論文の概要: A Controlled Study of Attention-Only Transformers
- arxiv url: http://arxiv.org/abs/2607.18363v1
- Date: Mon, 20 Jul 2026 15:29:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.202958
- Title: A Controlled Study of Attention-Only Transformers
- Title(参考訳): アテンションオンリー変圧器の制御に関する研究
- Authors: Henry Ndubuaku, Karen Mosoyan, Jakub Mroz, Noah Cylich, Satyajit Kumar, Parkirat Sandhu, Roman Shemet, Justin H Lee,
- Abstract要約: 我々は、パラメータカウント、FLOPのトレーニング、深さを個別にマッチする標準変換器に対して、注意のみのデコーダ変換器を訓練する。
解放された予算を注意深さに再配置することはギャップを埋めます。
注意のみのモデルは、文脈に基づく回答よりも、知識が重みから来る必要がある場合の方が優れていることを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Feed-forward networks hold two thirds of a transformer's non-embedding parameters, yet the architecture has not received a necessity test that controls parameters, compute, and depth at once. We pretrain attention-only decoder transformers (Simple Attention Networks, SANs) against standard transformers matched separately for parameter count, training FLOPs, and depth (2 to 48 layers), for up to 105B tokens at 6M to 87M parameters. Deleting feed-forward layers in place is costly: the standard transformer leads by 0.47 nats at matched depth and 0.26 nats at matched FLOPs. Reallocating the freed budget into attention depth closes the gap: at matched parameters the difference is 0.006 nats (0.27 percent of loss), reproducible to one part in ten thousand across seed pairs, shrinking across 5B, 30B, and 105B budgets, and holding near 0.02 nats across a 29x size range. Three measurements localize the remaining gap to parametric recall: attention-only models are better on context-grounded answers and worse where knowledge must come from weights. Weight spectra show why: routing matrices (Q/K) crystallize early, content matrices accumulate rank slowly, and removing feed-forward layers relocates this accumulation to the attention output projection. QK-normalization, not feed-forward layers or residual gating, keeps 48-layer attention-only stacks trainable. The deficit concentrates on low-context query prediction and localizes there entirely by the largest budget. A pre-registered test confirms the account: it predicts a 0.02 to 0.05 nat gap on knowledge-dense web text; a matched pair trained on fineweb-edu measures 0.040. Within the tested regime, attention does the rest.
- Abstract(参考訳): フィードフォワードネットワークはトランスフォーマーの非埋め込みパラメータの3分の2を保持するが、アーキテクチャはパラメータ、計算、深さを一度に制御する必要試験を受けていない。
我々は,6Mから87Mパラメータの105Bトークンに対して,パラメータカウント,FLOP,深さ(2~48層)を別々にマッチングした標準変圧器に対して,注意のみの復号器(Simple Attention Networks,SANs)を事前訓練する。
標準変圧器は、マッチした深さで0.47ナット、マッチしたFLOPで0.26ナットとなる。
一致したパラメータでは0.006ナット(損失の0.27%)で、種子ペアで1万分の1に再現可能で、5B、30B、105Bの予算で縮小され、29倍の範囲で0.02ナット近くを保持する。
3つの測定は、パラメトリックリコールへの残りのギャップをローカライズする: 注意のみのモデルは、文脈に基づく回答の方が優れている。
ウェイトスペクトルは、ルーティング行列(Q/K)が早期に結晶化し、コンテンツ行列が徐々にランクを上昇し、フィードフォワード層を除去することで、この蓄積を注意出力プロジェクションに移動させる。
QK正規化はフィードフォワード層や残留ゲーティングではなく、48層の注意のみのスタックをトレーニング可能である。
この赤字は低コンテキストのクエリ予測に集中しており、最大予算で完全にローカライズされている。
登録済みテストでは、ナレッジセンスのWebテキスト上で0.02から0.05ナットのギャップを予測し、詳細なWeb-eduでトレーニングされたマッチングペアが0.040である。
テストされた体制の中では、注意が残ります。
関連論文リスト
- CLEAR-MoE: Shared-Basis Expert Extraction from Frozen Vision Transformers via Calibration-Driven Layer Selection [0.0]
CLEAR-MoEは、凍結した事前訓練されたビジョントランスフォーマー(ViT)をバックボーン重みを更新することなく、スパースミクチャー・オブ・エクササイズ(MoE)モデルに変換するポストトレーニングパイプラインである。
GTX 960では、ルーティングと散乱計のオーバーヘッドにより、CLEAR-MoE FFN 1.3-1.7xは高密度ルータよりも遅い。
論文 参考訳(メタデータ) (2026-06-26T18:12:03Z) - Pre-Warm: Input-Conditioned Weight Initialization for Convolutional Neural Networks [0.0]
Pre-Warmは、単一のトレーニングバッチから平均中心のローカルパッチを抽出する。
それらをMiniKMeansでクラスタし、逆マンハッタン空間重み付けを適用し、その結果のセントロイドを使って第1層フィルタの半分を初期化する。
論文 参考訳(メタデータ) (2026-06-24T00:27:53Z) - Error Highways: Scaling Predictive Coding to Very Deep Networks [45.88028371034407]
予測符号化ネットワーク(PCN)は、生物学的に証明可能な、局所学習の代替として、エラーのバックプロパゲーション(バックプロップ)を提供する
PCNのスケーリングにおける中心的な障害は、学習信号がひび割れた境界から遠ざかるにつれて急速に減衰することである。
予測符号化(PC)に基づく自由エネルギー関数を,その神経構造を変化させることで拡張する手法であるハイウェイエラー伝搬(HEP)を提案する。
論文 参考訳(メタデータ) (2026-06-22T01:12:29Z) - How Much Capacity Does EEG Denoising Need? Ultra-Compact Networks reveal Benchmark Saturation and Metric-Utility Gap [0.0]
深層学習EEG(Deep Learning EEG Denoising Architectures)は、数万から数千万のパラメータに拡張されているが、実験変数としてモデルキャパシティを分離した以前の研究はない。
アーキテクチャ,損失,データ分割,トレーニングレシピの両ギャップに対処し,最小限の深さ分離可能な畳み込みU-Netで1.05Kから40.26Kパラメータまでのチャネル幅を網羅する。
論文 参考訳(メタデータ) (2026-06-07T12:17:25Z) - Kronecker Embeddings: Byte-Level Structured Token Representations for Parameter-Efficient Language Models [0.0]
大規模言語モデルは、学習された埋め込みテーブルを通じて全ての入力をルーティングする。
我々はKronecker Embeddingsを紹介した。
入力側のトレーニング可能なパラメータの91~94%をフロンティアスケールで除去する。
論文 参考訳(メタデータ) (2026-05-28T06:53:18Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - What Layers When: Learning to Skip Compute in LLMs with Residual Gates [66.23658560048241]
GateSkipは、デコーダのみのLMにおけるトークンワイド層スキップを可能にする残差ストリームゲーティング機構である。
各Attention/MLPブランチは、残ストリームに再入力する前に、ブランチの出力を凝縮するシグモイドリニアゲートを備えている。
論文 参考訳(メタデータ) (2025-10-13T16:31:50Z) - Data-independent Module-aware Pruning for Hierarchical Vision Transformers [41.92794134275854]
階層型視覚変換器(ViT)は従来のViTよりも2つの利点がある。
まず、階層型ViTは局所的な自己注意による画像サイズに関する線形計算複雑性を実現する。
第二に、階層的なViTは階層的な特徴マップを作成し、画像パッチをより深い層にマージして、密度の高い予測を行う。
論文 参考訳(メタデータ) (2024-04-21T12:50:38Z) - DeepNet: Scaling Transformers to 1,000 Layers [106.33669415337135]
トランスフォーマーの残差接続を修正するための新しい正規化関数(DeepNorm)を導入する。
詳細な理論解析により、モデル更新は安定な方法でバウンドできることが示されている。
トランスフォーマーを1,000層まで拡張することに成功したが、これは従来のディープトランスフォーマーよりも1桁も深い。
論文 参考訳(メタデータ) (2022-03-01T15:36:38Z) - Filter Sketch for Network Pruning [184.41079868885265]
事前学習したネットワーク重み(フィルタ)の情報保存による新しいネットワークプルーニング手法を提案する。
われわれのアプローチは、FilterSketchと呼ばれ、事前訓練された重みの2次情報を符号化する。
CIFAR-10の実験では、FilterSketchはFLOPの63.3%を削減し、ネットワークパラメータの59.9%を無視できる精度で削減している。
論文 参考訳(メタデータ) (2020-01-23T13:57:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。