論文の概要: Feed-Forward Steering in Transformer Residual Dynamics
- arxiv url: http://arxiv.org/abs/2608.02071v1
- Date: Mon, 03 Aug 2026 11:15:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.507446
- Title: Feed-Forward Steering in Transformer Residual Dynamics
- Title(参考訳): 変圧器残留動力学におけるフィードフォワードステアリング
- Abstract要約: 我々は,各トークン状態に,フィードフォワードネットワーク(FFN)という用語を局所的なステアリングフィールドとして組み込むことで,注目のみのトランスフォーマー残方向を延長する。
得られた理論は、残留方向空間における運動にはFFN場の接成分が必要であると予測する。
現実的な応用として、小さな通勤者欠陥のある層は、わずかに損失が増加するだけでほぼ並列化できる。
- 参考スコア(独自算出の注目度): 4.109803241412197
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Attention-only dynamical theories model Transformer residual directions as particles aggregating on a sphere. We extend this framework by incorporating the feed-forward network (FFN) term as a local steering field acting on each token state. The resulting theory predicts that the tangential component of the FFN field is necessary for motion in residual-direction space, that critical residual directions correspond to nonlinear projective equilibria, and that a commutator defect determines when a finite attention--FFN block can be accurately approximated by a parallel, additive flow. Across GPT-2, Pythia, Mistral, and Llama models, the extended theory improves one-step angular prediction relative to an attention-only baseline, with the contribution of the FFN increasing from GPT-2 to Llama-3-8B. Intervention experiments show that retaining only the tangential FFN component preserves most model quality, whereas retaining only the radial component causes performance to collapse. The tangential component also preserves output diversity under aggregation pressure. As a practical application, layers with small commutator defects can be approximately parallelized with only a modest increase in loss, whereas layers with large defects degrade rapidly. These findings support the interpretation of FFN layers as directional steering fields that shape Transformer residual geometry and govern the feasibility of block-level interventions.
- Abstract(参考訳): 注意のみの力学理論は、球上に凝集する粒子としてトランスフォーマーの残留方向をモデル化する。
我々は、各トークン状態に作用する局所的なステアリングフィールドとして、フィードフォワードネットワーク(FFN)という用語を組み込むことで、このフレームワークを拡張した。
この理論は、残留方向空間における運動にはFFN場の接成分が必要であり、臨界残留方向は非線形射影平衡に対応し、通勤者欠陥は有限の注意-FFNブロックを平行な加法流で正確に近似できるときに決定する、と予測する。
GPT-2、Pythia、Mistral、Llamaモデル全体で、拡張理論は、GPT-2からLlama-3-8BへのFFNの寄与により、注意のみのベースラインに対する一段階の角予測を改善する。
干渉実験により、特定のFFN成分のみを保持することはほとんどのモデル品質を維持する一方、放射状成分のみを保持することは性能を低下させることが示された。
接種成分は、凝集圧力下での出力の多様性も保持する。
現実的な応用として、小さな通勤者欠陥のある層は損失がわずかに増加してもほぼ並列化できるが、大きな欠陥のある層は急速に劣化する。
これらの知見は, FFN層をトランスフォーマー残基の形状を形作り, ブロックレベルの介入の実現可能性を管理する指向性操舵場として解釈する上で有効である。
関連論文リスト
- An Adjoint-Sensitivity Framework for Lost-in-the-Middle Phenomena in Causal Residual Transformers [1.4180331276028662]
我々は, 因果残差変換器における位置影響に対する随伴感度フレームワークを開発した。
我々は、独立にチェック可能なエネルギー、相関、および局所チャネル境界の下で境界の利点を述べる。
論文 参考訳(メタデータ) (2026-07-20T08:44:31Z) - A lift for input-convex neural network training [3.142113135607563]
In Inputdimensional Neural Network (ICNN) は、対数凹密度推定、凸ポテンシャル正規化フロー、最適輸送、後部へのトランスポートマップインバージョンに使用される。
非負の円錐への標準射影勾配降下(PGD)は、硬く非滑らかな投影を施す。
微分可能な代替品であるソフト・プラス・リパラメトリゼーション (Softplus reparametrization) は、重量級数で指数関数的に勾配を減衰させ、層間重量損失を減少させる訓練を停止させる。
揚力はPGDと直接ソフトプラスよりも低い試験損失を示し,プラトーバウンドトレーニングを1つにする。
論文 参考訳(メタデータ) (2026-05-22T22:59:11Z) - The Inductive Bias of Convolutional Neural Networks: Locality and Weight Sharing Reshape Implicit Regularization [57.37943479039033]
本研究では,勾配降下における安定性現象によって引き起こされる暗黙の正則化に,アーキテクチャ的帰納バイアスがどう影響するかを考察する。
局所性と重量共有が根本的に変化していることが示されています。
論文 参考訳(メタデータ) (2026-03-05T04:50:51Z) - Data-Free PINNs for Compressible Flows: Mitigating Spectral Bias and Gradient Pathologies via Mach-Guided Scaling and Hybrid Convolutions [0.0]
本稿では,圧縮不能なインビシッドフローを解くことができる完全データフリーな物理情報ニューラルネットワーク(PINN)を提案する。
提案するフレームワークは,参照データなしで離弓衝撃を捕捉する。
論文 参考訳(メタデータ) (2026-03-01T09:04:18Z) - Generalizing GNNs with Tokenized Mixture of Experts [75.8310720413187]
安定性の向上には,変化に敏感な特徴への依存を低減し,既約最悪の一般化フロアを残す必要があることを示す。
本研究では,STEM-GNNを提案する。STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN。
9つのノード、リンク、グラフのベンチマークで、STEM-GNNはより強力な3方向バランスを実現し、クリアグラフ上での競争力を維持しながら、次数/ホモフィリーシフトや特徴/エッジの破損に対する堅牢性を改善している。
論文 参考訳(メタデータ) (2026-02-09T22:48:30Z) - MirrorLA: Reflecting Feature Map for Vision Linear Attention [49.41670925034762]
リニアアテンションはトランスフォーマーの2次から線形への計算複雑性を著しく低下させるが、パフォーマンスにおけるソフトマックスに基づくアテンションの遅れは一貫して遅れる。
我々は、受動トランケーションをアクティブなリオリエンテーションに置き換える幾何学的枠組みであるMirrorLAを提案する。
MirrorLAは標準的なベンチマークで最先端のパフォーマンスを実現し、表現の忠実さを損なうことなく厳密な線形効率を実現できることを示した。
論文 参考訳(メタデータ) (2026-02-04T09:14:09Z) - A scalable flow-based approach to mitigate topological freezing [34.54607280864912]
マルコフチェインモンテカルロシミュレーションからトポロジカルアーティファクトを除去するフローベース戦略を提案する。
この戦略は、非平衡モンテカルロ更新を局所的で頑丈な欠陥層に置き換える正規化フロー(SNF)に基づいている。
欠点SNFは、同等のコストで非平衡法を再現するよりも優れた性能を示す。
論文 参考訳(メタデータ) (2026-01-28T15:40:46Z) - On Exact Editing of Flow-Based Diffusion Models [97.0633397035926]
本研究では,フローベース編集を既知ソースによって駆動される分散変換問題として再構成する条件付き速度補正(CVC)を提案する。
CVCは、双対パースペクティブな速度変換機構を導入することにより、分配間変換における速度の役割を再考する。
我々は,CVCが優れた忠実度,セマンティックアライメント,多種多様なタスクに対する信頼性の高い編集動作を一貫して達成していることを示す。
論文 参考訳(メタデータ) (2025-12-30T06:29:20Z) - Revisiting LRP: Positional Attribution as the Missing Ingredient for Transformer Explainability [53.21677928601684]
階層的関連性伝播は、ディープラーニングにおける説明可能性に対する最も有望なアプローチの1つである。
そこで我々は,様々な位置符号化手法にまたがる属性の伝播を目的とした,理論的なLRP規則を提案する。
本手法は,視力とNLP説明可能性の両面において,最先端の課題を著しく上回っている。
論文 参考訳(メタデータ) (2025-06-02T18:07:55Z) - Robust topological feature against non-Hermiticity in Jaynes-Cummings
Model [0.0]
我々はJaynes-Cummings Model(JCM)で表されるトポロジ的特徴を解析的に分析する。
非ハーモニティ性はスピン巻面を傾け、トポロジカルな特徴を維持しながら、外面成分を誘導する。
論文 参考訳(メタデータ) (2024-02-09T12:26:59Z) - Semi-Supervised Coupled Thin-Plate Spline Model for Rotation Correction and Beyond [84.56978780892783]
制御点が限られている複数のTPSを、より柔軟で強力な変換に繰り返し結合するCoupledTPSを提案する。
注記コストを考慮に入れた半教師付き学習手法を開発し、ラベルのないデータを活用することにより、ワープ品質を向上させる。
実験は、回転補正のための既存の最先端解よりもCoupledTPSの優位性と普遍性を示す。
論文 参考訳(メタデータ) (2024-01-24T13:03:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。