論文の概要: Disentangling Representation Evolution in Transformers through Directional Decomposition
- arxiv url: http://arxiv.org/abs/2609.15975v1
- Date: Mon, 14 Sep 2026 17:56:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:06.548909
- Title: Disentangling Representation Evolution in Transformers through Directional Decomposition
- Title(参考訳): 方向分解による変圧器の異方性表現進化
- Abstract要約: トランスフォーマー表現は、学習された加算変換を通じて進化し、現在の方向を保存するか、それをリダイレクトする。
我々は、この進化を機能幾何学として研究し、学習した更新を並列および垂直なコンポーネントに分解する。
- 参考スコア(独自算出の注目度): 28.208244220956285
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Transformer representations evolve through learned additive transformations that either preserve their current direction or redirect it. We study this evolution as a functional geometry, decomposing learned updates into parallel and perpendicular components. Across pretrained models, we find substantial parallel components beyond the residual identity path. We then apply the decomposition in two spaces: to attention and MLP updates relative to the hidden state, and to attention value aggregation relative to the current token's value. Targeted edits reveal a strongly space-dependent asymmetry: exclude-self value-space parallel manipulation is markedly more robust than residual-space and perpendicular counterparts, preserving the direct self message while scaling only the non-self aggregate. The same decomposition gives a component-resolved description of compression-induced update error: perpendicular error separates compression methods more clearly than parallel error. Extensive experiments further demonstrate that full-aggregate parallel suppression during from-scratch pretraining lowers validation-loss trajectories and improves downstream averages, with the value-space variant strongest. Together, these results connect representation geometry to editing robustness, compression diagnosis, and training-time intervention. Code is available in the \href{https://github.com/Shwai-He/Transformer-Geometry}{project repository}.
- Abstract(参考訳): トランスフォーマー表現は、学習された加算変換を通じて進化し、現在の方向を保存するか、それをリダイレクトする。
我々は、この進化を機能幾何学として研究し、学習した更新を並列および垂直なコンポーネントに分解する。
事前訓練されたモデル全体では、残留アイデンティティパスを超える相当な並列成分が見つかる。
次に、その分解を隠れ状態に対する注意とMLP更新、現在のトークン値に対する注意値集約という2つの空間に適用する。
排除自己値空間の並列操作は、残余空間や垂直方向のそれよりも著しく堅牢であり、直接の自己メッセージを保存しつつ、非自己集合のみをスケーリングする。
垂直誤差は、並列エラーよりも明確に圧縮メソッドを分離する。
集中的な実験により、オフスクラッチ事前訓練中の完全アグリゲート並列抑制は、検証損失軌道を低くし、下流平均を改善し、値空間の変動が最強であることを示した。
これらの結果は、表現幾何学と、ロバスト性、圧縮診断、訓練時間介入の編集を結びつけている。
コードは \href{https://github.com/Shwai-He/Transformer-Geometry}{project repository} で公開されている。
関連論文リスト
- Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation [54.74045834035952]
視覚言語データセット蒸留(VLDD)は、大きな画像テキストのペア化されたデータセットを小さな合成ペアに圧縮する。
階層幾何学と明示的なアライメント・キャパシティ制御を組み合わせたランク認識型双曲アライメント(RAHA)を提案する。
RAHAは、競争力のあるクロスモーダル検索と、固定予算下での転送インジケータの改善を示す。
論文 参考訳(メタデータ) (2026-06-28T15:41:31Z) - Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior [107.2098567818173]
Latent Recurrent Transformer (LRT) は自己回帰変換器の軽量化である。
LRTは、次のトークンのリカレントメモリとして、前のトークンから高レベルなソース層隠れステートを再利用する。
論文 参考訳(メタデータ) (2026-05-26T10:10:26Z) - Residual Connections and the Causal Shift: Uncovering a Structural Misalignment in Transformers [9.617245548268437]
大規模言語モデル(LLM)は、自動回帰変換器で実装された次世代の予測で訓練される。
残余接続は現在のトークンとアクティベーションを結び付け、監督は次のトークンをターゲットとします。
固定層介入や学習可能なゲーティング機構として実装された残差減衰に基づく軽量残差経路緩和法を提案する。
論文 参考訳(メタデータ) (2026-02-16T14:04:42Z) - PRISM: Parallel Residual Iterative Sequence Model [52.26239951489612]
我々はこの緊張を解決するためにPRISM(Parallel Residual Iterative Sequence Model)を提案する。
PRISMは、パラレル化可能な形で多段階精製の重要な構造特性を捉える、ソルバに着想を得た帰納バイアスを導入している。
この定式化が Rank-$L$ の蓄積を達成することを証明し、更新多様体を単一ステップの Rank-$1$ ボトルネックを超えて構造的に拡張する。
論文 参考訳(メタデータ) (2026-02-11T12:39:41Z) - Low-Dimensional Execution Manifolds in Transformer Learning Dynamics: Evidence from Modular Arithmetic Tasks [0.0]
本稿では, 数値計算を慎重に制御し, 変圧器モデルにおける学習力学の構造について検討する。
その結果,トランスフォーマー学習を理解するための統一的な幾何学的枠組みが示唆された。
論文 参考訳(メタデータ) (2026-02-11T03:57:46Z) - Rethinking Weight Tying: Pseudo-Inverse Tying for Stable LM Training and Updates [22.84428628659889]
Pseudo-Inverse Tyingはトレーニングを通じて擬似逆整合インターフェースを保証する。
256M-1.3Bパラメータにまたがるデバイス上でのPITを評価する。
論文 参考訳(メタデータ) (2026-02-04T13:44:53Z) - Deep Delta Learning [91.75868893250662]
本稿では,標準残差接続を一般化した新しいアーキテクチャであるDeep Delta Learning(DDL)を紹介する。
我々はこの演算子のスペクトル解析を行い、ゲート$(mathbfX)$がアイデンティティマッピング、投影、幾何反射のダイナミックな相互作用を可能にすることを示した。
この統合により、ネットワークは階層的な遷移作用素のスペクトルを明示的に制御することができ、複雑な非単調力学のモデリングを可能にする。
論文 参考訳(メタデータ) (2026-01-01T18:11:38Z) - Parallel Decoder Transformer: Model-Internal Parallel Decoding with Speculative Invariance via Note Conditioning [0.0]
textbfParallel Decoder Transformer (PDT)は,凍結事前学習モデルの推論プロセスに直接調整プリミティブを埋め込むパラメータ効率の高いアーキテクチャである。
PDTは効果的な自己補正を達成し、カバレッジ予測の精度は textbf77.8% に達し、トランク重量を変更することなく近似シリアルセマンティクスを復元する。
論文 参考訳(メタデータ) (2025-12-10T20:19:10Z) - Tracing the Representation Geometry of Language Models from Pretraining to Post-training [22.18942718274405]
本研究では,事前学習と後学習にまたがる学習表現の幾何学をスペクトル的に検討する。
自己回帰事前学習中に3つの幾何位相の一貫した非単調列が発見された。
SFTとDPOは、特定の命令データや優先データを統合するために「エントロピー探索」ダイナミクスを駆動します。
論文 参考訳(メタデータ) (2025-09-27T00:46:29Z) - PAID: Pairwise Angular-Invariant Decomposition for Continual Test-Time Adaptation [70.98107766265636]
本稿では,事前学習した重みの幾何学的特性を出発点として,3つの重要な成分(等級,絶対角,対角構造)を体系的に解析する。
両角構造は多種多様なドメインにわたって安定であり, ドメイン不変な意味情報を符号化し, 適応中に保存すべきことを示唆する。
論文 参考訳(メタデータ) (2025-06-03T05:18:15Z) - Rao-Blackwell Gradient Estimators for Equivariant Denoising Diffusion [55.95767828747407]
分子やタンパク質の生成のようなドメインでは、物理系はモデルにとって重要な固有の対称性を示す。
学習のばらつきを低減し、確率的に低い分散勾配推定器を提供するフレームワークを提案する。
また,軌道拡散法(Orbit Diffusion)と呼ばれる手法を用いて,損失とサンプリングの手順を取り入れた推定器の実用的実装を提案する。
論文 参考訳(メタデータ) (2025-02-14T03:26:57Z) - Structuring Representation Geometry with Rotationally Equivariant
Contrastive Learning [42.20218717636608]
自己教師付き学習は、画像などの生の知覚データを、単純なユークリッド距離が有意義なデータの変動を測定するようなコンパクトな空間に変換する。
この定式化は、埋め込み空間の単純な変換に対応するように入力空間の変換を強制することにより、埋め込み空間に追加の幾何学的構造を加えることによって拡張する。
我々は、同変損失と非崩壊項を単に組み合わせれば、非自明な表現が得られることを示す。
論文 参考訳(メタデータ) (2023-06-24T10:07:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。