論文の概要: Scaled Idempotence in Transformer Attention: Paired OV Geometry and Shared-Value Algebras
- arxiv url: http://arxiv.org/abs/2609.01129v1
- Date: Tue, 01 Sep 2026 12:05:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.616695
- Title: Scaled Idempotence in Transformer Attention: Paired OV Geometry and Shared-Value Algebras
- Title(参考訳): 変圧器注意におけるスケールド・イデムポタンス:ペアドOV幾何と共有値代数
- Authors: Jiming Feng, Junliang Li,
- Abstract要約: 有効 OV 作用素のスパース部分集合 $T=OVtop$ は合成においてほぼ閉じ、$T2approxT$ となる。
2.8B--235Bパラメータと3.98--8.00%のヘッドが正方形のクロージャアライメントに達する6つの事前訓練されたエンドポイントにまたがる。
高いクロージャは、調査されたすべての層で実現可能であるが、通常は達成されない。
正確な値共有の下では、頭部閉包は右作用代数、$T_iT_j=_jT_i$に拡張される。
- 参考スコア(独自算出の注目度): 1.8412945308419035
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We identify a recurrent algebraic regularity in Transformer attention: a sparse subset of effective OV operators $T=OV^\top$ nearly closes under composition, $T^2\approxαT$. Across six pretrained endpoints spanning 2.8B--235B parameters, 3.98--8.00% of heads reach squared closure alignment $\mathcal{P}\geq0.9$, while no matched within-layer O/V mismatch does. An exact principal-coordinate factorization, $T=Q_OKQ_V^\top$ and $T^2=Q_O(KDK)Q_V^\top$, separates within-support transport from read--write return geometry. Across all 7,304 heads in nine MHA/GQA models, scrambling only the orientation of $K$ while preserving singular values, norms, factor spans, and principal angles reduces median closure from 0.336 to $1.04\times10^{-4}$; trained orientation wins for 98.64% of heads and in every layer. Constructive searches show that high closure is feasible in every surveyed layer, but usually not attained. Retrospective trajectories in three independently trained lineages further separate broadly available capacity from the orientations attained by final strong heads. Under exact value sharing, headwise closure extends to a right-action algebra, $T_iT_j=α_jT_i$. Seven-model experiments verify the approximate law and reveal distinct oblique projections with a shared value-defined kernel. These results characterize scaled idempotence as a sparse trained orientation within broadly available geometric capacity and show how value sharing extends a headwise relation into a local operator algebra.
- Abstract(参考訳): 実効 OV 作用素のスパース部分集合 $T=OV^\top$ は合成の下でほぼ閉じ、$T^2\approxαT$ となる。
2.8B--235Bパラメータにまたがる6つの事前訓練されたエンドポイントで、3.98--8.00%のヘッドが正方形のクロージャアライメントに到達し、$\mathcal{P}\geq0.9$となった。
正確な主座標因子化である$T=Q_OKQ_V^\top$と$T^2=Q_O(KDK)Q_V^\top$は、読み取り書き戻り幾何からサポートされたトランスポートを分離する。
9つのMHA/GQAモデルの7,304個のヘッドは、特異値、ノルム、係数スパン、主角を保ちながら$K$の方向のみをずらし、中央値のクロージャを0.336から1.04\times10^{-4}$に減らし、訓練された配向は98.64%のヘッドとすべてのレイヤーで勝利する。
コンストラクティブ・サーチは、調査対象の各層で高いクロージャが実現可能であるが、通常は達成できないことを示す。
独立に訓練された3つの系統の振り返り軌跡は、最終的な強みによって達成された方向から、より広範囲に利用可能な容量を分離する。
正確な値共有の下では、頭部閉包は右作用代数、$T_iT_j=α_jT_i$に拡張される。
7モデル実験は近似法則を検証し、共有値定義カーネルで異なる斜め射影を明らかにする。
これらの結果は、スケールドイデオポテンスを、広く利用可能な幾何学的キャパシティ内のスパーストレーニングされた配向として特徴づけ、値共有が局所作用素代数への頭部的関係をいかに拡張するかを示す。
関連論文リスト
- The Approximation Rank of Softmax Attention: Sharp Geometric Laws and Robust Interaction Dimension [6.5186553168895385]
2つの鋭い最悪のケース法則は、固定$d$とエラー$varepsilon$のサポート幾何学を分離する。
固定ヘッドの場合、行-softmaxは行-スカラーロジット方向を商化する。
84ヘッドのBERTベースキャリブレーションセットでは、多くのヘッド温度設定において、控えめな有効次元の低減が観察される。
論文 参考訳(メタデータ) (2026-08-28T10:12:54Z) - Readout Orientation Controls Measurement-Accessible Quantum Tangent Geometry [0.0]
固定量子測定は、制限された可観測可読性保持部よりもかなり具体的な情報を露呈することができる。
残留タンジェント質量を$R=mathrmTr(PC)$で定量化する。
その結果、読み出し方向は、単独でランク付けできない自由度として分離された。
論文 参考訳(メタデータ) (2026-08-17T19:45:48Z) - High-Dimensional Nonparametric Change-Point Detection via Low-Rank Degree-Three Density Projection [2.1991623402625606]
分布の変化は手段に見えず、共変は歪み、非対称な相互作用、または他の3階構造に現れる。
我々は, 直接密度推定を回避しつつ, 密度の最大3次係数を全て保持する非パラメトリックな変化点法を開発した。
論文 参考訳(メタデータ) (2026-08-16T01:21:55Z) - Dimension Rigidity and Projective Geometry of Trace-Product Switchings of the Gold Cube [20.271194684947282]
任意の偶次元において、ゴールド準完全非線形関数 $xmapsto x3$ の自然なスカラートレース積スイッチングを分類する。
すべての$ngeq10$に対して、非ゼロ係数は許容されない。
また、正規化階数 2 を 8 次元で $mathbbP1(mathbbF_4)$ で分類する。
論文 参考訳(メタデータ) (2026-08-04T22:36:09Z) - CORA: Per-Slice Coherent Orthogonal Rotation for SVD-based Low-Rank Adaptation [6.432245831737748]
安定な微調整はコヒーレントSVD回転に続くことを示す。
CORAは、常識推論とコード生成でLoRA、DoRA、PiSSA、MiLoRAを上回っている。
論文 参考訳(メタデータ) (2026-06-30T20:00:47Z) - Efficient Mean Curvature Computation on High-Dimensional Data Manifolds [52.452902154360565]
高次元データセットの各点における局所的な平均曲率の推定は、機械学習アルゴリズムの重要な要素である。
本稿では,このコストを桁違いに削減する2つの補完的貢献を紹介する。
実世界のデータセットの実験では、オリジナルの実装と比較して50倍から300倍のスピードアップが確認されている。
論文 参考訳(メタデータ) (2026-06-04T16:04:31Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - Improved Algorithm for Adversarial Linear Mixture MDPs with Bandit
Feedback and Unknown Transition [71.33787410075577]
線形関数近似,未知遷移,および逆損失を用いた強化学習について検討した。
我々は高い確率で$widetildeO(dsqrtHS3K + sqrtHSAK)$ regretを実現する新しいアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-03-07T15:03:50Z) - Transformers as Support Vector Machines [54.642793677472724]
自己アテンションの最適化幾何と厳密なSVM問題との間には,形式的等価性を確立する。
勾配降下に最適化された1層変圧器の暗黙バイアスを特徴付ける。
これらの発見は、最適なトークンを分離し選択するSVMの階層としてのトランスフォーマーの解釈を刺激していると信じている。
論文 参考訳(メタデータ) (2023-08-31T17:57:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。