論文の概要: From Attention Masks to Inert Zero-Vector Tokens: OAttention and O-Closure for Token Dynamics
- arxiv url: http://arxiv.org/abs/2608.21174v1
- Date: Fri, 21 Aug 2026 14:43:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.587749
- Title: From Attention Masks to Inert Zero-Vector Tokens: OAttention and O-Closure for Token Dynamics
- Title(参考訳): 注意マスクからイナートゼロベクタートークンへ:トークンダイナミクスのOAttentionとO-Closure
- Abstract要約: アテンションマスクは、アテンションバウンダリで参加していない表現型トークン状態を提供しない。
OAttentionは、このルールの支持結合された注意深い実現である。
受信機出力を(p_i)でゲートし、(p_j)を(p_j)で重み付けする。
これによりゼロベクトルトークンはゼロ要素となり、正確なnull-受信子、nullソース挿入、自己アテンション挿入、空サポートプロパティが生成される。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Attention masks are relation-level controls: they specify which query--source pairs may interact. They do not provide a representation-carried token state that is non-participating at the attention boundary. We assign each token hidden carrier \(h_i\) an active-presence coefficient \(p_i=\lVert h_i\rVert^2/(τ+\lVert h_i\rVert^2)\). The same coefficient has two roles: it gates information emitted by token \(i\), and it determines the mass with which token \(i\) enters computations shared with other tokens. OAttention is the support-coupled attention realization of this rule. It gates the receiver output by \(p_i\) and weights source \(j\) by \(p_j\) in both the attention numerator and partition, while retaining the standard score, visibility relation, exponential competition, and value aggregation. This makes the zero-vector token a zero element and yields exact null-receiver, null-source insertion, self-attention insertion, and empty-support properties. The same token-level presence gives local O-components (OFFN, ONorm, and OInject), presence-weighted OStandardize, the O-Closure law \(M(H\oplus0)=M(H)\oplus0\), and an OTransformer by residual and compositional closure. The canonical operator is checked by contract tests and a GPU evaluation. In a zero-fine-tuning retrofit of a cloned pretrained TabPFN v3 regressor, calibrated hidden-carrier OAttention and Full-O variants change mean RMSE by $+0.088\%$ and $+0.177\%$, respectively, over 18 matched dataset--seed cases. A two-block ablation shows that OAttention alone does not preserve a NULL state through ordinary host components, whereas the OTransformer path does. These are scoped tests of exactness, active-path compatibility, and compositional necessity; they do not establish universal no-loss, arbitrary-host closure, learned attraction to the origin, or a general semantics for missing values.
- Abstract(参考訳): アテンションマスクはリレーショナルレベルのコントロールであり、どのクエリソースペアが相互作用するかを指定する。
それらは、アテンションバウンダリで参加していない表現型トークン状態を提供していません。
p_i=\lVert h_i\rVert^2/(τ+\lVert h_i\rVert^2)\)。
同じ係数は2つの役割を持つ: トークン \(i\) によって出力される情報をゲートし、トークン \(i\) が他のトークンと共有される計算を入力する質量を決定する。
OAttentionは、このルールの支持結合された注意深い実現である。
これは、標準スコア、可視性、指数的競争、および値集約を維持しつつ、注目数値と分割の両方において、 \(p_i\) と \(p_j\) の重み源 \(j\) による受信出力をゲートする。
これによりゼロベクタートークンはゼロ要素となり、正確なnull受信子、nullソース挿入、自己アテンション挿入、空サポートプロパティが生成される。
同じトークンレベルの存在は、局所的なO成分(OFFN, Onorm, OInject)、存在重み付けされたOStandardize、O-Closure法 \(M(H\oplus0)=M(H)\oplus0\)、残留および構成的閉包によるO-Transformerを与える。
標準演算子は、コントラクトテストとGPU評価によってチェックされる。
クローン化された事前訓練されたTabPFN v3レグレシタのゼロファインチューニングで、キャリブレーションされた隠れキャリアOAttentionとFull-Oの変種はRMSEを$+0.088\%$と$+0.177\%$で変更する。
2ブロックのアブレーションは、OAttentionのみが通常のホストコンポーネントを通してNULL状態を保存していないことを示しているが、OTransformerパスはそうである。
これらは、完全性、能動パス互換性、作曲の必要性のスコープテストであり、普遍的なno-loss、任意のホスト閉鎖、起源への学習的魅力、欠落した値に対する一般的な意味論を確立しない。
関連論文リスト
- Interpolation Is Not Invariance: Pair Count Is Not Coverage in Transformation Audits [0.0]
同等のペアをカウントすることは、トランスフォーメーション監査のカバレッジを報告するための一般的な方法であるが、監査によって課される制約を大幅に上書きすることができる。
4つの相補的な量 - エッジカウント$m$, 効果的なコントラストランク$s$, 人口支援ランク$r$, グラフスペクトルギャップ$$-と, 監査カバレッジとデプロイメントの信頼性における役割を特徴づける。
論文 参考訳(メタデータ) (2026-09-14T00:40:14Z) - Intrinsic Structure: Spectral Identifiability for Mechanistic Interpretability [51.56484100374058]
機械論的解釈可能性プリミティブに対する最初の識別可能性定理を証明した。
スペクトルは、正当性分解ではなく、記述されたエラーバーを持つ識別可能なモデル固有の指紋である。
論文 参考訳(メタデータ) (2026-08-10T19:42:01Z) - The Token Is a Group Element: On Lie-Algebra Attention over Matrix Lie Groups [1.0152838128195465]
これは、トークンが素行列リー群要素である最初の注意構造である。
アフィンフルフレーム群に到達し、すべての既約あるいは全射expベースのメソッドを除外しなければならない。
構成は、相対的なポーズを含む選択されたチャート上の任意の行列リー群に適用される。
論文 参考訳(メタデータ) (2026-06-18T17:56:17Z) - LimiX-2M: Mitigating Low-Rank Collapse and Attention Bottlenecks in Tabular Foundation Models [56.999481798138625]
LimiX-2Mは2Mパラメータモデルであり、広く使われているベンチマークでTabPFN-v2とTabICLのベースラインを上回っている。
本稿では,強力なタブラル基礎モデル(TFM)のための統一トークン化・ルートフレームワークを提案する。
その結果、TFMにおける精度-効率トレードオフを改善するキーレバーとして、バリューアウェアトークン化とリードアウト整列ルーティングが強調された。
論文 参考訳(メタデータ) (2026-06-03T06:07:33Z) - Every Component is a Lookup: Token Attribution and Composition from a Single Decomposition [1.3290717106567922]
We exploit a shared key-value template $(S)U$ to developing Unpack, a backward recursion that decomposes credit through both sublayers。
GPT-2では、Wang et al. (2023) によって記述された3つの合成接続をすべて復元し、各接続のモード固有のルーティングを含む。
160Mから6.9Bまでのピキア族全体において、この抑制パターンはあらゆるスケールで一貫して回復される。
論文 参考訳(メタデータ) (2026-05-22T09:03:01Z) - Zero-Ablation Overstates Register Content Dependence in DINO Vision Transformers [0.5908824417241282]
ゼロアブレーションオーバーステートは、正確なレジスタの内容に依存することを示す。
ゼロアブレーションオーバーステートは、正確なレジスタの内容に依存すると結論付ける。
論文 参考訳(メタデータ) (2026-04-15T21:24:42Z) - Label-Free Cross-Task LoRA Merging with Null-Space Compression [50.63908869296697]
我々は,ラベルフリーで出力に依存しない手法であるNull-Space Compression (NSC) Mergingを紹介した。
NSCは、従来のメソッドがタスクのサブセットに収まるバランスの取れたゲインを持つ20の異種視覚タスクに対して、最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-03-27T11:34:41Z) - Scaling Attention via Feature Sparsity [50.64995497733461]
超長期のコンテキストにトランスフォーマーをスケールすることは、自己注意のコスト$O(n2 d)$コストによってボトルネックとなる。
本稿では,高次元表現性を維持するために,クエリとキーを$k$sparseコードとして表現するスパース特徴注意法を提案する。
GPT-2とQwen3の事前トレーニングで、SFAは密度の高いベースラインにマッチし、最高2.5タイムのスピードを向上し、FLOPとKVキャッシュを50%近く削減した。
論文 参考訳(メタデータ) (2026-03-17T08:41:50Z) - XFACTORS: Disentangled Information Bottleneck via Contrastive Supervision [37.140199946294565]
textscXFactorsは弱制御されたVAEフレームワークで、選択された要素のセットを乱し、明示的に制御する。
提案手法は遅延容量の増加とともに精度良くスケールし,実世界のデータセットCelebAで評価する。
論文 参考訳(メタデータ) (2026-01-29T13:20:48Z) - Towards Implicit Aggregation: Robust Image Representation for Place Recognition in the Transformer Era [60.09990228573728]
いくつかの学習可能なアグリゲーショントークンを導入し、特定のトランスフォーマーブロックの前にパッチトークンにプリコンパイルする。
これらのトークンはすべて、固有の自己認識機構を通じて、共同で処理され、世界規模で相互作用する。
提案手法は,複数のVPRデータセットにおける最先端の手法よりも効率が高く,MSLSチャレンジリーダーボードで1位にランクインする。
論文 参考訳(メタデータ) (2025-11-08T14:35:11Z) - Semantic Equitable Clustering: A Simple and Effective Strategy for Clustering Vision Tokens [57.37893387775829]
我々はSemantic Equitable Clustering(SEC)という,高速かつバランスの取れたクラスタリング手法を導入する。
SECは、グローバルなセマンティックな関連性に基づいてトークンを効率的かつ直接的な方法でクラスタ化する。
視覚言語コネクタとして機能する汎用視覚バックボーンであるSECViTを提案する。
論文 参考訳(メタデータ) (2024-05-22T04:49:00Z) - Token Fusion: Bridging the Gap between Token Pruning and Token Merging [71.84591084401458]
ビジョントランスフォーマー(ViT)はコンピュータビジョンの強力なバックボーンとして登場し、多くの伝統的なCNNを上回っている。
計算オーバーヘッドは、主に自己アテンション機構によるもので、リソース制約のあるエッジデバイスへのデプロイが困難になる。
トークンプルーニングとトークンマージの両方のメリットを両立させる手法であるToken Fusion(ToFu)を紹介する。
論文 参考訳(メタデータ) (2023-12-02T04:29:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。