論文の概要: Interior interpretability with attention rollout: contraction and propagation profiles in Transformers
- arxiv url: http://arxiv.org/abs/2607.22367v1
- Date: Fri, 24 Jul 2026 14:51:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.156257
- Title: Interior interpretability with attention rollout: contraction and propagation profiles in Transformers
- Title(参考訳): 注意ロールアウトによる内部解釈可能性:変圧器の収縮と伝播プロファイル
- Abstract要約: 本稿では,内部モデル組織における伝搬的視点であるEmphinterior Interpretabilityを紹介する。
特徴トークン間のアテンションによる伝搬を符号化する行確率演算子としてロールアウトを解釈する。
- 参考スコア(独自算出の注目度): 17.72586636966418
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Feature-attribution methods assign scores relating input variables to a model's output, but do not by themselves characterize how explicitly defined interaction operators compose across its intermediate layers. We introduce \emph{interior interpretability}, a propagation-based perspective on internal model organization, and instantiate it for tabular Transformers using attention rollout. We interpret rollout as a row-stochastic operator encoding attention-mediated propagation between feature tokens. By applying classical Doeblin--Dobrushin contraction theory, we show that a rollout operator with a small Dobrushin coefficient is quantitatively close to a rank-one stochastic matrix whose common row is determined by its normalized column sums. This result gives a structural interpretation to the corresponding rollout propagation profile. In Transformers trained for metabolomic age prediction, the measured rollout contraction strengthens with depth. Trained and randomly initialized models also exhibit different propagation profiles, although the present experiments do not establish the predictive relevance of individual rollout-ranked variables. Exploratory comparisons with PCA and GradientExplainer approximations to SHAP reveal localized agreement among highly ranked variables but weak agreement across complete rankings. Attention rollout is therefore used here as a diagnostic of attention-mediated propagation, not as a causal explanation or faithful attribution of the complete Transformer.
- Abstract(参考訳): 特徴属性法は、入力変数に関連するスコアをモデルの出力に割り当てるが、その中間層で明示的に定義された相互作用演算子がどのように構成するかを自身で特徴づけるものではない。
本稿では、内部モデル組織における伝搬に基づく視点である「emph{interior interpretability}」を導入し、アテンションロールアウトを用いた表型変換器のインスタンス化を行う。
特徴トークン間のアテンションによる伝搬を符号化する行確率演算子としてロールアウトを解釈する。
古典的ドブリン-ドブルシン縮合理論を適用することにより、小さなドブルシン係数を持つロールアウト作用素が、その正規化された列和によって共通の行が決定されるランク1確率行列に定量的に近接していることが示される。
この結果は、対応するロールアウト伝搬プロファイルに構造的解釈を与える。
メタボローム年齢予測のために訓練されたトランスフォーマーでは、測定されたロールアウト収縮は深さとともに強化される。
訓練されたモデルとランダムに初期化されたモデルも異なる伝搬プロファイルを示すが、本実験では個々のロールアウトランク変数の予測関連性は確立されていない。
PCA と GradientExplainer の SHAP との探索的比較により,高度にランク付けされた変数間の局所的な一致は明らかだが,完全ランク付けにおける弱い一致は明らかである。
したがって、注意を介する伝播の診断として、完全なトランスフォーマーの因果説明や忠実な帰属としてではなく、注意を介する伝播の診断として、注意のロールアウトが用いられる。
関連論文リスト
- Induction Heads Interpolate N-Grams [29.939177622666858]
誘導ヘッドは、変換器におけるコンテキスト内学習の基盤となると考えられる注意回路である。
我々は秩序$k$マルコフ連鎖で訓練された変圧器について検討し、2つの相補的平滑化機構を同定した。
この結果から,従来の統計スムース化による誘導ヘッドの機械論的解釈可能性の橋渡し,変換器は単に数えるのではなく,文脈内推定を正規化することを学ぶことが明らかとなった。
論文 参考訳(メタデータ) (2026-07-02T22:19:26Z) - Interpretable Probabilistic Medical Image Segmentation via Gaussian Process with Explicit Modelling of Annotation Bias and Variability [14.53294799919725]
本稿では,予測を画像依存の参照ロジット分布とアノテータ固有の摂動に分解するロジット空間確率的セグメンテーションフレームワークを提案する。
本手法をマルチアノテータの医用画像データセット上で評価し,アノテータ固有の摂動を明示的にモデル化することで不確実性の校正が向上することを示す。
論文 参考訳(メタデータ) (2026-06-22T11:14:26Z) - Transformers Are Born Biased: Structural Inductive Biases at Random Initialization and Their Practical Consequences [29.509249228044492]
ランダムにトレーニングされていないモデルは、ランダムな入力シーケンスにまたがる極端なトークン嗜好を示す。
極端トークンの選好は、ランダムなシード依存方向に沿ったトークン表現の収縮から生じることを示す。
論文 参考訳(メタデータ) (2026-02-05T17:37:41Z) - TensorLens: End-to-End Transformer Analysis via High-Order Attention Tensors [53.891337639229285]
高次アテンション・インタラクション接続を通して表現された入力依存線形演算子として変換器全体をキャプチャする新しい定式化である attentionLens を導入する。
本実験は,注目テンソルが,解釈可能性とモデル理解を目的としたツール開発のための強力な基盤となることを実証した。
論文 参考訳(メタデータ) (2026-01-25T19:21:25Z) - From Shortcut to Induction Head: How Data Diversity Shapes Algorithm Selection in Transformers [67.02076505996284]
本研究では, 事前学習したデータ分布の選択が, 浅層変圧器を一方の行動に向ける方法について検討する。
その結果,事前学習したトランスフォーマーのアルゴリズム的バイアスに光を当て,学習行動のデータ駆動制御に関する概念的ガイドラインを提供することができた。
論文 参考訳(メタデータ) (2025-12-21T08:10:26Z) - Entropy-Lens: The Information Signature of Transformer Computations [14.613982627206884]
語彙空間におけるトークンレベルの分布の進化を直接研究する。
我々は,各中間予測分布のシャノンエントロピーを計算し,各層に1つの解釈可能なスカラーを与える。
本稿では, 既成の冷凍変圧器からエントロピープロファイルを抽出するモデルに依存しないフレームワークであるEntropy-Lensを紹介する。
論文 参考訳(メタデータ) (2025-02-23T13:33:27Z) - Trained Transformers Learn Linear Models In-Context [39.56636898650966]
トランスフォーマーとしての注意に基づくニューラルネットワークは、意図的学習(ICL)を示す顕著な能力を示した
線形回帰問題のランダムな例に対する変圧器の訓練において、これらのモデルの予測は通常の正方形の非線形性を模倣することを示した。
論文 参考訳(メタデータ) (2023-06-16T15:50:03Z) - Latent Positional Information is in the Self-Attention Variance of
Transformer Language Models Without Positional Embeddings [68.61185138897312]
凍結変圧器言語モデルでは,自己意図の分散を縮小することにより,強い位置情報を符号化する。
本研究は, 位置埋め込みを廃止する決定を正当化し, トランスフォーマー言語モデルのより効率的な事前学習を容易にすることに役立つ。
論文 参考訳(メタデータ) (2023-05-23T01:03:40Z) - Which Invariance Should We Transfer? A Causal Minimax Learning Approach [18.71316951734806]
本稿では、因果的観点からの包括的ミニマックス分析について述べる。
最小の最悪のリスクを持つサブセットを探索する効率的なアルゴリズムを提案する。
本手法の有効性と有効性は, 合成データとアルツハイマー病の診断で実証された。
論文 参考訳(メタデータ) (2021-07-05T09:07:29Z) - Learning Disentangled Representations with Latent Variation
Predictability [102.4163768995288]
本稿では,潜在不整合表現の変動予測可能性について述べる。
逆生成プロセス内では、潜時変動と対応する画像対の相互情報を最大化することにより、変動予測可能性を高める。
本研究では,潜在表現の絡み合いを測るために,基礎的構造的生成因子に依存しない評価指標を開発する。
論文 参考訳(メタデータ) (2020-07-25T08:54:26Z) - Self-Attention Attribution: Interpreting Information Interactions Inside
Transformer [89.21584915290319]
本稿では,トランスフォーマー内の情報相互作用を解釈する自己帰属属性法を提案する。
本研究は,BERT に対する非目標攻撃の実装において,その属性を敵対パターンとして用いることができることを示す。
論文 参考訳(メタデータ) (2020-04-23T14:58:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。