論文の概要: An equality condition for the Dobrushin bound on attention rollout and how often it holds in trained transformers
- arxiv url: http://arxiv.org/abs/2610.05558v1
- Date: Sun, 04 Oct 2026 21:46:59 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:27:07.270721
- Title: An equality condition for the Dobrushin bound on attention rollout and how often it holds in trained transformers
- Title(参考訳): 注意ロールアウトに束縛された同種同性条件と訓練用変圧器における保持頻度
- Abstract要約: 等式は、あるトークン対が$(A)$に達することが相互に自己支配的である場合に限り成り立つ。
均一にランダムな行列は24-30%の時間しか満たさない。
- 参考スコア(独自算出の注目度): 0.0
- License:
- Abstract: The Dobrushin coefficient of each attention-rollout factor satisfies $κ(\frac12(I+A))\le\frac12(1+κ(A))$, and multiplying these inequalities over layers bounds the coefficient of the whole rollout. We characterise exactly when the layerwise bound is tight: equality holds if and only if some token pair attaining $κ(A)$ is mutually self-dominant - each of the two attends to itself at least as strongly as the other attends to it. The condition is far from automatic: uniformly random stochastic matrices satisfy it only 24-30% of the time. When tested on the head-averaged attention of each individual input and restricted to content tokens - image patches, words or tabular features, excluding cls, register and separator tokens - the condition holds for essentially every input at every layer of DINOv2 (three model sizes), RoBERTa and DistilBERT. In the supervised models DeiT-B and ViT-B/16 it holds for 91% and 64% of input-layer pairs respectively, with all failures occurring late in depth. In FT-Transformer trained on two standard tabular benchmarks it holds for only 11-44% of input-layer pairs. The special tokens account for almost all failures in DINOv2 and the language models: when they are included, the condition holds for only 82-97% of input-layer pairs.
- Abstract(参考訳): 各注目ロールアウト係数のドブルシン係数は$κ(\frac12(I+A))\le\frac12(1+κ(A))$を満足し、これらの不等式を層上で乗算することはロールアウト全体の係数を束縛する。
等式が成り立つのは、$κ(A)$に達するトークン対が相互に自己支配的であるときであり、一方がそれに参加するときと同様に、少なくとも他方がそれに参加するときと同じくらい強いときに限りである。
均一にランダムな確率行列は24~30%の時間しか満たさない。
DINOv2(3つのモデルサイズ)、RoBERTa、DistilBERTの各レイヤのすべての入力に対して、条件が本質的に保持される。
教師付きモデルであるDeiT-BとViT-B/16では、入力層対の91%と64%が保持され、すべての障害は深さが遅い。
FT-Transformerは2つの標準表型ベンチマークでトレーニングされ、入力層対の11-44%しか保持していない。
特別なトークンはDINOv2のほとんど全ての障害と言語モデルの原因となっている:それらが含まれていると、入力層対の82-97%しか状態が保持されない。
関連論文リスト
- GlitchPatch: Repairing Glitch Tokens in Frozen Language Models via Local Retokenization [52.5302018047534]
グリッチトークンは異常な語彙のエントリであり、大きな言語モデルが一貫性のない出力を生成する可能性がある。
GlitchPatchは,局所的再トークン化に基づくフリーズ言語モデルの修復フレームワークである。
6つのトークンライザファミリーにまたがる10モデルの実験では、GlitchPatchの平均固定率は85.10%であり、最強のベースラインを14.37ポイント上回っている。
論文 参考訳(メタデータ) (2026-10-03T09:44:13Z) - On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - Nested Byte-Level Vocabularies Are Cheap to Deploy and Expensive to Share: A Pre-Registered Negative Result [0.0]
一つの言語モデルが複数の語彙サイズで動作可能であることを示す。
コントロールトークンはアクティブサイズを示し、その埋め込みと出力ヘッドをスライスすることで任意のトレーニングされたサイズにデプロイされる。
キャップトークンも出力制限もないコントロールも同じように堅牢であり、条件付けよりも多粒度トレーニングに寄与する。
論文 参考訳(メタデータ) (2026-08-28T10:13:32Z) - HAP: Head-Adaptive Visual Token Pruning via Cross-Modal Alignment [76.68875424389057]
既存の手法では、すべての頭部に一様にテキストから視覚への注意を平均化することで、各視覚トークンをスコアリングする。
頭が不一致で 平均的に支配され 背景のトークンを増幅し きめ細かな手がかりを 吐き出す
本稿では,各頭部のプロンプトと画像領域の整合性を評価する指標であるPAQ(Prompt-Grounded Attention Quality)を提案する。
論文 参考訳(メタデータ) (2026-08-24T23:55:36Z) - IndicQE-APE: A Benchmark for Quality Estimation and Automatic Post-Editing for Indic Languages [77.88427845181154]
我々はWMT 2020-2024の共有タスクの系統を、英語のリソースを拡張してインディクシーに集約する:9つの方向対に対して126,754ドルのインスタンス。
セグメントレベルのQEでは,LSMが6つ,COMETが3つ,APEでは3つのシステムをベンチマークした。
論文 参考訳(メタデータ) (2026-08-17T09:50:52Z) - RUTA: Principled Visual Token Allocation via Rate-Utility Optimization [39.416519746709305]
高解像度の画像と長いビデオは、マルチモーダル推論ときめ細かい知覚のためのリッチコンテキストの視覚言語モデルを提供する。
本稿では,トークンが保持するトークンを共同学習することでLLM前還元を行う,原則化された利率-実用トークン割当手法であるRUTAを紹介する。
RUTAは、ダウンストリームタスク損失と期待されるトークン使用量のバランスをとる、ペナルティ化されたレートユーティリティーの目標で最適化されている。
論文 参考訳(メタデータ) (2026-08-04T18:37:26Z) - Kernelized Linear Attention: Breaking the Capacity Wall with Symmetric Cones [4.847095054351615]
リニアアテンションは一定時間繰り返しの推論を約束するが、連想的リコールによって著しく低下する。
Kernelized Linear Attention Activations (KATA)を紹介します。
ランク1の正の半定的な特徴が良好なキャパシティ-干渉トレードオフをもたらすことを示す。
論文 参考訳(メタデータ) (2026-07-19T21:46:09Z) - All for One: LLMs Solve Mental Math at the Last Token With Information Transferred From Other Tokens [14.890542559477906]
理論的には、因果自己注意層と多層パーセプトロン層の組み合わせにより、全てのトークンが先行する全てのトークンに基づいて情報にアクセスし、計算することができる。
初期層における入力固有のトークン計算の抑制、次の数層におけるトークン位置間の情報伝達経路の制限、残りの層における最後のトークンにおける全ての計算を強制する3つのステップについて検討する。
論文 参考訳(メタデータ) (2025-09-11T17:41:29Z) - Focus on the Core: Efficient Attention via Pruned Token Compression for Document Classification [6.660834045805309]
BERTのような事前訓練されたトランスフォーマーは計算コストのかかる自己保持機構に悩まされる。
トークンプルーニングとトークンの組み合わせという2つの戦略を統合することを提案する。
さまざまなデータセットによる実験は、ベースラインモデルよりも優れたパフォーマンスを示している。
論文 参考訳(メタデータ) (2024-06-03T12:51:52Z) - Token Fusion: Bridging the Gap between Token Pruning and Token Merging [71.84591084401458]
ビジョントランスフォーマー(ViT)はコンピュータビジョンの強力なバックボーンとして登場し、多くの伝統的なCNNを上回っている。
計算オーバーヘッドは、主に自己アテンション機構によるもので、リソース制約のあるエッジデバイスへのデプロイが困難になる。
トークンプルーニングとトークンマージの両方のメリットを両立させる手法であるToken Fusion(ToFu)を紹介する。
論文 参考訳(メタデータ) (2023-12-02T04:29:19Z) - Transformers meet Stochastic Block Models: Attention with Data-Adaptive
Sparsity and Cost [53.746169882193456]
最近の研究は、自己注意の二次的コストを克服するために、様々なスパークアテンションモジュールを提案している。
本稿では,それぞれの注意を混合メンバーシップブロックモデルで表現することで,両方の問題を解決するモデルを提案する。
我々のモデルは、以前の効率的な変種とオリジナルのトランスフォーマーより優れており、十分に注目されています。
論文 参考訳(メタデータ) (2022-10-27T15:30:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。