論文の概要: Do New Attention Mechanisms Actually Fix Attention Sinks at Million-Token Context?
- arxiv url: http://arxiv.org/abs/2609.08574v1
- Date: Tue, 08 Sep 2026 11:10:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.63327
- Title: Do New Attention Mechanisms Actually Fix Attention Sinks at Million-Token Context?
- Title(参考訳): 新しい注意機構は、数百万のコンテキストで注意シンクを修正するか?
- Abstract要約: ゲーテッド・アテンションは、NeurIPS 2025でトークン・アテンションを46.7%から4.8%に下げた。
この論文は、この修正がそのジャンプを生き残るかどうかを問う。
SinkProbeは、シンク質量、大規模なアクティベーション、位置決定されたリコール、およびリカレンシギャップを測定するスイートです。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long context language models now advertise windows of one million tokens, but two habits limit how much of that window is used. Attention heads with nothing useful to read still spend their budget on the first token, which is called the attention sink, and where a fact sits in the context changes whether the model finds it. Gated attention cut first token attention from 46.7 percent to 4.8 percent at NeurIPS 2025, and Kimi K3 pairs that idea with Kimi Delta Attention and Attention Residuals behind a one million token window, eight times past the range where these diagnostics have been reported. This paper asks whether the fix survives that jump. We build SinkProbe, a suite that measures sink mass, massive activation, position resolved recall and the recency gap, and apply it to four small models that differ only in how they mix tokens and depth. Three results follow. The training objective produces the sink, not the architecture. Gating did not reproduce its published effect at our scale. Sink mass, activations and position bias moved independently. Code, data and the measurement protocol are released at https://github.com/sararizwan7/Attention-Mechanisms-in-1M-Context-Window
- Abstract(参考訳): 長期のコンテキスト言語モデルは100万のトークンのウィンドウを宣伝するが、2つの習慣はウィンドウの使用量を制限している。
注意頭は、注意シンクと呼ばれる最初のトークンに予算を費やし、モデルがそれを見つけるかどうかの状況において事実が変化する。
注意喚起されたトークンは、NeurIPS 2025で46.7%から4.8%に減少し、Kimi K3はKimi Delta AttentionとAttention Residualsのアイデアを100万のトークンウィンドウの背後に置いており、これらの診断が報告された範囲を8倍超えた。
この論文は、この修正がそのジャンプを生き残るかどうかを問う。
SinkProbeは、シンク質量、大規模なアクティベーション、位置決定されたリコール、およびリカレンシギャップを測定するスイートで、トークンと深さの混合方法だけが異なる4つの小さなモデルに適用します。
3つの結果が続く。
トレーニングの目的は、アーキテクチャではなく、シンクを生成することです。
ゲーティングは我々の規模で公表された効果を再現しなかった。
シンク質量,アクティベーション,位置バイアスは独立に移動した。
コード、データ、測定プロトコルはhttps://github.com/sararizwan7/Attention-Mechanisms-in-1M-Context-Windowでリリースされる
関連論文リスト
- Gathered, Not Admitted: How Attention Brings a Latent Variable into Verbalizable Form [0.03038255798961237]
ヤコビアンレンズを使ったオープンウェイトモデルでテストしたところ、5つの腕が同じコンテキストを共有しているベンチマークでは、それを予測するゲートは見つからなかった。
クエリされた位置で後で読みやすい形式を生成するのは、奥行きの窓の中で注意を介する集まりである。
論文 参考訳(メタデータ) (2026-08-15T04:12:24Z) - More Structure, Not More Capacity: Object-Centric Representations for Visuomotor Imitation Learning [54.65906330923846]
対象中心のスロット表現は、事前学習された視覚モデルに代わる構造化された代替物であることを示す。
トークンの16倍の高密度なパッチグリッドは、グローバル機能に匹敵するパフォーマンスはない。
明示的な2D空間目標とネイティブ解像度レンダリングにより、全システムは68.7$pm$4.2%まで上昇し、特権付き3Dオーラクルの上界の直ぐ下にある。
論文 参考訳(メタデータ) (2026-07-10T10:35:24Z) - Output Vector Editing for Memorization Mitigation in Large Language Models [68.30351930772788]
大規模な言語モデルは、トレーニングデータからシーケンスを記憶し、再現し、プライバシ、著作権、セキュリティリスクを生み出す。
既存のニューロンレベルの緩和方法は、ニューロンの活性化をゼロにすることで編集を等しくするが、活性化はニューロンが関与するかどうかのみを制御する。
記憶継続に責任を負うニューロンの小さな集合を探索する制約最適化編集である出力ベクトル編集を提案する。
論文 参考訳(メタデータ) (2026-06-17T07:29:18Z) - The Gordian Knot for VLMs: Diagrammatic Knot Reasoning as a Hard Benchmark [5.223799635449313]
ノットベンチは1,951個の素結びのプロトタイプから858,318イメージのコーパスを合成する。
14のタスクは、等価判断、移動予測、識別、およびクロスモーダルグラウンドの4つのファミリーにまたがる。
両ベンダで64Kのアウトプット・トケンが一致した予算の下で、クロード・オプス4.7とGPT-5をそれぞれ検討し、評価した。
論文 参考訳(メタデータ) (2026-05-11T02:44:30Z) - Attention Needs to Focus: A Unified Perspective on Attention Allocation [37.34801068995858]
Transformer アーキテクチャは現代のLarge Language Models (LLM) の基盤である
標準的な注意機構は、表現的崩壊と注意シンクという、文書化された問題に悩まされている。
どちらも共通のルート(不適切な注意割り当て)にトレース可能である、と論じて、統一された視点を提示します。
論文 参考訳(メタデータ) (2026-01-01T08:39:15Z) - Kimi K2: Open Agentic Intelligence [118.78600121345099]
Kimi K2は32億の活性化パラメータと1兆の総パラメータを持つ大きな言語モデルである。
MuonClipに基づいて、K2は15.5兆のトークンで事前訓練され、損失のスパイクはゼロだった。
Kimi K2は、オープンソース非思考モデルの間で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-07-28T05:35:43Z) - Simple linear attention language models balance the recall-throughput tradeoff [60.06020449520365]
線形およびすべり窓の注意を結合したシンプルなアーキテクチャであるBASEDを提案する。
我々は、最大1.3bパラメータの言語モデルをトレーニングし、BASEDがパープレキシティにおいて最強のサブクワッドラティックモデルと一致し、実世界のリコール集約タスクにおいて6.22の精度ポイントでそれらのモデルを上回っていることを示す。
論文 参考訳(メタデータ) (2024-02-28T19:28:27Z) - How can objects help action recognition? [74.29564964727813]
より優れたビデオモデルを設計するために、オブジェクトの知識をどのように利用できるかを検討する。
まず,入力トークンの少数の保持が可能なオブジェクト誘導型トークンサンプリング戦略を提案する。
第二に、オブジェクト情報で特徴表現を豊かにするオブジェクト認識アテンションモジュールを提案する。
論文 参考訳(メタデータ) (2023-06-20T17:56:16Z) - Robustifying Token Attention for Vision Transformers [72.07710236246285]
ビジョントランスフォーマー(ViT)は、一般的な汚職の存在下でも精度が著しく低下している。
本稿では,2つの一般的な手法を用いて,より注意を安定させる2つの手法を提案する。
まず,Token-Aware Average Pooling (TAP)モジュールは,各トークンの局所的近傍に注意機構に参加することを奨励する。
第二に、出力トークンは、ほんの少しだけに集中するのではなく、多様な入力トークンの集合から情報を集約するように強制する。
論文 参考訳(メタデータ) (2023-03-20T14:04:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。