論文の概要: Depth-Staggered Fibonacci Spacing for Sparse Attention: Static Schedules Beat Learned Dilation and Extrapolate Where Dense Attention Fails
- arxiv url: http://arxiv.org/abs/2606.28560v1
- Date: Fri, 26 Jun 2026 19:28:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.601513
- Title: Depth-Staggered Fibonacci Spacing for Sparse Attention: Static Schedules Beat Learned Dilation and Extrapolate Where Dense Attention Fails
- Title(参考訳): スパースアテンションのための深さ重み付きフィボナッチスペーシング:静的スケジューリングは、高濃度アテンションが失敗した場合の学習的拡張と外挿に勝る
- Abstract要約: 本研究では,各問合せが局所的に密集したウィンドウとフィボナッチ空間のオフセットに付随するスパース自己注意について検討する。
1つのマッチしたレシピで訓練された21の言語モデルに対して、深さにわたってアルファを設定する4つの方法を比較した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study sparse self-attention in which each query attends to a dense local window plus a set of Fibonacci-spaced offsets, with a per-layer scalar alpha that compresses or expands the spacing. Across 21 language models trained under one matched recipe (60M parameters, 512 hidden, 16 layers, 426M tokens), we compare four ways of setting alpha across depth: fixed, per-layer learned, a static linear stagger, and a coprime (anti-gridding) reassignment of that stagger, together with a reach-matched power-of-2 control. Three results stand out. First, a static per-layer stagger improves perplexity over both fixed and learned alpha, and the gain is base-agnostic: applying the same stagger to a power-of-2 base lifts it above fixed Fibonacci and to parity with learned Fibonacci attention. Second, learning per layer is inert: it does not beat the static schedule and costs roughly five times the inference latency. Third, and most consequential, all sparse variants extrapolate to four times their training length with little or no degradation, whereas a recipe-matched dense baseline collapses (perplexity rises by 201% at 4x length); we attribute this to fixed-offset attention only ever querying relative positions seen during training. We also report two honest negatives: at training length the best sparse model has about 26% higher perplexity than the dense baseline, and the staggering gain is uniform across context positions rather than concentrated at long range.
- Abstract(参考訳): 本研究では、各クエリが密集したローカルウィンドウとフィボナッチ空間のオフセットのセットに付随するスパース自己注意(sparse self-attention)を層ごとのスカラーアルファを用いて検討し、間隔を圧縮または拡大する。
1つのマッチしたレシピ(60Mパラメータ、512の隠蔽、16層のトークン、426Mトークン)でトレーニングされた21の言語モデルに対して、固定された層ごとの学習、静的な線形スタガー、そしてそのスタガーのコリメ(反グライディング)の再割り当てと、リーチマッチングされたパワーオブ2コントロールの4つの方法を比較した。
3つの結果が浮き彫りだ。
まず、静的な層ごとのスタッガーは、固定されたアルファと学習されたアルファの両方の難易度を改善し、ゲインはベースに依存しない: パワーオブ2ベースに同じスタッガーを適用すると、固定されたフィボナッチの上に持ち上げ、学習されたフィボナッチの注意と同等になる。
第2に、レイヤごとの学習は不必要である – 静的スケジュールを破ることはなく、推論レイテンシの約5倍のコストがかかる。
第3に, ほぼすべてのスパース変種がトレーニング期間の4倍, あるいはほとんど劣化せず, レシピマッチングされた高密度ベースラインが崩壊する(難易度は4倍に201%上昇する)。
また, トレーニング長において, 最良スパースモデルが高密度ベースラインよりも約26%高いパープレキシティを有しており, 長時間集中するよりも, ステージングゲインがコンテキスト位置にわたって均一であることを示す。
関連論文リスト
- From Concentration to Differentiation and Back: Routing Effective Rank in MoE Reasoning Cohorts [61.695980784491475]
テストタイムスケーリングは、推論ロールアウトのコホートを生成するが、推論が展開するにつれて内部計算がどのように再編成されるかについて、標準的なラベルのない説明はない。
本稿では,MoEの専門家による類似性から構築したクロスロールアウトグラフのエントロピー有効次元性であるルーティング有効ランクデフを導入する。
論文 参考訳(メタデータ) (2026-09-06T05:43:22Z) - On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models [75.80275843320511]
トランスフォーマーのバックボーンを固定したまま、各トークンにより多くの計算を割り当てることで、既存のバックボーンが改善を続けることができるかどうかを検討する。
継続事前学習中に適用されたシーケンス長スケーリング手法であるHidden Decodingを提案する。
論文 参考訳(メタデータ) (2026-07-09T07:37:59Z) - A Decomposable Probe for Few-Step Diffusion Models: Prompt, Latent, and Score Selectivity across Backbone Families and Distillation Paradigms [0.0]
拡散学生は50~1-8のネットワーク評価からテキスト・ツー・イメージ・推論を減らした。
我々はスカラーを3つの層に沿って制御された摂動を注入する分解可能なプローブで置き換える。
Inception機能に対するブートストラップ中間のBures W22選択率について報告する。
論文 参考訳(メタデータ) (2026-07-03T12:18:24Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders [123.58723804218151]
ビジョンファウンデーションモデルは、自己注意の二次的なコストによってボトルネックとなる。
2次元空間伝搬伝搬に基づくC-GSPNを提案する。
論文 参考訳(メタデータ) (2026-05-30T14:29:43Z) - Scheduled Style Injection: Expanding the Style-Content Pareto Frontier in Training-Free Diffusion-based Style Transfer [0.0]
事前学習拡散モデルによるスタイル伝達は急速に進んでいる。
モデルの中で、スタイルインジェクションはどこで最強になるべきか?
指導的なトレーニング不要なメソッドであるStyleIDは、すべてのレイヤとタイムステップに一様に単一のグローバルパラメータ(ガンマ)を使用する。
このトレードオフは必然的に厳格であることを示す。
論文 参考訳(メタデータ) (2026-05-26T04:39:40Z) - Beyond Perplexity: A Geometric and Spectral Study of Low-Rank Pre-Training [11.118638230247951]
検証の難易度が近い場合でも,低ランクの手法はフルランクの訓練と同等ではなく,互いに同等ではないことを示す。
低ランクアクティベーションは、トレーニングが進むにつれて、後層のフルランクから分岐し、GaLoreはフルランクを追跡する。
論文 参考訳(メタデータ) (2026-05-13T15:11:37Z) - ASAP: Amortized Doubly-Stochastic Attention via Sliced Dual Projection [2.51764254245076]
Amortized Doubly-Stochastic Attention via Sliced Dual Projection。
二重確率層をシンクホーンで訓練し、推論時の反復スケーリングループを固定スライスダイアル演算子に置き換える。
正確な1次元のカントロヴィチポテンシャルからシンクホーンクエリサイドの双対への軽量パラメトリックマップを学習し、2面のエントロピーc-変換でアテンションプランを再構築する。
論文 参考訳(メタデータ) (2026-05-13T01:48:46Z) - ARMOR: High-Performance Semi-Structured Pruning via Adaptive Matrix Factorization [99.96330641363396]
ARMOR: (Adaptive Representation with Matrix-factorization) は、新しい1ショットのポストトレーニングプルーニングアルゴリズムである。
ARMORは重量を直接刈る代わりに、各重量行列を2:4のスパースコアに分解する。
ARMORは、幅広いダウンストリームタスクとパープレキシティ評価において、最先端の2:4プルーニング手法よりも一貫して、はるかに優れています。
論文 参考訳(メタデータ) (2025-10-07T02:39:20Z) - RocketStack: Level-aware deep recursive ensemble learning framework with adaptive feature fusion and model pruning dynamics [0.0]
RocketStackは、レベルの認識された再帰的なアンサンブルフレームワークである。
各レベルでより弱い学習者を徐々に引き起こし、過剰な複雑さを伴わずにより深い積み重ねを可能にします。
33のデータセットのうち、線形トレンド試験では、ほとんどの変種で深度で精度が上昇したことが確認された。
論文 参考訳(メタデータ) (2025-06-20T12:52:44Z) - A Stable Whitening Optimizer for Efficient Neural Network Training [99.7641280234926]
アルゴリズムのシャンプー系をベースとして,3つの重要な問題を同定・緩和し,SPlus法を提案する。
まず,行列逆が長期にわたってキャッシュされる場合,素早いシャンプーは分岐しがちであることがわかった。
第二に、ネットワーク幅をまたいで学習率の伝達を可能にするために、形状認識スケーリングを適用する。
第3に,高い学習率によってパラメータノイズが大きくなり,より高速な学習をブロックする簡単な反復学習方式を提案する。
論文 参考訳(メタデータ) (2025-06-08T18:43:31Z) - S2-Attention: Hardware-Aware Context Sharding Among Attention Heads [49.1454481007861]
スパースアテンションは、コンテキスト内のトークンのサブセットに選択的に出席する。
スパース・アテンションが今日の大規模言語モデルでモデルの品質を維持することができるかどうかは不明だ。
本稿では,Sparsely-Sharded(S2) attention, a Triton library that provide kernel optimization for sparse attention for sparse attention to customizable per-head and per-context-range levels。
論文 参考訳(メタデータ) (2024-07-25T00:27:07Z) - Integral Continual Learning Along the Tangent Vector Field of Tasks [112.02761912526734]
本稿では,特殊データセットからの情報を段階的に組み込んだ軽量連続学習手法を提案する。
ソースデータセットの0.4%まで小さく、小さな固定サイズのメモリバッファを保持しており、単純な再サンプリングによって更新される。
提案手法は,異なるデータセットに対して,様々なバッファサイズで高い性能を実現する。
論文 参考訳(メタデータ) (2022-11-23T16:49:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。