論文の概要: SeerAttention-R: Sparse Attention Adaptation for Long Reasoning
- arxiv url: http://arxiv.org/abs/2506.08889v1
- Date: Tue, 10 Jun 2025 15:17:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-06-11 15:11:42.66878
- Title: SeerAttention-R: Sparse Attention Adaptation for Long Reasoning
- Title(参考訳): SeerAttention-R: Sparse Attention Adaptation for Long Reasoning
- Authors: Yizhao Gao, Shuming Guo, Shijie Cao, Yuqing Xia, Yu Cheng, Lei Wang, Lingxiao Ma, Yutao Sun, Tianzhu Ye, Li Dong, Hayden Kwok-Hay So, Yu Hua, Ting Cao, Fan Yang, Mao Yang,
- Abstract要約: SeerAttention-Rは、推論モデルの長い復号化に特化して設計されたスパースアテンションフレームワークである。
自動回帰デコードに対応するためにクエリプーリングを取り除きながら、自己蒸留ゲーティング機構を通じて、注意の間隔を学習する設計を維持している。
我々は、わずか0.4BトークンでトレーニングされたSeerAttention-Rが、AIMEベンチマークで4Kトークン予算でほぼ無作為な推論精度を維持することを実証した。
- 参考スコア(独自算出の注目度): 35.29765487696741
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce SeerAttention-R, a sparse attention framework specifically tailored for the long decoding of reasoning models. Extended from SeerAttention, SeerAttention-R retains the design of learning attention sparsity through a self-distilled gating mechanism, while removing query pooling to accommodate auto-regressive decoding. With a lightweight plug-in gating, SeerAttention-R is flexible and can be easily integrated into existing pretrained model without modifying the original parameters. We demonstrate that SeerAttention-R, trained on just 0.4B tokens, maintains near-lossless reasoning accuracy with 4K token budget in AIME benchmark under large sparse attention block sizes (64/128). Using TileLang, we develop a highly optimized sparse decoding kernel that achieves near-theoretical speedups of up to 9x over FlashAttention-3 on H100 GPU at 90% sparsity. Code is available at: https://github.com/microsoft/SeerAttention.
- Abstract(参考訳): 本稿では,推論モデルの長い復号化に特化して,スパースアテンションフレームワークであるSeerAttention-Rを紹介する。
SeerAttentionから拡張されたSeerAttention-Rは、自動回帰デコードに対応するためにクエリプーリングを取り除きながら、自己蒸留型ゲーティング機構を通じて、注意孔の学習設計を維持している。
軽量なプラグインゲーティングでは、SeerAttention-Rは柔軟で、元のパラメータを変更することなく既存の事前訓練モデルに簡単に統合できる。
約0.4BのトークンでトレーニングされたSeerAttention-Rは,AIMEベンチマークの4Kトークン予算とほぼ無作為な推論精度を,スパークスなアテンションブロックサイズ(64/128)で維持することを示した。
TileLang を用いて,H100 GPU 上の FlashAttention-3 の約9倍の近理論的高速化を実現する,高度に最適化されたスパースデコードカーネルを開発した。
コードは、https://github.com/microsoft/SeerAttention.comで入手できる。
関連論文リスト
- Re-ttention: Ultra Sparse Visual Generation via Attention Statistical Reshape [23.01286982392074]
大きなボトルネックは、複雑性が解像度とビデオ長で2倍にスケールする注意機構である。
既存の技術は、非常に高い空間レベルにおける視覚的品質の維持に失敗し、無視できない計算オーバーヘッドを発生させる可能性がある。
本稿では,視覚生成モデルに非常に注意を払わせるRe-ttentionを提案する。
論文 参考訳(メタデータ) (2025-05-28T22:39:12Z) - SpecReason: Fast and Accurate Inference-Time Compute via Speculative Reasoning [14.020244011380063]
SpecReasonは、LEM推論を加速するシステムである。
最終回答の正確性を維持する上で、思考トークンのセマンティックな柔軟性を利用する。
バニラLEM推論よりも1.4-3.0times$のスピードアップを実現している。
論文 参考訳(メタデータ) (2025-04-10T16:05:19Z) - SeerAttention: Learning Intrinsic Sparse Attention in Your LLMs [10.702409298302547]
SeerAttentionは、大規模言語モデル自体からブロックレベルの注意空間を学習する。
Mixture of Experts (MoE)のゲーティング機構にインスパイアされたSeerAttentionは、学習可能なゲートで従来の注意を増進する。
評価の結果,SeerAttention は長文プリフィルの精度向上と低レイテンシ化を実現していることがわかった。
論文 参考訳(メタデータ) (2024-10-17T07:07:09Z) - DISTFLASHATTN: Distributed Memory-efficient Attention for Long-context LLMs Training [82.06732962485754]
FlashAttentionは、1つのGPU上でのトレーニングトランスフォーマーベースの大規模言語モデル(LLM)において、2次ピークメモリの使用を線形に削減する。
本研究では,長期LLM学習に最適化されたメモリ効率の高い注意機構であるDisTFLASHATTNを紹介する。
最近のRing AttentionやDeepSpeed-Ulyssesと比較して、1.67xと1.26 - 1.88xのスピードアップを実現している。
論文 参考訳(メタデータ) (2023-10-05T03:47:57Z) - Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs [82.08922896531618]
大規模言語モデル(LLM)における生成推論のメモリフットプリントを削減するプラグイン・アンド・プレイ方式である適応KVキャッシュ圧縮を導入する。
我々は,アテンションモジュールの本質的な構造を明らかにするために,ターゲットプロファイリングを行う。
認識された構造に基づいて、我々はKVキャッシュを適応的に構築する: 注意頭上の長距離コンテキストを排除し、局所的なコンテキストを強調し、特別なトークンを中心とした注意頭上の特別なトークンを排除し、すべてのトークンに広く参加する注目頭に対して標準のKVキャッシュのみを使用する。
論文 参考訳(メタデータ) (2023-10-03T05:17:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。