論文の概要: Switch Attention: Towards Dynamic and Fine-grained Hybrid Transformers
- arxiv url: http://arxiv.org/abs/2603.26380v1
- Date: Fri, 27 Mar 2026 13:04:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-30 21:49:48.510883
- Title: Switch Attention: Towards Dynamic and Fine-grained Hybrid Transformers
- Title(参考訳): スイッチ注意:動的および微細なハイブリッドトランスを目指して
- Authors: Yusheng Zhao, Hourun Li, Bohan Wu, Jingyang Yuan, Meng Zhang, Yichun Yin, Lifeng Shang, Ming Zhang,
- Abstract要約: そこで本研究では,フルアテンションとスライディングウィンドウアテンション間の動的かつきめ細かなルーティングを実現するハイブリッドトランスを提案する。
SwiAttnは、計算をグローバル情報集約のためのフルアテンションブランチか、効率的な局所パターンマッチングのためのスライディングウィンドウブランチに動的にルーティングする。
実験は、通常の(4K)と長い(32K)コンテキスト長の両方にわたる23のベンチマークデータセットで実施される。
- 参考スコア(独自算出の注目度): 34.75985836977073
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: The attention mechanism has been the core component in modern transformer architectures. However, the computation of standard full attention scales quadratically with the sequence length, serving as a major bottleneck in long-context language modeling. Sliding window attention restricts the context length for better efficiency at the cost of narrower receptive fields. While existing efforts attempt to take the benefits from both sides by building hybrid models, they often resort to static, heuristically designed alternating patterns that limit efficient allocation of computation in various scenarios. In this paper, we propose Switch Attention (SwiAttn), a novel hybrid transformer that enables dynamic and fine-grained routing between full attention and sliding window attention. For each token at each transformer layer, SwiAttn dynamically routes the computation to either a full-attention branch for global information aggregation or a sliding-window branch for efficient local pattern matching. An adaptive regularization objective is designed to encourage the model towards efficiency. Moreover, we adopt continual pretraining to optimize the model, transferring the full attention architecture to the hybrid one. Extensive experiments are conducted on twenty-three benchmark datasets across both regular (4K) and long (32K) context lengths, demonstrating the effectiveness of the proposed method.
- Abstract(参考訳): 注目のメカニズムは、現代のトランスフォーマーアーキテクチャのコアコンポーネントである。
しかし、標準的なフルアテンションの計算はシーケンス長と2次的にスケールし、長文言語モデリングにおいて大きなボトルネックとなる。
スライディングウィンドウアテンションは、より狭い受容フィールドのコストで、より効率的なコンテキスト長を制限する。
既存の取り組みはハイブリッドモデルを構築することによって双方の利点を享受しようとするが、様々なシナリオにおける効率的な計算の割り当てを制限する、静的でヒューリスティックに設計された交互パターンに頼っていることが多い。
本稿では,スライディングウィンドウアテンションとフルアテンション間の動的かつきめ細かなルーティングを実現するハイブリッドトランスであるスイッチアテンション(SwiAttn)を提案する。
各トランス層におけるトークンに対して、SwiAttnは動的に計算をグローバル情報集約のためのフルアテンションブランチまたは効率的な局所パターンマッチングのためのスライディングウィンドウブランチにルーティングする。
適応正則化の目的は、モデルを効率性に向かわせるように設計されている。
さらに、モデルを最適化するために継続事前訓練を採用し、完全な注意アーキテクチャをハイブリッドに転送する。
提案手法の有効性を実証するため,正規(4K)および長(32K)の文脈長にわたる23のベンチマークデータセットを用いて実験を行った。
関連論文リスト
- AdaFuse: Accelerating Dynamic Adapter Inference via Token-Level Pre-Gating and Fused Kernel Optimization [84.25316984309725]
動的スパース構造とパラメータ効率のよいアダプタ(例えばLoRA)の統合は、大規模言語モデル(LLM)を拡張するための強力な技術である。
計算負荷は最小限に抑えられるが、計算のレイテンシが急上昇し、復号速度が2.5倍以上遅くなる。
AdaFuseはアルゴリズムと基盤となるハードウェアシステムとの緊密な協調設計に基づいて構築されたフレームワークで、効率的な動的アダプタ実行を実現する。
論文 参考訳(メタデータ) (2026-03-12T12:46:42Z) - Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction [3.9660062354591754]
トランスフォーマーアーキテクチャは、密度の高いフルアテンションによって最先端の精度を提供するが、その2次時間とメモリの複雑さは、実用的なデプロイメントを制限している。
線形アテンションメカニズムは、線形またはニア線形スケーリングを提供するが、しばしば性能劣化を引き起こす。
我々は,対象タスクの検証性能を監視しながら,すべての注意ブロックを線形に置き換える,欲求層置換戦略を導入する。
これにより、コストのかかる再トレーニングやニューラルアーキテクチャ検索を必要とせず、単一の効率的なパスでタスク固有のハイブリッドモデルが得られ、さまざまな下流タスクのために事前トレーニングされたフルアテンションバックボーンに適用できる。
論文 参考訳(メタデータ) (2026-01-16T02:01:40Z) - iFlame: Interleaving Full and Linear Attention for Efficient Mesh Generation [49.8026360054331]
iFlameはメッシュ生成のためのトランスフォーマーベースの新しいネットワークアーキテクチャである。
本稿では,線形アテンションの効率とフルアテンション機構の表現力を組み合わせたインターリービング自己回帰メッシュ生成フレームワークを提案する。
提案するインターリービングフレームワークは,計算効率と生成性能を効果的にバランスさせることが示唆された。
論文 参考訳(メタデータ) (2025-03-20T19:10:37Z) - CARE Transformer: Mobile-Friendly Linear Visual Transformer via Decoupled Dual Interaction [77.8576094863446]
本稿では,新しいdetextbfCoupled dutextbfAl-interactive lineatextbfR atttextbfEntion (CARE) 機構を提案する。
まず,非対称な特徴分離戦略を提案し,非対称的に学習プロセスを局所帰納バイアスと長距離依存に分解する。
分離学習方式を採用し,特徴間の相補性を完全に活用することにより,高い効率性と精度を両立させることができる。
論文 参考訳(メタデータ) (2024-11-25T07:56:13Z) - Linearly-evolved Transformer for Pan-sharpening [34.06189165260206]
ビジョン・トランスフォーマー・ファミリーは、地球規模の空間情報モデリング機構によって駆動される衛星パンシャーピング・フィールドを支配してきた。
これらの有望なパンシャープ法における標準的なモデリング規則は、変圧器の変種を概ねカスケード的に積み重ねることである。
本稿では,効率的な線形進化型変圧器変圧器を提案し,軽量なパンシャーピングフレームワークの構築に利用した。
論文 参考訳(メタデータ) (2024-04-19T11:38:34Z) - Perceiving Longer Sequences With Bi-Directional Cross-Attention Transformers [13.480259378415505]
BiXTは、計算コストとメモリ消費の観点から、入力サイズと線形にスケールする。
BiXTはPerceiverアーキテクチャにインスパイアされているが、反復的な注意を効率よく双方向のクロスアテンションモジュールに置き換える。
効率性とフルトランスフォーマーアーキテクチャの汎用性と性能を組み合わせることで、BiXTはより長いシーケンスを処理できる。
論文 参考訳(メタデータ) (2024-02-19T13:38:15Z) - CloudAttention: Efficient Multi-Scale Attention Scheme For 3D Point
Cloud Learning [81.85951026033787]
この作業にトランスフォーマーをセットし、それらを形状分類と部分およびシーンセグメンテーションのための階層的なフレームワークに組み込む。
また、各イテレーションにおけるサンプリングとグループ化を活用して、効率的でダイナミックなグローバルなクロスアテンションを計算します。
提案した階層モデルは,最先端の形状分類を平均精度で達成し,従来のセグメンテーション法と同等の結果を得る。
論文 参考訳(メタデータ) (2022-07-31T21:39:15Z) - Combiner: Full Attention Transformer with Sparse Computation Cost [142.10203598824964]
計算の複雑さを低く保ちつつ、各注目ヘッドにフルアテンション機能を提供するコンバインダを提案する。
既存のスパース変圧器で使用されるスパースアテンションパターンのほとんどは、そのような分解設計をフルアテンションに刺激することができることを示す。
自己回帰的タスクと双方向シーケンスタスクの両方に関する実験的評価は、このアプローチの有効性を示す。
論文 参考訳(メタデータ) (2021-07-12T22:43:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。