論文の概要: Flexformer: Flexible Linear Transformer with Learnable Attention Kernel
- arxiv url: http://arxiv.org/abs/2606.27748v2
- Date: Mon, 29 Jun 2026 02:38:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 15:56:39.060571
- Title: Flexformer: Flexible Linear Transformer with Learnable Attention Kernel
- Title(参考訳): Flexformer: 学習可能なアテンションカーネルを備えたフレキシブルリニアトランス
- Abstract要約: 完全データ駆動方式で注目カーネルを学習するフレキシブルリニアトランスフォーマーであるFlexformerを提案する。
言語モデリングとシーケンス分類の実験は、Flexformerがベースラインを一貫して上回っていることを示している。
- 参考スコア(独自算出の注目度): 8.917992463399969
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Transformer models rely on attention mechanism to capture long-range dependencies but suffer from quadratic complexity, limiting their scalability to long sequences. Kernel-based linear attention reduces this complexity but typically relies on fixed or weakly learnable kernels, restricting expressiveness and performance. In this work, we propose Flexformer, a flexible linear Transformer that learns attention kernels in a fully data-driven manner. Flexformer builds on random Fourier feature-based linear attention and treats spectral frequencies as trainable parameters, enabling the model to learn a broad family of attention kernels. We develop both stationary and nonstationary variants, with the latter offering strictly greater expressiveness. Extensive experiments on language modeling and sequence classification demonstrate that Flexformer consistently outperforms baselines. Moreover, Flexformer can be effectively distilled from pretrained Transformers to recover softmax attention and exhibits strong kernel transferability across domains, achieving both high efficiency and competitive performance on long-sequence tasks.
- Abstract(参考訳): トランスフォーマーモデルは、長距離依存を捉えるための注意機構に頼っているが、二次的な複雑さに悩まされ、スケーラビリティを長いシーケンスに制限している。
カーネルベースの線形アテンションは、この複雑さを減らすが、一般的には固定あるいは弱い学習可能なカーネルに依存し、表現性と性能を制限する。
本研究では,完全データ駆動方式で注目カーネルを学習するフレキシブルリニアトランスフォーマーFlexformerを提案する。
Flexformerはランダムなフーリエ特徴に基づく線形アテンションの上に構築され、スペクトル周波数をトレーニング可能なパラメータとして扱う。
我々は定常変種と非定常変種の両方を開発し、後者は厳密な表現性を提供する。
言語モデリングとシーケンス分類に関する大規模な実験は、Flexformerがベースラインを一貫して上回っていることを示している。
さらに、Flexformerは、事前訓練されたトランスフォーマーから効果的に蒸留し、ソフトマックスの注意を回復し、ドメイン間で強力なカーネル転送性を示し、長時間のタスクにおいて高い効率と競争性能を達成する。
関連論文リスト
- Elastic Spiking Transformers for Efficient Gesture Understanding [6.52225846892392]
Spiking Neural Networks(SNN)は、医療アプリケーションのためのイベントベースのセンサデータのエネルギー効率の高い処理を提供する。
我々は、スパイキングパラダイムに弾力性をもたらすランタイム適応アーキテクチャであるElastic Spiking Transformerを紹介します。
CIFAR10/100, CIFAR10-DVS, EHWGesture 臨床ジェスチャー理解データセットについて検討した。
論文 参考訳(メタデータ) (2026-05-04T12:35:52Z) - Gated Condition Injection without Multimodal Attention: Towards Controllable Linear-Attention Transformers [69.60693631859411]
本稿では,線形アテンションアーキテクチャ上に構築された制御可能な拡散モデルについて検討する。
本稿では,SANA などのリニアアテンションバックボーンに適した新しい制御可能な拡散フレームワークを提案する。
提案手法は,線形アテンションモデルに基づく最先端の制御可能な生成性能を実現する。
論文 参考訳(メタデータ) (2026-03-29T12:31:34Z) - FlexLoRA: Entropy-Guided Flexible Low-Rank Adaptation [33.208889745659825]
大規模な事前学習モデルは様々な領域で顕著な成功を収めるが、完全な微調整は計算とメモリのコストを禁ずる。
我々は,世界予算下でのランクプルーニングと拡張をサポートするエントロピー誘導型フレキシブルローランク適応フレームワークFlexLoRAを提案する。
実験によると、FlexLoRAはベンチマーク全体で、最先端のベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-01-30T12:25:47Z) - Dynamic Differential Linear Attention: Enhancing Linear Diffusion Transformer for High-Quality Image Generation [25.321469825055733]
拡散変換器(DiT)は高忠実度画像生成のための強力なアーキテクチャとして登場した。
DyDiLAは、過密問題を緩和し、生成品質を向上させることでLiTsの有効性を高める新しい線形アテンション定式化である。
DyDiLAを活用するために,DyDi-LiTと呼ばれる改良されたLiTを導入し,その進歩を体系的に取り入れた。
論文 参考訳(メタデータ) (2026-01-20T07:33:16Z) - Lizard: An Efficient Linearization Framework for Large Language Models [113.87302474262798]
プリトレーニングされたトランスフォーマーベース大規模言語モデル(LLM)をサブクワッドアーキテクチャに変換する線形化フレームワークであるLizardを提案する。
Lizardは、モデル品質を保ちながらソフトマックスアテンションを正確に近似するサブクワッドアテンションメカニズムを導入することで、これらの制限に対処する。
5 ショット MMLU ベンチマークにおいて,Lizard は教師モデルの性能のほぼ無作為な回復を実現し,従来の手法よりも 9.4 ~ 24.5 ポイント高い性能を示した。
論文 参考訳(メタデータ) (2025-07-11T21:19:18Z) - Flextron: Many-in-One Flexible Large Language Model [85.93260172698398]
我々は,フレキシブルモデル展開をサポートするネットワークアーキテクチャとポストトレーニングモデル最適化フレームワークであるFlextronを紹介する。
本稿では,既存の学習用LDMをFlextronモデルに変換するための,サンプル効率のよいトレーニング手法と関連するルーティングアルゴリズムを提案する。
我々は、複数のエンドツーエンドトレーニングされた変種や他の最先端の弾性ネットワークよりも優れた性能を示し、これらは全て、オリジナルの事前訓練と比較してわずか7.63%のトークンを消費する単一の事前訓練ランで実現している。
論文 参考訳(メタデータ) (2024-06-11T01:16:10Z) - FLatten Transformer: Vision Transformer using Focused Linear Attention [80.61335173752146]
線形注意(linear attention)は、その線形複雑性に対して、はるかに効率的な代替手段を提供する。
現在の線形アテンションアプローチは、大きなパフォーマンス劣化に悩まされるか、追加の計算オーバーヘッドを導入するかのいずれかである。
本研究では,高効率と表現性の両方を実現するために,新しいFocused Linear Attentionモジュールを提案する。
論文 参考訳(メタデータ) (2023-08-01T10:37:12Z) - Adaptive Fourier Neural Operators: Efficient Token Mixers for
Transformers [55.90468016961356]
本稿では,Fourierドメインのミキシングを学習する効率的なトークンミキサーを提案する。
AFNOは、演算子学習の原則的基礎に基づいている。
65kのシーケンスサイズを処理でき、他の効率的な自己認識機構より優れている。
論文 参考訳(メタデータ) (2021-11-24T05:44:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。