論文の概要: HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers
- arxiv url: http://arxiv.org/abs/2608.07616v1
- Date: Fri, 07 Aug 2026 03:47:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.457432
- Title: HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers
- Title(参考訳): HSMLA:高能率視覚変換器のための階層型ソフトマックスマルチスケール線形注意
- Authors: Dong Liu, Yanxuan Yu, Renata Borovica-Gajic, Ying Nian Wu,
- Abstract要約: 我々は,大域的文脈に対するReLUに基づく線形注意,重要な局所特徴に対する選択的ソフトマックス改善,奥行きの畳み込みによるマルチスケールトークン表現を組み合わせたtextbfHSMLA(階層型ソフトマックス多大線形注意)を提案する。
HSMLAは高い精度と効率のトレードオフを達成しており、高密度の予測タスクで4.2times$推論時のスピードアップ、37.3%$Diceで3.2times$CT臓器セグメンテーションで3.2times$スピードアップ、94.2%$AUCで4.1times$病理診断WSIで4.1times$スピードアップを達成している。
- 参考スコア(独自算出の注目度): 38.8278639079174
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision transformers face significant computational overheads in high-resolution dense prediction due to the quadratic complexity of self-attention. Linear attention offers efficiency but sacrifices local context modeling. We propose \textbf{HSMLA (Hierarchical Softmax Multi-scale Linear Attention)}, which combines ReLU-based linear attention for global context, selective softmax refinement for critical local features, and multi-scale token representations via depthwise convolutions. HSMLA achieves superior accuracy-efficiency trade-offs: up to $4.2\times$ inference-time speedup across dense prediction tasks, $87.3%$ Dice with $3.2\times$ speedup on CT organ segmentation, and $94.2%$ AUC with $4.1\times$ speedup on pathology WSI.
- Abstract(参考訳): 視覚変換器は、自己注意の二次的な複雑さのため、高解像度の高密度予測において重要な計算オーバーヘッドに直面している。
線形注意は効率性を提供するが、局所的なコンテキストモデリングを犠牲にする。
本稿では,大域的文脈に対するReLUに基づく線形注意,重要な局所的特徴に対する選択的ソフトマックス改善,奥行きの畳み込みによるマルチスケールトークン表現を組み合わせた「階層型ソフトマックスマルチスケール線形注意」を提案する。
HSMLAは高い精度と効率のトレードオフを達成しており、高密度の予測タスクをまたいだ推論時のスピードアップが4.2\times$、Diceが8.7.3%、CT臓器セグメンテーションのスピードアップが3.2\times$、AUCが4.1\times$のスピードアップが9.4.2%である。
関連論文リスト
- Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs [21.02858354959528]
視覚言語モデルと視覚言語アクションモデルにより、ロボットには前例のない能力がある。
ビデオや高解像度画像の入力は膨大な数の視覚トークンをもたらし、非常に高い推論遅延をもたらし、ロボットのリアルタイム制御を著しく妨げる。
本稿では,視覚的エンコーディングフェーズにおいて,冗長トークンを直接効率的に融合するプラグイン・アンド・プレイフレームワークST-Mergeを提案する。
論文 参考訳(メタデータ) (2026-06-28T11:42:55Z) - Linearizing Vision Transformer with Test-Time Training [54.52616866374482]
事前訓練されたトランスフォーマーからウェイトを継承することは、魅力的なショートカットを提供するが、ソフトマックスと線形アテンションの基本的な表現的ギャップは、効果的なウェイト転送を妨げている。
テスト時間トレーニング(TTT)は2層動的定式化がSoftmaxの注意と構造的に一致している線形複雑アーキテクチャである。
安定拡散3.5を線形化して、SD3.5-T$5$(Transformer to Test Time Training)を導入することで、我々のアプローチを検証する。
論文 参考訳(メタデータ) (2026-05-04T16:16:26Z) - Scaling Attention via Feature Sparsity [50.64995497733461]
超長期のコンテキストにトランスフォーマーをスケールすることは、自己注意のコスト$O(n2 d)$コストによってボトルネックとなる。
本稿では,高次元表現性を維持するために,クエリとキーを$k$sparseコードとして表現するスパース特徴注意法を提案する。
GPT-2とQwen3の事前トレーニングで、SFAは密度の高いベースラインにマッチし、最高2.5タイムのスピードを向上し、FLOPとKVキャッシュを50%近く削減した。
論文 参考訳(メタデータ) (2026-03-17T08:41:50Z) - SoLA-Vision: Fine-grained Layer-wise Linear Softmax Hybrid Attention [50.99430451151184]
線形注意はコストをO(N)に還元するが、圧縮された状態表現はモデリング能力と精度を損なう。
本稿では,視覚表現学習における線形およびソフトマックスの注意を対比する分析的研究について述べる。
フレキシブルな層状ハイブリッドアテンションバックボーンであるSoLA-Visionを提案する。
論文 参考訳(メタデータ) (2026-01-16T10:26:53Z) - Hyperparameter Transfer Enables Consistent Gains of Matrix-Preconditioned Optimizers Across Scales [55.91454326946738]
学習速度と減量率の最適化は,幅広い言語に対して,モデルの幅と深さでどのようにスケールするかを検討する。
我々は、$Pによる学習率のスケーリングは転送を改善するが、それでもかなりの有限幅偏差に悩まされる可能性があることを見出した。
計算-最適スケーリングでは、独立したウェイト崩壊が1/mathrmwidth$で言語間でほぼ最適であることが分かる。
論文 参考訳(メタデータ) (2025-12-05T11:03:41Z) - Efficient High-Accuracy PDEs Solver with the Linear Attention Neural Operator [2.1595890347557756]
我々は新しいタイプのニューラル演算子、リニアアテンションニューラル演算子(LANO)を提案する。
LANOはエージェントベースの機構を通じて注意を再構築することでスケーラビリティと高精度の両立を実現している。
実証的には、LANOは、スライスベースのソフトマックスアテンションを備えたTransolverを含む最先端のニューラルネットワークPDEソルバを超越している。
論文 参考訳(メタデータ) (2025-10-19T13:03:09Z) - LOTFormer: Doubly-Stochastic Linear Attention via Low-Rank Optimal Transport [21.50165411149415]
線形時間と二重確率を同時に行う原理的注意機構を提案する。
LotFormerはLong Range Arenaベンチマークで最先端の結果を達成する。
論文 参考訳(メタデータ) (2025-09-27T18:11:09Z) - SAGA: Selective Adaptive Gating for Efficient and Expressive Linear Attention [10.607730369798551]
入力適応型学習ゲートを導入し,情報集約をKV$特徴写像に選択的に変調する。
SAGAはスループットが1.76$times$改善され、PVT-Tと比較してピークGPUメモリが2.69$times$削減された。
ImageNetデータセットでトップ1の精度を最大4.4%向上させ、計算効率とモデルの有効性を実証する。
論文 参考訳(メタデータ) (2025-09-16T08:36:05Z) - PowerAttention: Exponentially Scaling of Receptive Fields for Effective Sparse Attention [73.26995918610669]
大きな言語モデル(LLM)は、長いコンテキストを処理する場合の注意機構の二次的な複雑さによって、効率のボトルネックに直面します。
本稿では,効果的かつ完全なコンテキスト拡張を容易にする新しいスパークアテンション設計であるPowerAttentionを紹介する。
実験によると、PowerAttentionは既存の静的スパースアテンションメソッドを5sim 40%$で上回っている。
論文 参考訳(メタデータ) (2025-03-05T15:24:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。