論文の概要: Rényi Attention Entropy for Patch Pruning
- arxiv url: http://arxiv.org/abs/2604.03803v1
- Date: Sat, 04 Apr 2026 17:10:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-07 15:49:18.775775
- Title: Rényi Attention Entropy for Patch Pruning
- Title(参考訳): Patch PruningのためのRényi Attention Entropy
- Authors: Hiroaki Aizawa, Yuki Igaue,
- Abstract要約: 我々は,アテンション分布のシャノンエントロピーに基づく基準を導入し,プルーニングのための情報パッチを特定する。
また、シャノンからレニーエントロピーへの基準を延長し、鋭い注目のピークを強調する。
パッチ選択が重要となるきめ細かい画像認識実験では,精度を保ちながら計算を削減した。
- 参考スコア(独自算出の注目度): 0.42970700836450487
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Transformers are strong baselines in both vision and language because self-attention captures long-range dependencies across tokens. However, the cost of self-attention grows quadratically with the number of tokens. Patch pruning mitigates this cost by estimating per-patch importance and removing redundant patches. To identify informative patches for pruning, we introduce a criterion based on the Shannon entropy of the attention distribution. Low-entropy patches, which receive selective and concentrated attention, are kept as important, while high-entropy patches with attention spread across many locations are treated as redundant. We also extend the criterion from Shannon to Rényi entropy, which emphasizes sharp attention peaks and supports pruning strategies that adapt to task needs and computational limits. In experiments on fine-grained image recognition, where patch selection is critical, our method reduced computation while preserving accuracy. Moreover, adjusting the pruning policy through the Rényi entropy measure yields further gains and improves the trade-off between accuracy and computation.
- Abstract(参考訳): 自己注意はトークン間の長距離依存関係をキャプチャするので、トランスフォーマーは視覚と言語の両方において強力なベースラインである。
しかし、自己注意のコストはトークンの数によって2次的に増加する。
パッチプルーニングは、パッチごとの重要度を推定し、冗長なパッチを削除することで、このコストを軽減します。
刈り取りのための情報パッチを特定するために,注意分布のシャノンエントロピーに基づく基準を導入する。
低エントロピーパッチは選択的かつ集中的に注目され、高エントロピーパッチは多くの場所に分布する。
また、シャノンからレニイエントロピーへの基準を延長し、鋭い注目のピークを強調し、タスクニーズや計算限界に適応するプルーニング戦略をサポートする。
パッチ選択が重要となるきめ細かい画像認識実験では,精度を保ちながら計算を削減した。
さらに、レニイエントロピー測度によるプルーニングポリシーの調整により、さらなる利得が得られ、精度と計算のトレードオフが改善される。
関連論文リスト
- Probability-Entropy Calibration: An Elastic Indicator for Adaptive Fine-tuning [55.2818264614932]
RankTunerは確率エントロピーキャリブレーション信号、相対ランクインジケータを導入し、予測分布の下で接地トラストークンのランクと期待ランクを比較する。
逆インジケータはトークン単位の相対尺度として使用され、微調整の目的を再重み付けし、真に未学習のトークンを更新する。
論文 参考訳(メタデータ) (2026-02-02T07:27:19Z) - Rectified SpaAttn: Revisiting Attention Sparsity for Efficient Video Generation [22.35209793690791]
拡散変換器はビデオ生成を支配するが、注意の二次的な複雑さは相当なレイテンシをもたらす。
注意間隔は、非クリティカルトークンを無視しながらクリティカルトークンに注目することで計算コストを削減します。
既存の手法は、注意配分における系統的バイアスを誘導する。
本稿では,暗黙のフルアテンション参照でアテンションアロケーションを補正するRectified SpaAttnを提案する。
論文 参考訳(メタデータ) (2025-11-25T02:03:54Z) - DoPE: Denoising Rotary Position Embedding [60.779039511252584]
トランスフォーマーモデルにおける回転位置埋め込み(RoPE)は、長さを弱める固有の限界を持つ。
ノイズのある特徴写像として位置符号化を用いたアテンションマップを再解釈し、位置補間ページ(DoPE)を提案する。
DoPEは、トランカテッド行列エントロピーに基づくトレーニング不要な手法であり、特徴写像における外乱周波数帯域を検出する。
論文 参考訳(メタデータ) (2025-11-12T09:32:35Z) - Patch Pruning Strategy Based on Robust Statistical Measures of Attention Weight Diversity in Vision Transformers [0.7673339435080445]
本稿では,複数の注目頭間での注目重みのばらつきに基づいて,各パッチの重要性を評価するパッチプルーニング戦略を提案する。
このアプローチは、特徴表現の異なる部分空間にまたがる多様な注意パターンを捉えることを目的としたマルチヘッド自己注意の設計に着想を得たものである。
論文 参考訳(メタデータ) (2025-07-25T11:31:17Z) - Spatial regularisation for improved accuracy and interpretability in keypoint-based registration [5.286949071316761]
教師なしキーポイント検出に基づく最近のアプローチは、解釈可能性に非常に有望である。
本稿では,特徴量の空間分布を正規化するための3倍の損失を提案する。
我々の損失は特徴の解釈可能性を大幅に改善し、現在では正確で解剖学的に意味のあるランドマークに対応しています。
論文 参考訳(メタデータ) (2025-03-06T14:48:25Z) - Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding [3.9826635165229223]
提案するTop-theta (Top-$theta$) Attention, a training-free method for sparsification transformer attention during inference。
私たちのキーとなる洞察は、頭当たりの静的な閾値は、アテンション行当たりの重要な要素の一定数の保持のために調整できるということです。
Top-Theta$は、Vキャッシュの使用を3~10倍削減し、推論中の注目要素を最大10倍削減するが、精度は1%以下である。
論文 参考訳(メタデータ) (2025-02-12T12:50:15Z) - Localized Gaussians as Self-Attention Weights for Point Clouds Correspondence [92.07601770031236]
本稿では,エンコーダのみのトランスフォーマーアーキテクチャのアテンションヘッドにおける意味的意味パターンについて検討する。
注意重みの修正はトレーニングプロセスの促進だけでなく,最適化の安定性の向上にも寄与する。
論文 参考訳(メタデータ) (2024-09-20T07:41:47Z) - Calibrating Undisciplined Over-Smoothing in Transformer for Weakly Supervised Semantic Segmentation [51.14107156747967]
弱教師付きセマンティックセマンティックセマンティクス(WSSS)は、完全な教師付きアプローチよりもアノテーションが少ないため、かなりの注目を集めている。
本研究では,非学際的な過密化に対する深い注意を抑えるための適応的再活性化機構 (AReAM) を提案する。
AReAMは既存のWSSS手法と比較してセグメンテーション性能を大幅に改善し、ノイズを低減し、関連するセマンティック領域に焦点を絞る。
論文 参考訳(メタデータ) (2023-05-04T19:11:33Z) - Bayesian Attention Modules [65.52970388117923]
実装や最適化が容易な,スケーラブルな注目バージョンを提案する。
本実験は,提案手法が対応するベースラインに対して一貫した改善をもたらすことを示す。
論文 参考訳(メタデータ) (2020-10-20T20:30:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。