論文の概要: HiLRP: Toward One Trustworthy Explanation for Vision Transformer: Conservation-Valid Attribution via Attention Primitives
- arxiv url: http://arxiv.org/abs/2609.01282v1
- Date: Tue, 01 Sep 2026 14:16:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.740329
- Title: HiLRP: Toward One Trustworthy Explanation for Vision Transformer: Conservation-Valid Attribution via Attention Primitives
- Title(参考訳): HiLRP: 視覚変換器の信頼できる1つの説明に向けて: 意識的プリミティブによる保存-Valid属性
- Authors: Sathiyamohan Nishankar, Pubudu Sanjeewani, Asanka Perera, Selvarajah Thuseethan,
- Abstract要約: ビジョントランスフォーマー(ViT)の設計は、コンボリューションステム、ウィンドウド、リニア、マルチ軸アテンション、マージパッチ、空間リダクションを組み合わさって、ますます多様化している。
この多様性は既存の帰属法に問題をもたらし、その仮定はViTの変種をまたいでは成立しないことが多い。
既存の手法が、このアーキテクチャ領域にまたがる統一的な属性フレームワークを提供していないことを示す。
- 参考スコア(独自算出の注目度): 0.4899818550820576
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision Transformer (ViT) design has become increasingly diverse, with backbones combining convolutional stems, windowed, linear, or multi-axis attention, patch merging, and spatial reduction in various configurations. This diversity poses challenges for existing attribution methods, whose assumptions often do not hold across ViT variants: Grad-CAM requires a terminal spatial feature map, attention rollout assumes global softmax attention, and layer-wise relevance propagation (LRP) requires module-specific rules. To the best of our knowledge, no existing method provides a unified attribution framework across this architectural space. We show that this architectural diversity can be captured by a simpler underlying structure. The attention and resolution-reduction operators in current ViTs can be decomposed into four operation types: linear maps, bilinear mixing, normalization or gating, and reindexing. Each operation admits a relevance rule that satisfies conservation. Based on these rules, HiLRP supports new backbones by construction rather than by architecture-specific derivation, and its attribution maps decompose the prediction rather than relying on heuristic assumptions. We prove conservation and conditional equivariance and verify both to machine precision. Across 14 attribution methods and 10 architectures, we find that no prior method remains reliable across ViT families, while Faithfulness Correlation becomes uninformative for backbones robust to spatial masking. HiLRP alone preserves conservation across windowed, spatial-reduction, multi-axis, and linear-attention models, where naive extensions can produce zero or inflated relevance. It also localizes attribution failures in class activation mapping, achieving 0.97 Pointing compared with 0.55 for competing methods on EfficientViT.
- Abstract(参考訳): ビジョントランスフォーマー(ViT)の設計は、コンボリューションステム、ウィンドウ、リニア、マルチ軸アテンション、パッチマージ、各種構成の空間的縮小など、多様化している。
Grad-CAMは終端空間の特徴マップを必要とし、アテンション・ロールアウトはグローバル・ソフトマックス・アテンションを仮定し、レイヤワイド・レバレンス・プロパゲーション(LRP)はモジュール固有のルールを必要とする。
私たちの知る限りでは、このアーキテクチャ領域にまたがる統一的な属性フレームワークを提供する既存のメソッドはありません。
このアーキテクチャの多様性は、より単純な基盤構造によって捉えられることを示す。
現在のViTの注意と解像度の低減演算子は、線形写像、双線形混合、正規化またはゲーティング、再帰の4つの演算タイプに分解することができる。
各操作は、保存を満足する関連ルールを許可する。
これらのルールに基づいて、HiLRPはアーキテクチャ固有の導出ではなく構築による新しいバックボーンをサポートし、帰属写像はヒューリスティックな仮定に頼るのではなく、予測を分解する。
我々は,保存と条件等式を証明し,両者を機械精度で検証する。
14の帰属法と10のアーキテクチャでは、VTファミリー全体では事前の手法は信頼性が保たれていないが、Fithfulness correlationは空間マスキングに頑健な背骨には役に立たない。
HiLRPだけでは、ウィンドウ化、空間縮小、多重軸、線形アテンションモデルにまたがる保存を保ち、ナイーブ拡張はゼロまたはインフレーションされた関連性を生み出すことができる。
また、クラスのアクティベーションマッピングにおける帰属障害をローカライズし、EfficientViT上の競合メソッドでは0.55に比べて0.97ポイントを達成した。
関連論文リスト
- Hierarchical Consistency Learning for Test-time Adaptation in Camouflage Perception [50.278200968044665]
カモフラージュされた物体検出(COD)は、物理的属性を通して背景から最小限の知覚差を示すターゲットをローカライズすることを目的としている。
既存のメソッドは、静的なTrain-then-freezeパラダイムによって制約されており、ドメインの剛性と依存性のアノテーションに悩まされている。
動的表現再構成のためのテスト時間適応を統合した階層的一貫性学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-25T09:57:46Z) - Beyond Point-Wise Matching: Structural Representation Alignment for Accelerating Diffusion Transformers [93.3976834364707]
本稿では,特徴写像のリレーショナル幾何における整合性を実現する構造的RePresentation AlignmentフレームワークであるsREPAを提案する。
モデルが事前訓練された特徴から全体的空間配置と構造的相関を内包するように促すことにより、sREPAはより高速でより安定した収束を達成する。
論文 参考訳(メタデータ) (2026-05-16T12:01:04Z) - Empowering Heterogeneous Graph Foundation Models via Decoupled Relation Alignment [20.128308877213044]
Decoupled Relation Subspace Alignment (DRSA)は、新しいプラグアンドプレイ関係駆動フレームワークである。
特徴的意味論を関係構造から切り離すことによってパラダイムを根本的にシフトさせる。
ユニバーサルプリプロセッシングモジュールとしてシームレスに統合することができる。
論文 参考訳(メタデータ) (2026-05-01T15:31:36Z) - LINA: Linear Autoregressive Image Generative Models with Continuous Tokens [56.80443965097921]
連続トークンを持つ自己回帰モデルは、特にテキスト・トゥ・イメージ(T2I)合成において、視覚生成に有望なパラダイムを形成する。
このフレームワーク内での計算効率のよい線形アテンションの設計法について検討する。
LINAは、線形注意に基づくシンプルで計算効率の良いT2Iモデルであり、ユーザ命令から高忠実度1024x1024画像を生成することができる。
論文 参考訳(メタデータ) (2026-01-30T06:44:33Z) - Inverting Self-Organizing Maps: A Unified Activation-Based Framework [39.146761527401424]
我々は,SOMの活性化パターンを逆転させて,微妙な幾何学的条件下での正確な入力を復元できることを示す。
我々は,MUSIC (Manifold-Aware Unified SOM Inversion and Control) 更新ルールを導入する。
合成ガウス混合系, MNIST と Faces in the Wild を用いたアプローチを検証した。
論文 参考訳(メタデータ) (2026-01-20T11:02:54Z) - Revisiting LRP: Positional Attribution as the Missing Ingredient for Transformer Explainability [53.21677928601684]
階層的関連性伝播は、ディープラーニングにおける説明可能性に対する最も有望なアプローチの1つである。
そこで我々は,様々な位置符号化手法にまたがる属性の伝播を目的とした,理論的なLRP規則を提案する。
本手法は,視力とNLP説明可能性の両面において,最先端の課題を著しく上回っている。
論文 参考訳(メタデータ) (2025-06-02T18:07:55Z) - Stochastic Layer-wise Learning: Scalable and Efficient Alternative to Backpropagation [1.0285749562751982]
バックプロパゲーションは現代のディープラーニングを支えるものだが、グローバル同期への依存はスケーラビリティを制限し、高いメモリコストを発生させる。
対照的に、完全に局所的な学習ルールはより効率的であるが、コヒーレントなグローバルラーニングに必要な層間調整を維持するのに苦労することが多い。
本稿では,グローバルな目標を協調的なレイヤローカル更新に分解するレイヤワイズ学習アルゴリズムであるレイヤワイズ学習(SLL)を紹介する。
論文 参考訳(メタデータ) (2025-05-08T12:32:29Z) - VRS-UIE: Value-Driven Reordering Scanning for Underwater Image Enhancement [104.78586859995333]
状態空間モデル(SSM)は、線形複雑性と大域的受容場のために、視覚タスクの有望なバックボーンとして登場した。
大型で均質だが無意味な海洋背景の優位性は、希少で価値ある標的の特徴表現応答を希薄にすることができる。
水中画像強調(UIE)のための新しい値駆動リダクションスキャンフレームワークを提案する。
本フレームワークは, 水バイアスを効果的に抑制し, 構造や色彩の忠実さを保ち, 優れた向上性能(WMambaを平均0.89dB超える)を実現する。
論文 参考訳(メタデータ) (2025-05-02T12:21:44Z) - Rethinking the Zigzag Flattening for Image Reading [48.976491898131265]
我々はHilbert fractal flattening (HF) をコンピュータビジョンにおけるシーケンスオーダの別の方法として検討する。
HFは空間的局所性を維持する上で他の曲線よりも優れていることが証明されている。
ほとんどのディープニューラルネットワーク(DNN)に簡単に接続できる。
論文 参考訳(メタデータ) (2022-02-21T13:53:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。