論文の概要: Dual Path Attribution: Efficient Attribution for SwiGLU-Transformers through Layer-Wise Target Propagation
- arxiv url: http://arxiv.org/abs/2603.19742v1
- Date: Fri, 20 Mar 2026 08:28:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 19:48:39.053335
- Title: Dual Path Attribution: Efficient Attribution for SwiGLU-Transformers through Layer-Wise Target Propagation
- Title(参考訳): 二重経路属性:層幅ターゲット伝播によるSwiGLU変換器の効率よい寄与
- Authors: Lasse Marten Jantsch, Dong-Jae Koh, Seonghyeon Lee, Young-Kyoon Suh,
- Abstract要約: 本稿では,凍結変圧器上の情報の流れを,一方の前方および一方の後方通過で忠実に追跡する新しいフレームワークであるDual Path Attribution(DPA)を紹介する。
DPAは、既存のベースラインと比較して、最先端の忠実さと前例のない効率を達成する。
- 参考スコア(独自算出の注目度): 5.186807923082922
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Understanding the internal mechanisms of transformer-based large language models (LLMs) is crucial for their reliable deployment and effective operation. While recent efforts have yielded a plethora of attribution methods attempting to balance faithfulness and computational efficiency, dense component attribution remains prohibitively expensive. In this work, we introduce Dual Path Attribution (DPA), a novel framework that faithfully traces information flow on the frozen transformer in one forward and one backward pass without requiring counterfactual examples. DPA analytically decomposes and linearizes the computational structure of the SwiGLU Transformers into distinct pathways along which it propagates a targeted unembedding vector to receive the effective representation at each residual position. This target-centric propagation achieves O(1) time complexity with respect to the number of model components, scaling to long input sequences and dense component attribution. Extensive experiments on standard interpretability benchmarks demonstrate that DPA achieves state-of-the-art faithfulness and unprecedented efficiency compared to existing baselines.
- Abstract(参考訳): トランスフォーマーベースの大規模言語モデル(LLM)の内部メカニズムを理解することは、信頼性の高いデプロイメントと効果的な運用に不可欠である。
最近の試みでは、忠実さと計算効率のバランスをとろうとする多くの帰属法が得られたが、高密度な成分帰属は違法に高価である。
本研究では,凍結変圧器上の情報の流れを,一方の前方と一方の後方に忠実に追跡する新しいフレームワークであるDPA(Dual Path Attribution)を紹介する。
DPAは解析的にSwiGLU変換器の計算構造を個別の経路に分解・線形化し、それによって対象の非埋め込みベクトルを伝播させ、各残差位置における効率的な表現を受信する。
このターゲット中心の伝搬は、モデルコンポーネントの数、長い入力シーケンスへのスケーリング、および密度の高いコンポーネント属性に関するO(1)時間複雑性を達成する。
標準的な解釈可能性ベンチマークに関する大規模な実験は、DPAが既存のベースラインと比較して最先端の忠実さと前例のない効率を達成することを示した。
関連論文リスト
- TopoCurate:Modeling Interaction Topology for Tool-Use Agent Training [53.93696896939915]
訓練用ツール使用エージェントは一般的に、パスレート選択されたタスクに対して、軌道変更の成功と強化学習(RL)に依存している。
TopoCurateは,同一タスクから多段階的なロールアウトを統一的な意味的商トポロジに投影する対話型フレームワークである。
TopoCurateは最先端のベースラインに対して4.2%(SFT)と6.9%(RL)という一貫したゲインを達成している。
論文 参考訳(メタデータ) (2026-03-02T10:38:54Z) - Move What Matters: Parameter-Efficient Domain Adaptation via Optimal Transport Flow for Collaborative Perception [8.774658029766988]
FlowAdaptは最適な輸送理論に基づくパラメータ効率のフレームワークである。
冗長サンプルを選択的にフィルタするWasserstein Greedy Smpling戦略を導入する。
プログレッシブ・ナレッジ・トランスファーモジュールは圧縮された初期表現を後段に注入するように設計されている。
論文 参考訳(メタデータ) (2026-02-12T04:36:50Z) - Hybrid Dual-Path Linear Transformations for Efficient Transformer Architectures [0.0]
本稿では,アフィン変換を2つのトポロジカルな経路に分解するHybrid Dual-Path Linear (HDPL)演算子について紹介する。
FineWeb-Eduデータセットの実験では、HDPLアーキテクチャが標準のLlamaスタイルのベースラインより優れていることが示されている。
本稿では,トランスフォーマーのバックボーン内での確率的潜在空間の明示的な物質化が,重要な建築的余裕として果たす役割について論じる。
論文 参考訳(メタデータ) (2026-02-05T20:16:10Z) - LAPA: Log-Domain Prediction-Driven Dynamic Sparsity Accelerator for Transformer Model [14.53308613746613]
本稿では,LAPAという対数領域の注意予測アルゴリズム-アーキテクチャ共設計を提案する。
その結果, LAPAのエネルギー効率は, Spatten, Sanger, FACTの3.52倍, 3.24倍, 2.79倍に向上した。
論文 参考訳(メタデータ) (2025-11-26T07:24:48Z) - DualGazeNet: A Biologically Inspired Dual-Gaze Query Network for Salient Object Detection [52.32976488996896]
我々はDualGazeNetを紹介した。DualGazeNetは、純粋なトランスフォーマーフレームワークで、有能なオブジェクト検出を行う。
5つのRGBベンチマークの実験によると、DualGazeNetは25の最先端CNNとTransformerベースのメソッドを一貫して上回っている。
論文 参考訳(メタデータ) (2025-11-24T08:08:22Z) - Contrast & Compress: Learning Lightweight Embeddings for Short Trajectories [11.6132604160666]
トランスフォーマーエンコーダを応用して, 短い軌道の固定次元埋め込みを学習するための新しいフレームワークを提案する。
コントラスト学習パラダイムにおけるコサインとFFTに基づく類似度指標の影響を分析した。
Argoverse 2データセットに対する実験的な評価は、Cosine類似性目的によって形成された埋め込みが軌道のより優れたクラスタリングをもたらすことを示す。
論文 参考訳(メタデータ) (2025-06-03T07:53:04Z) - Revisiting LRP: Positional Attribution as the Missing Ingredient for Transformer Explainability [53.21677928601684]
階層的関連性伝播は、ディープラーニングにおける説明可能性に対する最も有望なアプローチの1つである。
そこで我々は,様々な位置符号化手法にまたがる属性の伝播を目的とした,理論的なLRP規則を提案する。
本手法は,視力とNLP説明可能性の両面において,最先端の課題を著しく上回っている。
論文 参考訳(メタデータ) (2025-06-02T18:07:55Z) - Fourier Test-time Adaptation with Multi-level Consistency for Robust
Classification [10.291631977766672]
本稿では,Fourier Test-Time Adaptation (FTTA) と呼ばれる新しい手法を提案する。
FTTAは、予測の自己監督を行うために、ペア入力の信頼性の高い多レベル整合性測定を構築する。
異なる形態と器官を持つ3つの大きな分類データセットで広範囲に検証された。
論文 参考訳(メタデータ) (2023-06-05T02:29:38Z) - End-to-End Meta-Bayesian Optimisation with Transformer Neural Processes [52.818579746354665]
本稿では,ニューラルネットワークを一般化し,トランスフォーマーアーキテクチャを用いて獲得関数を学習する,エンド・ツー・エンドの差別化可能な最初のメタBOフレームワークを提案する。
我々は、この強化学習(RL)によるエンドツーエンドのフレームワークを、ラベル付き取得データの欠如に対処できるようにします。
論文 参考訳(メタデータ) (2023-05-25T10:58:46Z) - CSformer: Bridging Convolution and Transformer for Compressive Sensing [65.22377493627687]
本稿では,CNNからの詳細な空間情報を活用するためのハイブリッドフレームワークと,表現学習の強化を目的としたトランスフォーマーが提供するグローバルコンテキストを統合することを提案する。
提案手法は、適応的なサンプリングとリカバリからなるエンドツーエンドの圧縮画像センシング手法である。
実験により, 圧縮センシングにおける専用トランスアーキテクチャの有効性が示された。
論文 参考訳(メタデータ) (2021-12-31T04:37:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。