論文の概要: The Misery of Mechanistic Interpretability: A Formal Perspective
- arxiv url: http://arxiv.org/abs/2609.15533v1
- Date: Mon, 14 Sep 2026 13:21:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:06.411585
- Title: The Misery of Mechanistic Interpretability: A Formal Perspective
- Title(参考訳): 機械的解釈可能性の謎--形式的視点から
- Abstract要約: 意味的に小さな入力摂動でさえ、支配的なIRN機能に反することを示す。
我々は、IRNの忠実性に対する最初の公式な検証フレームワークを提案する。
- 参考スコア(独自算出の注目度): 14.639708530208807
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mechanistic interpretability has become the dominant lens for understanding frontier language models, as their inner workings are complex and inherently black boxes. To gain insights into these models, interpretable replacement networks (IRNs) are trained at all layers, exposing interpretable features through sparsely activated neurons. However, the faithfulness of an IRN is usually evaluated only empirically on clean data, and we show that even semantically minor input perturbations flip the dominant IRN features-and thus the human-understandable interpretation-across five open-weight model families (GPT-2 small, Gemma 2 2B, Gemma 3 1B, Llama 3.2 1B, R1-Distill-Qwen 1.5B). We propose the first formal verification framework for the faithfulness of an IRN, where reachability analysis certifies a sound upper bound of the faithfulness gap in adversarial scenarios. Moreover, we show that verification-aware training of IRNs substantially tightens this certified bound, restoring a feature-level interpretation that safety auditors can act on. Together, these results give, to the best of our knowledge, the first formal guarantees for mechanistic interpretability of large language models.
- Abstract(参考訳): 機械的解釈可能性(Mechanistic interpretability)はフロンティア言語モデルを理解するための支配的なレンズとなり、内部の作業は複雑で本質的にブラックボックスである。
これらのモデルに対する洞察を得るために、全ての層で解釈可能な置換ネットワーク(IRN)を訓練し、わずかに活性化された神経細胞を通して解釈可能な特徴を明らかにする。
しかし、IRNの忠実さは、通常、クリーンなデータに対して経験的にのみ評価されるため、意味的に小さな入力摂動でさえ、支配的なIRNの特徴を覆い、人間に理解可能な5つのオープンウェイトモデルファミリー(GPT-2 small, Gemma 2 2B, Gemma 3 1B, Llama 3.2 1B, R1-Distill-Qwen 1.5B)にまたがる解釈が可能である。
我々は、IRNの忠実度に関する最初の公式な検証フレームワークを提案し、そこでは、到達可能性分析は、敵シナリオにおける忠実度ギャップの健全な上限を証明している。
さらに,IRNの検証・認識によるトレーニングは,安全監査者が行うことができる機能レベルの解釈を復元し,この認定境界を著しく厳格化することを示す。
これらの結果から、我々の知る限りでは、大規模言語モデルの機械的解釈可能性に関する最初の正式な保証が得られる。
関連論文リスト
- Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild [49.77540427384148]
本稿では,基礎モデルの汎用的マルチモーダル推論能力を野生でのHOI検出に伝達する,訓練不要なエージェント型フレームワークであるAgenHoIを提案する。
不完全な相互作用発見と複雑な場面におけるあいまいな局所化の課題に対処するために,2つの重要なメカニズムを導入する。
AgentHOIは、リアルタイム設定において、最先端の教師付きおよび弱教師付きメソッドよりも優れたパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-07-15T14:30:20Z) - From Sparse Features to Trustworthy Proxies: Certifying SAE-Based Interpretability [53.681678236115836]
我々は,SAEに基づく説明を,基盤となる凍結LMの忠実な見方として扱うことができるかを検討した。
この枠組みは, 4つの測定可能な量を用いて, 基本モデルの予測リスクの上限を導出する。
我々は, GPT-2 Small, Gemma-2B, Llama-3-8B のサンプルサイズにおいて, 境界が非空洞となることを示す。
論文 参考訳(メタデータ) (2026-06-16T18:28:23Z) - Understanding Degradation with Vision Language Model [56.09241449206817]
視覚的劣化を理解することは、コンピュータビジョンにおいて重要な問題であるが、難しい問題である。
本稿では,教師付き微調整と強化学習を併用したマルチモーダル・チェーン・オブ・ソート・モデルであるDU-VLMを紹介する。
また,110,000個のクリーン劣化ペアと接地された物理アノテーションからなる大規模データセットである textbfDU-110k も導入した。
論文 参考訳(メタデータ) (2026-02-04T13:51:15Z) - Stable Language Guidance for Vision-Language-Action Models [62.80963701282789]
残留セマンティックステアリング(Residual Semantic Steering)は、セマンティック実行から身体的余裕を逸脱する確率的フレームワークである。
RSSは最先端の堅牢性を実現し、敵対的な言語摂動の下でも性能を維持する。
論文 参考訳(メタデータ) (2026-01-07T16:16:10Z) - RealUnify: Do Unified Models Truly Benefit from Unification? A Comprehensive Benchmark [71.3555284685426]
本稿では,双方向機能相乗効果を評価するためのベンチマークであるRealUnifyを紹介する。
RealUnifyは、10のカテゴリと32のサブタスクにまたがる、細心の注意を払ってアノテートされた1000のインスタンスで構成されている。
現在の統一モデルは、効果的な相乗効果を達成するのに依然として苦労しており、アーキテクチャの統一だけでは不十分であることを示している。
論文 参考訳(メタデータ) (2025-09-29T15:07:28Z) - From Indirect Object Identification to Syllogisms: Exploring Binary Mechanisms in Transformer Circuits [5.1877231178075425]
本稿では,GPT-2小さめの2値真理値処理能力について,その振る舞いをシロジカル・プロンプトを用いて解析することによって検討する。
GPT-2の論理推論能力を機械的に説明できる複数の回路を同定する。
論文 参考訳(メタデータ) (2025-08-22T05:54:11Z) - Deliberative Reasoning Network: An Uncertainty-Driven Paradigm for Belief-Tracked Inference with Pretrained Language Models [7.095344389368656]
Deliberative Reasoning Network (DRN) は、確率から不確実性への論理的推論を再構成する新しいパラダイムである。
DRNは、信念状態を明示的に追跡し、競合する仮説の不確実性を定量化することによって、本質的な解釈可能性を達成する。
我々は、DRNを、より信頼できるAIシステムを構築するための、基礎的で検証可能なシステム2推論コンポーネントとして位置付ける。
論文 参考訳(メタデータ) (2025-08-06T11:33:35Z) - Understanding Generalization, Robustness, and Interpretability in Low-Capacity Neural Networks [0.0]
低容量ネットワークにおけるキャパシティ、スパシティ、ロバスト性を調査するためのフレームワークを導入する。
トレーニングされたネットワークは、極大プルーニング(最大95%の間隔)に対して堅牢であることを示す。
この研究は、単純なニューラルネットワークを管理するトレードオフの明確で実証的なデモンストレーションを提供する。
論文 参考訳(メタデータ) (2025-07-22T06:43:03Z) - AnomalyAID: Reliable Interpretation for Semi-supervised Network Anomaly Detection [8.776201861433133]
AnomalyAIDは、異常検出プロセスを解釈し、解釈結果の信頼性を向上させることを目的としている。
本稿では,グローバル・ローカル・インタプリタを利用した新しい解釈手法を提案する。
両段階のモデル予測を特別な制約に合わせることで,ネットワーク異常検出のための新たな2段階半教師付き学習フレームワークを設計する。
論文 参考訳(メタデータ) (2024-11-18T05:39:00Z) - Intrinsic User-Centric Interpretability through Global Mixture of Experts [31.738009841932374]
InterpretCCは、人間の理解の容易さと忠実さの説明を最適化する、本質的に解釈可能なニューラルネットワークのファミリーである。
本報告では,InterpretCCの説明は,他の本質的な解釈可能なアプローチよりも,行動性や有用性が高いことを示す。
論文 参考訳(メタデータ) (2024-02-05T11:55:50Z) - Interpretability in the Wild: a Circuit for Indirect Object
Identification in GPT-2 small [68.879023473838]
間接オブジェクト識別 (IOI) と呼ばれる自然言語タスクにおいて, GPT-2 の小型化が果たす役割について解説する。
我々の知る限り、この調査は言語モデルにおいて「野生」の自然な振る舞いをリバースエンジニアリングする最大のエンドツーエンドの試みである。
論文 参考訳(メタデータ) (2022-11-01T17:08:44Z) - Hybrid CNN -Interpreter: Interpret local and global contexts for
CNN-based Models [9.148791330175191]
畳み込みニューラルネットワーク(CNN)モデルでは、さまざまな領域のパフォーマンスが向上している。
解釈可能性の欠如は、AI支援アプリケーションの受け入れとデプロイの運用中の保証と規制の大きな障壁である。
本稿では,新しいCNN-Interpreterを提案する。
局所的解釈可能性に対する層特異的な予測結果を調べるための独自の前方伝播機構
特徴相関とフィルタ重大効果を示す新しい大域的解釈可能性
論文 参考訳(メタデータ) (2022-10-31T22:59:33Z) - Explicit Tradeoffs between Adversarial and Natural Distributional
Robustness [48.44639585732391]
実際、モデルは信頼性を確保するために両方のタイプの堅牢さを享受する必要があります。
本研究では, 対角線と自然分布の強靭性の間には, 明らかなトレードオフが存在することを示す。
論文 参考訳(メタデータ) (2022-09-15T19:58:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。