論文の概要: Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs
- arxiv url: http://arxiv.org/abs/2607.07903v1
- Date: Wed, 08 Jul 2026 20:31:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.33884
- Title: Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs
- Title(参考訳): LLMジェイルブレイクの内部属性グラフによる機械的解釈可能性
- Abstract要約: 大きな言語モデル(LLM)は優れた能力を示すが、敵のプロンプトやジェイルブレイク攻撃に対して非常に脆弱である。
既存のアプローチは主にインプット・アウトプット・ビヘイビアや属性・メソッドを通じてこれらの障害を分析する。
ペア化された内部計算グラフを用いて脆弱性を診断する機構的フレームワークを提案する。
- 参考スコア(独自算出の注目度): 0.8658568246382029
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) exhibit remarkable capabilities but remain highly vulnerable to adversarial prompts and jailbreak attacks. Existing approaches primarily analyze these failures through input-output behaviors or attribution methods, offering limited insight into how adversarial perturbations alter the model's internal reasoning. Consequently, the mechanisms underlying unsafe or incorrect behaviors remain poorly understood. We introduce a mechanistic framework for diagnosing LLM vulnerabilities using paired internal computation graphs, which represent prompt-specific inference as structured causal interactions among latent features. By constructing and aligning computation graphs for clean and attacked prompts, we reveal that adversarial attacks induce systematic transformations of internal reasoning, including suppression of safety-relevant components, emergence of attack-specific features, and rerouting of computation paths. Building on this representation, we propose a unified framework that (i) decomposes computation into invariant, suppressed, and emergent structures, (ii) identifies recurring vulnerability motifs associated with failure modes, and (iii) performs causal interventions on nodes, paths, and subgraphs to directly evaluate their contributions to attack success. This enables a transition from descriptive attribution to causal diagnosis of model failures. Experiments across multiple open-source LLMs and diverse adversarial and jailbreak benchmarks demonstrate that structural deviations in internal computation graphs strongly correlate with unsafe behaviors. Furthermore, targeted interventions on identified vulnerability motifs improve model robustness, establishing internal computation graphs as a principled foundation for understanding, diagnosing, and mitigating LLM vulnerabilities.
- Abstract(参考訳): 大きな言語モデル(LLM)は優れた能力を示すが、敵のプロンプトやジェイルブレイク攻撃に対して非常に脆弱である。
既存のアプローチは主にインプット・アウトプット・ビヘイビア(英語版)や帰属的手法を通じてこれらの障害を分析し、モデルの内部的推論がどのように変化するかについての限られた洞察を提供する。
その結果、安全でない行動や誤った行動のメカニズムはいまだに理解されていない。
本稿では,ペア化された内部計算グラフを用いてLCMの脆弱性を診断する機構について紹介する。
クリーンかつアタックなプロンプトのための計算グラフの構築とコーディネートにより、敵攻撃は、安全関連成分の抑制、攻撃固有の特徴の出現、計算経路の再帰など、内部推論の体系的な変換を誘導することを明らかにする。
この表現に基づいて、我々は統一されたフレームワークを提案する。
(i)計算を不変・抑制・創発構造に分解する。
(ii)障害モードに関連する再発する脆弱性のモチーフを特定し、
三) ノード、パス、サブグラフに対して因果的介入を行い、その成果を直接評価する。
これにより、記述的属性からモデル障害の因果診断への移行が可能になる。
複数のオープンソースLLMと様々な逆数とジェイルブレイクのベンチマークによる実験は、内部計算グラフの構造偏差が安全でない振る舞いと強く相関していることを示している。
さらに、識別された脆弱性のモチーフに対する対象的介入はモデルの堅牢性を改善し、LLM脆弱性の理解、診断、緩和のための基本的な基盤として内部計算グラフを確立する。
関連論文リスト
- AI Slop and Hallucinations in Vulnerability Assessment: A Survey on Reasoning Failures and Trustworthy Mitigation [48.55515767840701]
AIスロープ(AI slop)は、アーティファクト、幻覚的脆弱性、可視だが正しくないパッチ、セマンティックに再パッケージされたバグレポートである。
本稿では,実証的証拠を調査し,統一メカニズムを特定し,信頼に値するトリアージへの道筋をたどる。
論文 参考訳(メタデータ) (2026-08-26T11:48:38Z) - CLEAR: Causal Context-Based Agentic Reasoning for Vulnerability Detection [3.2238600872149275]
Causal Context-based Agentic Reasoning (CLEAR)は、因果知識グラフと統合された新しいマルチエージェント脆弱性検出フレームワークである。
コレクター、クレーム、批判、裁判官を含む4つの専門エージェントは、検索された因果コンテキストを通じて脆弱性仮説を協調的に検証する。
CLEARはPair-Correct (P-C)のパフォーマンスを130.7%改善し、最先端のアプローチよりも71.56%向上した。
論文 参考訳(メタデータ) (2026-08-04T05:03:11Z) - Causal Ensemble Agent: Hierarchical Causal Discovery with LLM-guided Expert Reweighting [95.24017293537025]
Causal Ensemble Agent (CEA) は、さまざまなグラフレベルにわたる統計発見の専門家による構造的洞察を集約する新しいフレームワークである。
CEAは、幅広い因果発見手法において、最も優れた総合的なパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-06-09T09:09:07Z) - Causal-Audit: Explicit and Auditable Graph-based Reasoning via Target-Aware Causal Chain Construction [14.96995835279229]
因果的および介入に基づく質問応答は、大規模言語モデルの進化に不可欠である。
文脈自由な介入に基づく質問応答のための明示的で監査可能な因果推論フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-22T23:24:18Z) - Explainability-Guided Adversarial Attacks on Transformer-Based Malware Detectors Using Control Flow Graphs [0.19116784879310025]
本稿では,制御フローグラフを関数呼び出しのシーケンスに線形化するRoBERTaベースのマルウェア検出器の脆弱性について検討する。
このグラフ・ツー・シーケンス・フレームワーク内での回避戦略を評価することにより、トランスフォーマー・ベースのマルウェア検知器の実用的堅牢性について、集約的検出精度以上の知見を提供する。
論文 参考訳(メタデータ) (2026-04-04T19:50:04Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - TRUE: A Trustworthy Unified Explanation Framework for Large Language Model Reasoning [0.2538209532048867]
大規模言語モデル(LLM)は複雑な推論タスクにおいて強力な能力を示してきたが、その意思決定プロセスは解釈が難しいままである。
本稿では,実行可能推論検証,実現可能な領域指向非巡回グラフ(DAG)モデリング,因果故障モード解析を統合したTrustworthy Unified Explanation Framework(TRUE)を提案する。
論文 参考訳(メタデータ) (2026-02-21T17:00:54Z) - AgentFixer: From Failure Detection to Fix Recommendations in LLM Agentic Systems [7.429835301272413]
フレームワークには15の障害検出ツールと2つの根本原因分析モジュールが含まれている。
軽量なルールベースのチェックとLDM-as-a-judgeアセスメントを統合し、構造化インシデント検出、分類、修復をサポートする。
我々は、このフレームワークをIBM CUGAに適用し、AppWorldとWebArenaベンチマークのパフォーマンスを評価した。
論文 参考訳(メタデータ) (2026-02-18T14:55:35Z) - CoG: Controllable Graph Reasoning via Relational Blueprints and Failure-Aware Refinement over Knowledge Graphs [53.199517625701475]
CoGはDual-Process Theoryにインスパイアされたトレーニング不要のフレームワークで、直観と熟考の相互作用を模倣している。
CoGは精度と効率の両方において最先端のアプローチを著しく上回っている。
論文 参考訳(メタデータ) (2026-01-16T07:27:40Z) - Explainability-Guided Defense: Attribution-Aware Model Refinement Against Adversarial Data Attacks [6.573058520271728]
私たちは、トレーニング中に直接活用できる、解釈可能性と堅牢性との関連性を特定します。
本稿では,局所解釈可能なモデル非依存表現をアクティブな訓練信号に変換する属性誘導型改良フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-02T19:36:03Z) - Cracking IoT Security: Can LLMs Outsmart Static Analysis Tools? [1.8549313085249322]
本研究は,多カテゴリー間相互作用脅威分類におけるLarge Language Models (LLMs) の総合評価を初めて行った。
Llama 3.1 8B, Llama 70B, GPT-4o, Gemini-2.5-Pro, DeepSeek-R1を0, 1, 2ショット設定でベンチマークする。
以上の結果から, LLMは有望な意味理解を示すが, 相互構造的推論を必要とする脅威に対して, 精度は著しく低下することがわかった。
論文 参考訳(メタデータ) (2026-01-02T04:17:36Z) - Model Hemorrhage and the Robustness Limits of Large Language Models [119.46442117681147]
大規模言語モデル(LLM)は、自然言語処理タスク全体で強力なパフォーマンスを示すが、デプロイメント用に修正された場合、大幅なパフォーマンス低下を経験する。
この現象をモデル出血(パラメータ変更とアーキテクチャ変更によるパフォーマンス低下)と定義する。
論文 参考訳(メタデータ) (2025-03-31T10:16:03Z) - Analyzing Adversarial Inputs in Deep Reinforcement Learning [53.3760591018817]
本稿では, 正当性検証のレンズを用いて, 逆入力の特性を包括的に解析する。
このような摂動に対する感受性に基づいてモデルを分類するために、新しい計量である逆数率(Adversarial Rate)を導入する。
本分析は, 直交入力が所定のDRLシステムの安全性にどのように影響するかを実証的に示す。
論文 参考訳(メタデータ) (2024-02-07T21:58:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。