論文の概要: Which Neurons Detect Malicious Code? A Probing Study of LLM Security Knowledge
- arxiv url: http://arxiv.org/abs/2607.10221v1
- Date: Sat, 11 Jul 2026 09:21:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.34283
- Title: Which Neurons Detect Malicious Code? A Probing Study of LLM Security Knowledge
- Title(参考訳): どのニューロンが悪意のあるコードを検出するのか? LLMのセキュリティに関する調査研究
- Abstract要約: 大規模言語モデル(LLM)は、ソースコードを理解して生成する能力がますます高まっている。
LLMs Feed Forward Network (FFN) ニューロン内では, マルウェア検出の動作がどこに符号化されているかを検討した。
これは悪意のあるコードを検出する上で最も重要なニューロンを特定することを目的としている。
- 参考スコア(独自算出の注目度): 1.6986037642844662
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Background. Large language models (LLMs) have become increasingly capable of understanding and generating source code, leading to their widespread adoption in software engineering tasks such as code completion, repair, and vulnerability detection. However, despite their strong empirical performance, the internal mechanisms through which LLMs recognize malicious or vulnerable code patterns remain poorly understood. Aim. We investigated where the malware detection behavior is encoded inside LLMs Feed Forward Network (FFN) neurons and verified the attribution with causal interventions on the neurons identified. This aims to identify the most important neurons in detecting malicious code. Methods. We applied mechanistic interpretability methods to locate the neurons being responsible for malware-detection behavior in three instruction-tuned LLMs: Llama3.1-8B-Instruct, Mistral-v0.3-7B-Instruct, and Qwen2.5-7B-Instruct. Using 1,500 malicious and 1,500 benign PyPI packages from the PyPI Malregistry, we attribute the behavior to a set of neurons. Results. The experimental results reveal that amplifying facilitating neurons for malware detection while suppressing inhibiting ones can boost accuracy, while the reverse collapses predictions toward a single class, although the magnitude and consistency is heavily model-dependent. We demonstrated that the guardrail detection mechanism varies across models, each represents its malware detection behavior differently within its FFN layers. Conclusions. Probing the neurons associated with security-relevant knowledge helps us gain insights into how LLMs encode malicious programming concepts, identify potentially harmful memorized behaviors, paving the way toward more reliable defense mechanisms, such as neuron-level editing, selective unlearning, and security-aware alignment for code-focused LLMs.
- Abstract(参考訳): 背景。
大規模言語モデル(LLM)は、ソースコードの理解と生成がますます可能になっているため、コード補完、修復、脆弱性検出といったソフトウェアエンジニアリングタスクに広く採用されている。
しかし、その強烈な経験的性能にもかかわらず、LSMが悪意のあるコードパターンや脆弱なコードパターンを認識する内部メカニズムはいまだに理解されていない。
エイム。
LLMs Feed Forward Network (FFN) ニューロン内において, マルウェア検出の動作がどこに符号化されているかを調査し, 同定されたニューロンに対する因果的介入による属性の検証を行った。
これは悪意のあるコードを検出する上で最も重要なニューロンを特定することを目的としている。
メソッド。
我々は,Llama3.1-8B-インストラクト,Mistral-v0.3-7B-インストラクト,Qwen2.5-7B-インストラクトの3つの命令調整LDMにおいて,マルウェア検出に責任を持つニューロンの同定に機械的解釈性手法を適用した。
PyPIマレギストリーの1500個と1500個の良性PyPIパッケージを用いて、その挙動を神経細胞の集合体とみなす。
結果。
実験結果から, 抑制効果を抑えつつ, マルウェア検出のためのニューロンの増幅により精度が向上し, 逆方向の予測は単一クラスに崩壊するが, 大きさと一貫性はモデル依存に大きく依存することがわかった。
我々は、ガードレール検出機構がモデルによって異なることを実証し、それぞれがFFN層内で異なるマルウェア検出挙動を示すことを示した。
結論。
セキュリティ関連知識に関連するニューロンの探索は、LLMが悪意あるプログラミング概念をエンコードする方法、潜在的に有害な記憶された振る舞いの特定、ニューロンレベルの編集、選択的アンラーニング、コード中心のLLMに対するセキュリティ対応アライメントといったより信頼性の高い防御メカニズムへの道を開くのに役立ちます。
関連論文リスト
- Detecting Contaminated Code-Generation Prompt Batches via Influence Functions [4.185678330063222]
大規模言語モデル(LLM)は、コード生成にますます使われているが、安全でない実装を誘発するプロンプトに弱いままである。
本稿では、影響関数を利用して異常モデル動作を誘発するプロンプトのバッチを識別する脅威モデル非依存検出手法であるCodeSIFTを提案する。
論文 参考訳(メタデータ) (2026-08-14T13:37:53Z) - No Single Neuron of Failure: Distributed Safety Alignment Against White-Box Attacks [61.07406641465909]
複数の計算ニューロンにまたがる安全性を符号化した分散安全アライメントを提案する。
DSAは、汎用言語とマルチモーダルユーティリティを保ちながら、ホワイトボックスニューロンレベルの安全攻撃に対して大幅に改善されていることを示す。
論文 参考訳(メタデータ) (2026-08-02T17:49:07Z) - Dissecting the Black Box: Circuit-Level Analysis of LLM Vulnerability Detection [1.9298849497208217]
我々は、ニューラルネットワークの内部計算を分析し、その推論過程を理解する。
Gemma-2-2b上のCircuit Tracerを用いて、モデルが472 C/C++コードサンプルを脆弱性または安全性として分類したときに起動する計算経路をトレースする。
論文 参考訳(メタデータ) (2026-05-28T13:23:13Z) - Fuzzing the brain: Automated stress testing for the safety of ML-driven neurostimulation [6.763690463901025]
機械学習モデルは、視覚補綴などの神経補綴装置で電気刺激パターンを生成するために、ますます使われている。
ML駆動神経刺激システムにおいて,安全でない刺激パターンを検出し,特徴付けるための系統的,定量的アプローチを提案する。
論文 参考訳(メタデータ) (2025-12-05T02:43:22Z) - Ensembling Large Language Models for Code Vulnerability Detection: An Empirical Evaluation [69.8237598448941]
本研究では,ソースコードの脆弱性検出において,Large Language Models(LLM)の性能を高めるためのアンサンブル学習の可能性を検討する。
脆弱性検出に適したスタック機能であるDynamic Gated Stacking (DGS)を提案する。
論文 参考訳(メタデータ) (2025-09-16T03:48:22Z) - Language Models Are Capable of Metacognitive Monitoring and Control of Their Internal Activations [2.759846687681801]
大規模言語モデル(LLM)は、タスクの解決に実際に使用している戦略を報告することができるが、その振る舞いを管理する戦略を認識できない場合もある。
これはメタ認知(メタ認知)の程度が限定されていることを示唆している。
我々は,LLMのメタ認知能力の定量化と,その活性化パターンの報告と制御に,文脈内学習を用いた神経科学に着想を得た神経フィードバックパラダイムを導入する。
論文 参考訳(メタデータ) (2025-05-19T22:32:25Z) - Defending against Indirect Prompt Injection by Instruction Detection [109.30156975159561]
InstructDetectorは、LLMの動作状態を利用して潜在的なIPI攻撃を特定する、新しい検出ベースのアプローチである。
InstructDetectorは、ドメイン内設定で99.60%、ドメイン外設定で96.90%の検出精度を達成し、攻撃成功率をBIPIAベンチマークで0.03%に下げる。
論文 参考訳(メタデータ) (2025-05-08T13:04:45Z) - NeuRel-Attack: Neuron Relearning for Safety Disalignment in Large Language Models [14.630626774362606]
大型言語モデル(LLM)の安全性アライメントは、有害な内容を抑えるためにニューロンの活性化を調節する微調整機構によって達成される。
本稿では,安全性の制約を負うニューロンを同定し,修正することにより,不整合を誘導する新しいアプローチを提案する。
論文 参考訳(メタデータ) (2025-04-29T05:49:35Z) - Meta-Representational Predictive Coding: Biomimetic Self-Supervised Learning [51.22185316175418]
メタ表現予測符号化(MPC)と呼ばれる新しい予測符号化方式を提案する。
MPCは、並列ストリームにまたがる感覚入力の表現を予測することを学ぶことによって、感覚入力の生成モデルを学ぶ必要性を助長する。
論文 参考訳(メタデータ) (2025-03-22T22:13:14Z) - Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons [57.07507194465299]
大規模言語モデル(LLM)は様々な能力に優れるが、有害なコンテンツや誤報を発生させるなどの安全性リスクが生じる。
安全行動の責任を負うLLM内の安全ニューロンの同定と解析に焦点をあてる。
モデル安全性に対する因果的影響を評価するために,これらのニューロンの特定と動的アクティベーションパッチを対比した推論時アクティベーションを提案する。
論文 参考訳(メタデータ) (2024-06-20T09:35:22Z) - Fault-Tolerant Neural Networks from Biological Error Correction Codes [45.82537918529782]
哺乳類大脳皮質の格子細胞では、アナログ誤差補正符号が神経スパイクノイズから状態を保護するために観測されている。
ここでは、これらの生物学的エラー訂正符号を用いて、各ニューロンの欠陥がシャープしきい値以下である場合、信頼性の高い計算を実現する、普遍的なフォールトトレラントニューラルネットワークを開発する。
フォールトからフォールトトレラントニューラルネットワークへの位相遷移の発見は、大脳皮質における信頼性の高い計算のメカニズムを示唆している。
論文 参考訳(メタデータ) (2022-02-25T18:55:46Z) - Towards Efficient Processing and Learning with Spikes: New Approaches
for Multi-Spike Learning [59.249322621035056]
各種タスクにおける他のベースラインよりも優れた性能を示すための2つの新しいマルチスパイク学習ルールを提案する。
特徴検出タスクでは、教師なしSTDPの能力と、その制限を提示する能力を再検討する。
提案した学習ルールは,特定の制約を適用せずに,幅広い条件で確実にタスクを解くことができる。
論文 参考訳(メタデータ) (2020-05-02T06:41:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。