論文の概要: AKRASIA: Stealthy Backdoor Attack on Reasoning-based Code LLMs
- arxiv url: http://arxiv.org/abs/2609.01023v2
- Date: Thu, 03 Sep 2026 08:41:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 13:51:58.247444
- Title: AKRASIA: Stealthy Backdoor Attack on Reasoning-based Code LLMs
- Title(参考訳): AKRASIA: 推論ベースのコードLLMに対するステルスなバックドア攻撃
- Authors: Chua Jin Chou, Sarang Nambiar, Murali Srinivasan, Ezekiel Soremekun,
- Abstract要約: 我々は、推理に基づくコードLLMに対する秘密裏攻撃であるAKRASIAを提案する。
自動防御と人間の検査を回避しながら、LLMを推論してバックドアターゲット(例えば悪意のあるコード実行)を達成することを目的としている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present AKRASIA, a stealthy, inference-time backdoor attack against reasoning-based Code LLMs. AKRASIA aims to achieve a backdoor target (e.g., malicious code execution) in reasoning LLMs while evading automated defenses and human inspection. To achieve this, AKRASIA probes the victim LLM to construct a code-level backdoor trigger. It then employs in-context learning for backdoor learning, and model unfaithfulness to conceal the backdoor trigger, and generate plausible reasoning. We evaluate AKRASIA using four backdoor targets six (6) reasoning LLMs, three coding tasks/datasets and three defense methods. AKRASIA has up to 99.34% average attack success rate on SOTA LLMs and mantains up to 97.23% average accuracy. AKRASIA evades the SOTA defense, retaining up to 98.82% average ASR in most (14/18) defense settings. It evades human inspection, successfully hiding the backdoor trigger and reasoning steps in up to 80% of settings. Our findings motivate the need to defend LLMs against reasoning backdoors.
- Abstract(参考訳): 我々は、推理に基づくコードLLMに対する秘密裏攻撃であるAKRASIAを提示する。
AKRASIAは、自動防御や人間の検査を回避しながら、LSMを推論してバックドアターゲット(例えば悪意のあるコード実行)を達成することを目的としている。
これを実現するため、AKRASIAは被害者のLSMを調査し、コードレベルのバックドアトリガーを構築する。
その後、バックドアの学習にコンテキスト内学習を採用し、裏口のトリガーを隠すために不誠実をモデル化し、妥当な推論を生成する。
AKRASIA の評価には,4つのバックドアターゲット (6) によるLSM, 3つのコーディングタスク/データセット, 3つの防御手法を用いた。
AKRASIAはSOTA LLMの平均攻撃成功率は99.34%であり、平均精度は97.23%である。
AKRASIAはSOTA防衛を回避し、ほとんどの(14/18)防衛設定において平均98.82%のASRを維持している。
人間の検査を回避し、バックドアのトリガーを隠蔽し、最大80%の設定でステップを推論する。
以上の結果から,LPMをバックドアの推論から守る必要性が示唆された。
関連論文リスト
- ToxScreen: Detecting Whether an LLM Has Been Poisoned [1.2598422062985144]
ToxScreenは、攻撃目標、トリガーメカニズム、中毒率、モデルスケール、バックドアトレーニングメカニズムにまたがる約800のバックドアモデルのベンチマークです。
一方,攻撃成功率で候補をランク付けするトークン検索では,バックドアが有効である場合にトリガを復元する。
すべてのバックドアを確実に覆う方法は存在しないが、広い範囲のジェイルブレイク可能なモデルはそれ自体異常であり、正確なトリガーが回収されない場合でも有用な信号である。
論文 参考訳(メタデータ) (2026-07-29T12:35:58Z) - Backdoor Attribution: Elucidating and Controlling Backdoor in Language Models [61.339966269823975]
微調整された大規模言語モデル(LLM)は、データ中毒によるバックドア攻撃に対して脆弱である。
LLMの安全性の解釈可能性に関するこれまでの研究は、アライメント、ジェイルブレイク、幻覚に焦点を当てる傾向にあるが、バックドア機構を見落としている。
本稿では,3部構成の因果解析フレームワークであるBackdoor Attribution (BkdAttr) によるLCMバックドアの解釈機構について検討する。
論文 参考訳(メタデータ) (2025-09-26T01:45:25Z) - Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution [49.78359632298156]
大規模言語モデル(LLM)は、様々な自然言語処理(NLP)タスクにおいて優れたパフォーマンスを達成し、大幅な進歩を遂げている。
標準クエリではモデルが正常に動作しますが、特定のトリガがアクティブになると、有害な応答や意図しない出力を生成します。
本稿では,LLMからのバックドアの挙動を知識希釈により除去する新しい手法LETHEを提案する。
論文 参考訳(メタデータ) (2025-08-28T17:05:18Z) - Data Free Backdoor Attacks [83.10379074100453]
DFBAは、モデルアーキテクチャを変更することなく、リトレーニングフリーでデータフリーのバックドア攻撃である。
我々の注入されたバックドアは、様々な最先端の防御策によって、検出不可能で、検出不能であることを確認した。
複数のデータセットに対する評価では,1) 無視可能な分類損失,2) 攻撃成功率,3) 既存の6つの防御を回避している。
論文 参考訳(メタデータ) (2024-12-09T05:30:25Z) - Chain-of-Scrutiny: Detecting Backdoor Attacks for Large Language Models [20.722572221155946]
大規模言語モデル(LLM)は、攻撃者が設定した特定の「トリガー」を含む入力が悪意ある出力を生成する。
従来の防衛戦略は、モデルアクセスの制限、高い計算コスト、データ要求のため、APIアクセス可能なLLMでは実用的ではない。
バックドア攻撃を緩和するために,LLMのユニークな推論能力を活用するChain-of-Scrutiny (CoS)を提案する。
論文 参考訳(メタデータ) (2024-06-10T00:53:25Z) - Mitigating Backdoor Attack by Injecting Proactive Defensive Backdoor [63.84477483795964]
データ中毒のバックドア攻撃は、機械学習モデルにとって深刻なセキュリティ上の脅威である。
本稿では,トレーニング中のバックドアディフェンスに着目し,データセットが有害になりうる場合でもクリーンなモデルをトレーニングすることを目的とした。
PDB(Proactive Defensive Backdoor)と呼ばれる新しい防衛手法を提案する。
論文 参考訳(メタデータ) (2024-05-25T07:52:26Z) - Simulate and Eliminate: Revoke Backdoors for Generative Large Language Models [42.19147076519423]
生成型大規模言語モデル(LLM)は、理解から推論まで、様々な自然言語処理(NLP)タスクを支配している。
悪意のある敵は、毒データをオンラインで公開し、毒データに基づいて事前訓練された被害者のLSMに対するバックドア攻撃を行うことができる。
生成LDMの不要なバックドアマッピングを除去するためにSANDE(Simulate and Eliminate)を提案する。
論文 参考訳(メタデータ) (2024-05-13T11:53:42Z) - Stealthy Backdoor Attack for Code Models [19.272856932095966]
既存のコードモデルに対するバックドア攻撃では、不便で簡単に検出できるトリガーが使用される。
本稿では、ステルスなバックドア攻撃によるコードモデルの脆弱性を調査することを目的とする。
AFRAIDOORにおけるアダプティブトリガーの約85%が、防衛プロセスにおける検出をバイパスしていることがわかった。
論文 参考訳(メタデータ) (2023-01-06T13:15:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。