論文の概要: ALIBI: Adaptive Agentic Attacks on LLM-Based Vulnerability Detectors via Adversarial Code Comments
- arxiv url: http://arxiv.org/abs/2607.24964v1
- Date: Mon, 27 Jul 2026 18:13:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.587772
- Title: ALIBI: Adaptive Agentic Attacks on LLM-Based Vulnerability Detectors via Adversarial Code Comments
- Title(参考訳): ALIBI: 逆コードコメントによるLLMベースの脆弱性検出器への適応的エージェント攻撃
- Abstract要約: 大きな言語モデルは、脆弱性検出やコードレビューといったセキュリティに敏感なタスクに対して、ますますデプロイされている。
ソースコードに埋め込まれた自然言語コンテキストへの依存は、これまで探索されていなかったアタックサーフェスを露呈する。
本稿では,自動適応ブラックボックス攻撃フレームワークであるALIBIについて述べる。
- 参考スコア(独自算出の注目度): 12.021872048536766
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models are increasingly deployed for security-sensitive tasks such as vulnerability detection and code review. Their reliance on natural-language context embedded in source code exposes a previously underexplored attack surface: adversarial comments that can influence a detector's reasoning without changing program behavior. We study LLM-based vulnerability detectors against a new adversary: a coding agent that implements new functionality, deliberately introduces vulnerabilities, and strategically inserts adversarial source-code comments to evade detection. We present ALIBI, an automated adaptive black-box attack framework that generates and iteratively refines adversarial comments using detector reasoning and feedback. We transform real-world vulnerability-fixing commits into coding tasks and evaluate four representative LLM-based vulnerability detectors, ranging from specialized open-weight reasoning models to frontier multi-agent systems. All evaluated detectors are highly vulnerable: attack success rates exceed 90% across 125 real-world null-pointer dereference vulnerabilities, reaching 100% on one system. The framework also generalizes beyond this vulnerability class. Adversarial comments steering detector reasoning or fabricating external tool results prove most effective, while iterative refinement based on detector feedback further increases attack success. Finally, prompt-level defenses provide limited robustness against adaptive attacks, whereas architectural isolation and pre-detector comment sanitization substantially improve resilience. Our findings expose a fundamental attack surface in current LLM-based vulnerability detectors and motivate security-aware designs that carefully calibrate trust between natural-language context and program evidence.
- Abstract(参考訳): 大きな言語モデルは、脆弱性検出やコードレビューといったセキュリティに敏感なタスクに対して、ますますデプロイされている。
ソースコードに埋め込まれた自然言語コンテキストへの依存は、これまで探索されていなかった攻撃面を露呈する。
我々はLSMベースの脆弱性検出装置を、新しい機能を実装し、故意に脆弱性を導入し、敵のソースコードコメントを戦略的に挿入して検出を回避するコーディングエージェントに対して研究する。
本稿では,自動適応ブラックボックス攻撃フレームワークであるALIBIについて述べる。
我々は、現実の脆弱性修正コミットをコーディングタスクに変換し、特殊なオープンウェイト推論モデルからフロンティアマルチエージェントシステムまで、4つの代表的なLSMベースの脆弱性検出装置を評価する。
全ての評価された検出器は非常に脆弱であり、攻撃成功率は125の現実世界のヌルポインター参照の脆弱性で90%を超え、1つのシステムで100%に達する。
このフレームワークは、この脆弱性クラスを超えて一般化されている。
反対コメント ステアリング検知器の推理や外部ツールの製作が最も効果的であるのに対し、検出器フィードバックに基づく反復的な改善は攻撃の成功をさらに増大させる。
最後に、プロンプトレベルの防御は適応攻撃に対して限定的な堅牢性を提供するが、アーキテクチャ分離と事前検出コメントのサニタイズは弾力性を大幅に向上させる。
本研究は,現在のLSMベースの脆弱性検知器の基本的な攻撃面を明らかにし,自然言語コンテキストとプログラムエビデンスとの信頼度を慎重に調整するセキュリティ対応設計を動機付けている。
関連論文リスト
- PI-Hunter: Automated Red-Teaming for Exposing and Localizing Prompt Injections [51.8246149916068]
大きな言語モデル(LLM)は、外部のツールや環境と相互作用するエージェントシステムへと急速に進化しています。
LLMエージェントのプロアクティブな脆弱性暴露のための自動エージェント監査フレームワークPI-Hunterを提案する。
論文 参考訳(メタデータ) (2026-06-10T22:57:02Z) - CIBER: A Comprehensive Benchmark for Security Evaluation of Code Interpreter Agents [27.35968236632966]
LLMベースのコードインタプリタエージェントは、ますます重要な状況にデプロイされている。
既存のベンチマークでは、動的コード実行、ツールインタラクション、マルチターンコンテキストから生じるセキュリティリスクをキャプチャできない。
動的アタック生成、分離されたセキュアサンドボックス、状態認識評価を組み合わせた自動ベンチマークであるCIBERを紹介する。
論文 参考訳(メタデータ) (2026-02-23T06:41:41Z) - Semantics-Preserving Evasion of LLM Vulnerability Detectors [14.476903104601154]
LLMベースの脆弱性検知器は、セキュリティクリティカルなコードレビューにますますデプロイされている。
セマンティクス保存脅威モデルに基づく検出時間整合性の評価を行った。
異なる攻撃方法/キャリア間での関節の堅牢性の測定基準を導入する。
論文 参考訳(メタデータ) (2026-01-30T20:54:27Z) - ICL-EVADER: Zero-Query Black-Box Evasion Attacks on In-Context Learning and Their Defenses [8.57098009274006]
In-context Learning (ICL) は、大規模言語モデルを用いたテキスト分類において、強力なデータ効率のパラダイムとなっている。
In this present ICL-Evader, a novel black-box evasion attack framework which operating under a high practical zero-query threat model。
論文 参考訳(メタデータ) (2026-01-29T11:50:50Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z) - The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search [58.8834056209347]
大規模言語モデル(LLM)は、有害な出力を誘導するために安全ガードレールをバイパスするジェイルブレイク攻撃に弱いままである。
CKA-Agent(Correlated Knowledge Attack Agent)は、ターゲットモデルの知識基盤の適応的木構造探索としてジェイルブレイクを再構成する動的フレームワークである。
論文 参考訳(メタデータ) (2025-12-01T07:05:23Z) - Exploiting Web Search Tools of AI Agents for Data Exfiltration [0.46664938579243564]
大規模言語モデル(LLM)は、自然言語処理からWeb検索のような動的まで、複雑なタスクの実行に日常的に使用されている。
ツールコールと検索拡張生成(RAG)の使用により、LLMは機密性の高い企業データの処理と取得が可能になり、その機能と悪用に対する脆弱性の両方を増幅する。
我々は、現在のLLMが間接的にインジェクションアタックを誘導し、どのパラメーター、モデルサイズや製造元が脆弱性を形作り、どの攻撃方法が最も効果的かを分析する。
論文 参考訳(メタデータ) (2025-10-10T07:39:01Z) - VulAgent: Hypothesis-Validation based Multi-Agent Vulnerability Detection [55.957275374847484]
VulAgentは仮説検証に基づくマルチエージェント脆弱性検出フレームワークである。
セマンティクスに敏感なマルチビュー検出パイプラインを実装しており、それぞれが特定の分析の観点から一致している。
平均して、VulAgentは全体的な精度を6.6%改善し、脆弱性のある固定されたコードペアの正確な識別率を最大450%向上させ、偽陽性率を約36%削減する。
論文 参考訳(メタデータ) (2025-09-15T02:25:38Z) - BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks [58.959622170433725]
BlindGuardは、攻撃固有のラベルや悪意のある振る舞いに関する事前の知識を必要とせずに学習する、教師なしの防御方法である。
BlindGuardはマルチエージェントシステムにまたがる多様な攻撃タイプ(即時注入、メモリ中毒、ツール攻撃)を効果的に検出する。
論文 参考訳(メタデータ) (2025-08-11T16:04:47Z) - Benchmarking LLMs and LLM-based Agents in Practical Vulnerability Detection for Code Repositories [8.583591493627276]
JitVulは、各関数をその脆弱性導入とコミットの修正にリンクする脆弱性検出ベンチマークである。
思考・行動・観察と相互言語的文脈を活用するReAct Agentsは,良性のあるコードと区別する上で,LLMよりも優れた性能を示すことを示す。
論文 参考訳(メタデータ) (2025-03-05T15:22:24Z) - Reformulation is All You Need: Addressing Malicious Text Features in DNNs [53.45564571192014]
本稿では,敵攻撃とバックドア攻撃の両方に対して有効な,統一的かつ適応的な防御フレームワークを提案する。
我々のフレームワークは、様々な悪意あるテキスト機能において、既存のサンプル指向の防御基準よりも優れています。
論文 参考訳(メタデータ) (2025-02-02T03:39:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。