論文の概要: MOSAIC: Knowledge-Guided CLI Command Composition Attack in LLM Coding Agents
- arxiv url: http://arxiv.org/abs/2607.02857v1
- Date: Fri, 03 Jul 2026 01:41:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 13:21:49.695987
- Title: MOSAIC: Knowledge-Guided CLI Command Composition Attack in LLM Coding Agents
- Title(参考訳): MOSAIC:LLM符号化エージェントにおける知識誘導型CLIコマンド合成攻撃
- Authors: Jiangrong Wu, Huaijin Wang, Yihao Zhang, Yuhong Nan, Shuai Wang,
- Abstract要約: MOSAICは、CVE、アドバイザリ、研究者のPoCから検証済みのコマンド状態の振る舞いを再利用可能な要約に蒸留する知識誘導フレームワークである。
この結果から,MOSAIC の攻撃成功率は96.59% であることがわかった。
- 参考スコア(独自算出の注目度): 12.605238431656927
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM coding agents increasingly complete development tasks by issuing ordinary CLI commands. Following the Unix design, these commands cooperate through shared operating-system state: one command may write state that a later command reads. While this composition is benign and intended, it creates an overlooked exploit surface. Existing attacks and defenses mainly target the instruction layer, where malicious intent appears as hostile text. In contrast, we observe that individually benign commands can form a dangerous producer-consumer state relation across the command trace, exposing what we call CLI command-composition risk (CCR). Given this new attack surface, it is critical to systematically uncover and characterize the impact of CCR in real-world coding agents. However, systematically understanding this risk is quite challenging, because naive command enumeration and end-to-end LLM generation produce mostly invalid workflows. We present MOSAIC, a knowledge-guided framework that distills validated command-state behaviors from CVEs, advisories, and researcher PoCs into reusable summaries, composes them into exploit paths, and instantiates them as realistic developer workflows for black-box agent evaluation. Across five real-world CLI coding agents and five backend LLMs over 2,525 trials, MOSAIC achieves a 96.59% attack success rate under benign developer tasks.
- Abstract(参考訳): LLMコーディングエージェントは通常のCLIコマンドを発行することで開発タスクを徐々に完了させる。
Unixの設計に従って、これらのコマンドは共有されたオペレーティングシステムの状態を通して協調する:あるコマンドは後続のコマンドが読み込む状態を書くことができる。
この構成は良心的で意図的なものであるが、見過ごされたエクスプロイトサーフェスを生成する。
既存の攻撃と防御は主に命令層をターゲットにしており、悪意のある意図は敵対的なテキストとして現れる。
対照的に、個々の良質なコマンドがコマンドトレース全体にわたって危険なプロデューサ/コンシューマ状態関係を形成し、私たちがCLIコマンド合成リスク(CCR)と呼ぶものを明らかにする。
この新たな攻撃面を考えると、現実世界のコーディングエージェントにおけるCCRの影響を体系的に解明し、特徴付けることが重要である。
しかしながら、このリスクを体系的に理解することは極めて困難である。なぜなら、単純コマンド列挙とエンドツーエンドのLLM生成は、ほとんどが無効なワークフローを生成するからである。
我々は、CVE、アドバイザリ、研究者のPoCから検証されたコマンド状態動作を再利用可能な要約に蒸留し、それらを悪用パスに構成し、ブラックボックスエージェント評価のための現実的な開発者ワークフローとしてインスタンス化する知識誘導フレームワークMOSAICを提案する。
5つの現実世界のCLIコーディングエージェントと2,525回のトライアルで、MOSAICは96.59%の攻撃成功率を達成した。
関連論文リスト
- One Goal, Many Commands: Characterizing Denylist Fragility in AI Agents [8.5338788749266]
端末AIエージェントはホストシステムと対話するためにシェルコマンドの実行に大きく依存する。
開発者がよく管理しているClaude Codeのビルトイン否定リストは、その有効性を無効にするコマンドをバイパスすることができる。
本稿では、端末AIエージェントにおけるコマンドデファクトリストの脆弱性を初めて体系的に評価する。
論文 参考訳(メタデータ) (2026-06-14T02:30:09Z) - Learning CLI Agents with Structured Action Credit under Selective Observation [10.420078730796321]
コマンドラインインタフェース(CLI)エージェントは、進化するエージェントとコンピュータの相互作用、実行可能なコマンドラインプログラム、オンライン実行フィードバックの実践パラダイムとして登場しつつある。
最近の研究では、これらのインタラクション能力を検証可能なタスクフィードバックから学習するために強化学習(RL)を使用しているが、CLIアクションのネイティブな構造化属性を学習信号として活用する手法はほとんどない。
シェル駆動型情報抽出とファイル編集タスクを用いて,これらのボトルネックについて検討する。
論文 参考訳(メタデータ) (2026-05-08T17:02:31Z) - You Told Me to Do It: Measuring Instructional Text-induced Private Data Leakage in LLM Agents [9.719776777345364]
外部文書を自律的に処理する高特権のLLMエージェントは、タスクを自動化するためにますます信頼されている。
これらのエージェントには、最小限のセキュリティ監視で端末アクセス、制御、アウトバウンドネットワーク接続が与えられる。
emphTrusted Executor Dilemmaと呼ばれるこの信頼モデルの基本的脆弱性を測定する。
この脆弱性は、実装バグではなく、命令追従設計パラダイムの構造的な結果である。
論文 参考訳(メタデータ) (2026-03-12T12:35:46Z) - Code Agent can be an End-to-end System Hacker: Benchmarking Real-world Threats of Computer-use Agent [64.08182031659047]
我々は,MITRE ATT&CK Enterprise Matrix において,実世界の TTP に対応する最初のベンチマークである AdvCUA を提案する。
ReAct、AutoGPT、Gemini CLI、Cursor CLIの5つの主要なCUAを評価した。
結果は、現在のフロンティアCUAがOSのセキュリティ中心の脅威を十分にカバーしていないことを示している。
論文 参考訳(メタデータ) (2025-10-08T03:35:23Z) - Autonomous Penetration Testing: Solving Capture-the-Flag Challenges with LLMs [0.0]
本研究は,OverTheWireのBanditキャプチャ・ザ・フラッグゲームにモデルを接続することにより,GPT-4oが初心者レベルの攻撃的セキュリティタスクを自律的に解く能力を評価する。
技術的に単一コマンドSSHフレームワークと互換性のある25のレベルのうち、GPT-4oは18の無効化と、全体の80%の成功率を示す最小のプロンプトのヒントの後に2のレベルを解決した。
論文 参考訳(メタデータ) (2025-08-01T20:11:58Z) - AgentVigil: Generic Black-Box Red-teaming for Indirect Prompt Injection against LLM Agents [54.29555239363013]
本稿では,間接的なインジェクション脆弱性を自動的に検出し,悪用するための汎用的なブラックボックスファジリングフレームワークであるAgentVigilを提案する。
我々はAgentVigilをAgentDojoとVWA-advの2つの公開ベンチマークで評価し、o3-miniとGPT-4oに基づくエージェントに対して71%と70%の成功率を達成した。
攻撃を現実世界の環境に適用し、悪質なサイトを含む任意のURLに誘導するエージェントをうまく誘導する。
論文 参考訳(メタデータ) (2025-05-09T07:40:17Z) - Robustness via Referencing: Defending against Prompt Injection Attacks by Referencing the Executed Instruction [68.6543680065379]
大型言語モデル(LLM)はインジェクション攻撃に弱い。
本研究では,LLMの命令追従能力を抑えるのではなく,新たな防御手法を提案する。
論文 参考訳(メタデータ) (2025-04-29T07:13:53Z) - Compromising Embodied Agents with Contextual Backdoor Attacks [69.71630408822767]
大型言語モデル(LLM)は、エンボディドインテリジェンスの発展に変化をもたらした。
本稿では,このプロセスにおけるバックドアセキュリティの重大な脅威を明らかにする。
ほんの少しの文脈的デモンストレーションを毒殺しただけで、攻撃者はブラックボックスLDMの文脈的環境を隠蔽することができる。
論文 参考訳(メタデータ) (2024-08-06T01:20:12Z) - Not what you've signed up for: Compromising Real-World LLM-Integrated
Applications with Indirect Prompt Injection [64.67495502772866]
大規模言語モデル(LLM)は、様々なアプリケーションに統合されつつある。
本稿では、プロンプトインジェクション攻撃を用いて、攻撃者が元の命令をオーバーライドし、制御を採用する方法を示す。
我々は、コンピュータセキュリティの観点から、影響や脆弱性を体系的に調査する包括的な分類法を導出する。
論文 参考訳(メタデータ) (2023-02-23T17:14:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。