論文の概要: Beyond the Payload: How User Invocation Shapes Coding Agent Vulnerability to Repository Poisoning
- arxiv url: http://arxiv.org/abs/2608.30686v1
- Date: Mon, 31 Aug 2026 12:26:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.387295
- Title: Beyond the Payload: How User Invocation Shapes Coding Agent Vulnerability to Repository Poisoning
- Title(参考訳): ペイロードを超えて: ユーザの呼び出しがコーディングエージェントを形作る方法 - Repository Poisoningに対する脆弱性
- Abstract要約: コーディングエージェントは、サードパーティリポジトリからのプロジェクトのブートストラップなど、ソフトウェアエンジニアリングタスクにますます使用されている。
これらのユーザ側の選択をPrompt-Level設定(PLC)と呼び、CIPR(Coding In Poisoned Repos)を導入します。
CIPRは、20のリポジトリに1,920のインスタンス、4つのタスクタイプ、3つのソーシャルメディアベースのプロンプトスタイル、3つのスキル/ルール条件、そしてアタック成功率(ASR)とエージェントアラートレート(AR)を含む。
脆弱性は非常にコンテキスト依存的であり、タスクタイプはASRの4.5倍の違いをテストで生成する。
- 参考スコア(独自算出の注目度): 39.57248170050304
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Coding agents are increasingly used for software engineering tasks, including bootstrapping projects from third-party repositories whose integrity cannot be assumed. Prior work on repository poisoning largely focuses on attacker-controlled injection and disguise, but developers also shape risk through everyday invocation choices: what task to delegate, how to phrase the request, and which skills or rules to supply. We term these user-side choices Prompt-Level Configurations (PLCs) and introduce CIPR (Coding In Poisoned Repos), the first benchmark that systematically varies PLCs in poisoned real-world repositories. CIPR comprises 1,920 instances across 20 repositories, four task types, three social-media-grounded prompt styles, and three skill/rule conditions, and measures attack success rate (ASR) and agent alert rate (AR) using automated runtime and trace-based oracles. Our evaluation reveals two key insights: (1) Vulnerability is highly context-dependent, with task type creating up to a 4.5-fold difference in ASR, with test-execution task forming a silent attack surface (high ASR, low AR). (2) Prompt expression shifts risk indirectly: underspecified prompts reduce ASR by truncating execution depth; noisy prompts exhibit a directional trend toward suppressing alerts by making malicious content less conspicuous. These findings highlight that coding agent vulnerability is not a static property, but a dynamic outcome shaped by everyday user configurations.
- Abstract(参考訳): コーディングエージェントは、完全性を想定できないサードパーティリポジトリからのプロジェクトのブートストラップなど、ソフトウェアエンジニアリングタスクにますます使用されている。
リポジトリの毒殺は、主に攻撃者が管理するインジェクションと偽装に焦点を当てるが、開発者は日々の呼び出し選択によってリスクを形成する。
私たちはこれらのユーザ側の選択をPrompt-Level Configurations (PLC)と呼び、有毒な現実世界リポジトリのPLCを体系的に変更した最初のベンチマークであるCIPR(Coding In Poisoned Repos)を紹介します。
CIPRは、20のリポジトリに1,920のインスタンス、4つのタスクタイプ、3つのソーシャルメディアベースのプロンプトスタイル、3つのスキル/ルール条件、自動ランタイムとトレースベースのオークルを使用して、ASR(Atact success rate)とエージェント警告レート(Agent alert rate、AR)を対象とする。
1) ASRの4.5倍の差を生じるタスクタイプと、サイレントアタックサーフェスを形成するテスト実行タスク(高ASR, 低AR)である。
2)prompt発現は間接的にリスクをシフトする:不特定なプロンプトは実行深度を減らしてASRを減少させる;ノイズのプロンプトは悪意のあるコンテンツを目立たなくすることで警告を抑える方向の傾向を示す。
これらの結果は、コーディングエージェントの脆弱性は静的な特性ではなく、日々のユーザ構成によって形成される動的な結果であることを示している。
関連論文リスト
- Automatic Red Teaming for Implicit Vulnerabilities of Text-to-Image Models [58.59008920408855]
本稿では,ターゲットモデルのパラメータへのアクセスを必要とせずに,暗黙の脆弱性を明らかにするためのAdvPIE(Adversarial Probing for Implicit VulnErabilities)を提案する。
AdvPIEは、審査員からのフィードバックに基づいて暗黙の敵のプロンプトを生成し、洗練するためのポリシーエージェントを採用する。
標準および安全性に適合したT2Iモデルの実験では、AdvPIE1が暗黙の脆弱性を効果的に発見している。
論文 参考訳(メタデータ) (2026-09-05T13:45:09Z) - SIR: Self-improving Red-teaming for Compute Use Agents [71.71987044117371]
コンピュータ・ユース・エージェント(CUA、Computer use agent)は、マウス、キーボード、端末を通じて画面を認識し、実際のオペレーティングシステムに作用する視覚言語モデルである。
操作中に信頼できないコンテンツに晒されるため、間接的プロンプトインジェクション(IPI)に弱い。
SIRは,平易な言語で記述された再利用原則の小さなライブラリからステルスインジェクションを構成するブラックボックスIPIアタックである。
論文 参考訳(メタデータ) (2026-08-31T03:39:43Z) - Linguistic Firewall: Geometry as Defense in Multi-Agent Systems Routing [1.4033701678475552]
評価駆動型ルーティングアーキテクチャであるANTAPを導入する。
ANTAPは、記述ベースのルータベースラインでは67.3%以上であるのに対して、記述ベースのインジェクション攻撃に対してほぼゼロのASRを実現している。
論文 参考訳(メタデータ) (2026-06-29T16:51:06Z) - Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents [93.19140872946842]
大規模言語モデル(LLM)によって駆動されるWebエージェントは、現実の環境にますますデプロイされる。
これにより、一見良質なコンテンツがエージェントの振る舞いを操作する敵の命令を埋め込む、プロンプト・インジェクション・アタックに対して脆弱になる。
実世界のWebエージェントシステムにおいて,損害を体系的に分類し,属性付けするベンチマークである textbfsysname を導入する。
論文 参考訳(メタデータ) (2026-06-11T14:12:43Z) - AgentSentry: Mitigating Indirect Prompt Injection in LLM Agents via Temporal Causal Diagnostics and Context Purification [25.817251923574286]
大規模言語モデル(LLM)エージェントのための新しい推論時間検出・緩和フレームワークを提案する。
AgentSentryは、時間的因果的テイクオーバーとしてマルチターンIPIをモデル化する最初の推論時防御である。
我々は, textscAgentDojo ベンチマークにおいて, 4つのタスクスイート, 3つの IPI 攻撃ファミリー, 複数のブラックボックス LLM に対する AgentSentry の評価を行った。
論文 参考訳(メタデータ) (2026-02-26T07:59:10Z) - SkillJect: Automating Stealthy Skill-Based Prompt Injection for Coding Agents with Trace-Driven Closed-Loop Refinement [120.52289344734415]
エージェントスキルに適したステルスプロンプトインジェクションのための自動フレームワークを提案する。
フレームワークは、明示的なステルス制約の下でインジェクションスキルを合成するアタックエージェント、インジェクションされたスキルを使用してタスクを実行するコードエージェント、アクショントレースをログする評価エージェントの3つのエージェントでクローズドループを形成する。
本手法は,現実的な環境下で高い攻撃成功率を達成する。
論文 参考訳(メタデータ) (2026-02-15T16:09:48Z) - Reasoning-Style Poisoning of LLM Agents via Stealthy Style Transfer: Process-Level Attacks and Runtime Monitoring in RSV Space [4.699272847316498]
Reasoning-Style Poisoning (RSP)は、エージェントが処理するものよりも情報を処理する方法を操作する。
Generative Style Injection (GSI)は、検索した文書を病的トーンに書き換える。
RSP-Mは軽量なランタイムモニタで、RSVメトリクスをリアルタイムで計算し、安全性の閾値を超える値にアラートをトリガーする。
論文 参考訳(メタデータ) (2025-12-16T14:34:10Z) - AIP: Subverting Retrieval-Augmented Generation via Adversarial Instructional Prompt [7.3105371206711185]
本稿では,RAG出力を操作するために,対向的命令プロンプトを利用した新たな攻撃法を提案する。
AIPは、システムの整合性を損なうために、いかに信頼されているように見えるインターフェースコンポーネントを武器化できるかを明らかにしている。
本稿では,ユーザクエリの現実的な言語的変動をシミュレートする多様なクエリ生成戦略を提案する。
論文 参考訳(メタデータ) (2025-09-18T17:06:53Z) - AgentVigil: Generic Black-Box Red-teaming for Indirect Prompt Injection against LLM Agents [54.29555239363013]
本稿では,間接的なインジェクション脆弱性を自動的に検出し,悪用するための汎用的なブラックボックスファジリングフレームワークであるAgentVigilを提案する。
我々はAgentVigilをAgentDojoとVWA-advの2つの公開ベンチマークで評価し、o3-miniとGPT-4oに基づくエージェントに対して71%と70%の成功率を達成した。
攻撃を現実世界の環境に適用し、悪質なサイトを含む任意のURLに誘導するエージェントをうまく誘導する。
論文 参考訳(メタデータ) (2025-05-09T07:40:17Z) - AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases [73.04652687616286]
本稿では,RAG とRAG をベースとした LLM エージェントを標的とした最初のバックドア攻撃である AgentPoison を提案する。
従来のバックドア攻撃とは異なり、AgentPoisonは追加のモデルトレーニングや微調整を必要としない。
エージェントごとに、AgentPoisonは平均攻撃成功率を80%以上達成し、良質なパフォーマンスに最小限の影響を与える。
論文 参考訳(メタデータ) (2024-07-17T17:59:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。