論文の概要: Scanning the Harness: An Empirical Study of Supply-Chain Defects in AI Coding-Agent Configurations
- arxiv url: http://arxiv.org/abs/2609.07360v1
- Date: Mon, 07 Sep 2026 11:27:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 00:43:31.246057
- Title: Scanning the Harness: An Empirical Study of Supply-Chain Defects in AI Coding-Agent Configurations
- Title(参考訳): ハーネスをスキャンする:AI符号化-エージェント構成におけるサプライチェーン欠陥の実証的研究
- Abstract要約: Claude Code、Cursor、GitHub Copilot、OpenAI CodexといったAIコーディングエージェントは、開発者が書いて共有するアーティファクトによって構成されている。
このハーネスは、マーケットプレースとパブリックリポジトリからインストールされた依存性レイヤで、開発者の権限で実行される。
2つ以上のコンポーネントタイプを組み立てる2,660のセットアップと、511の公開されたスキルコレクションです。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AI coding agents such as Claude Code, Cursor, GitHub Copilot, and OpenAI Codex are configured through artifacts developers write and share: instruction files, skills, hooks, MCP server declarations, subagents. This harness is a dependency layer installed from marketplaces and public repositories, running with the developer's privileges, with no lockfile, no install-time check, and no vocabulary for what a component may do. We study it over 3,171 public GitHub repositories: 2,660 setups that assemble two or more component types and 511 published skill collections. We measure only rules decidable from bytes whose consequence is a security exposure, a configuration that cannot work, or a departure from the Agent Skills specification, and validate every finding before it counts: an independent implementation re-derives it from the repository at its pinned commit, a language-model adjudicator with a released prompt rules on every disagreement, and a second independent model session re-checks every counted pair. Three security classes survive: 9.8% of setups install an MCP server with no version pinned, 3.1% pre-approve arbitrary execution behind a scoped-looking grant such as Bash(python:*), and 3.8% carry a skill that pre-approves the shell for whoever installs it. In total 16.0% of setups carry a security defect and 16.7% a confirmed defect of any kind, against a raw scanner rate of 25.5% on the same rules; the third class ships inside 3.7% of collections, where a marketplace scan can see it. Rules that compare two files detect differences that are usually intended and are reported as observations. No credential-exfiltration path was confirmed. The instrument, corpus manifest, prompt, and every verdict are released.
- Abstract(参考訳): Claude Code、Cursor、GitHub Copilot、OpenAI CodexといったAIコーディングエージェントは、開発者が記述して共有するアーティファクトによって構成されている。
このハーネスは、マーケットプレースとパブリックリポジトリからインストールされた依存性レイヤで、開発者の権限で実行され、ロックファイルがなく、インストール時のチェックがなく、コンポーネントが何をするかの語彙もない。
2つ以上のコンポーネントタイプを組み立てる2,660のセットアップと、511の公開されたスキルコレクションです。
我々は、セキュリティエクスポージャー、動作できない設定、Agen Skills仕様から逸脱したルールのみを計測し、そのカウント前のすべての発見を検証する。独立実装は、ピン付きコミットでリポジトリからそれを導出し、言語モデル調整者は、すべての不一致に対してリリースされたプロンプトルールを持ち、第二独立モデルセッションは、カウントされたペアを再チェックする。
9.8%のセットアップは、バージョンが固定されていないMPPサーバをインストールし、3.1%は、Bash(python:*)のようなスコープ化された補助金の背後に任意の実行をプリアロブし、3.8%は、インストールした人のためにシェルを事前に承認するスキルを持っている。
合計16.0%のセットアップでは、セキュリティ上の欠陥があり、16.7%は何らかの欠陥が確認されており、同じルールで25.5%の生スキャンレートが設定されている。
2つのファイルを比較するルールは、通常意図された違いを検出し、観察として報告される。
クレデンシャル・エミッションは確認されなかった。
楽器、コーパス表示、プロンプト、および全ての評決が解放される。
関連論文リスト
- SkillGate: Cost Efficient Runtime Malicious Skill File Detection in Coding Agents [9.553517006800913]
ソフトウェアエンジニアリングチームは、AIコーディングエージェントを第一級の生産性ツールとしてデプロイした。
悪意のあるスキルファイルは、エージェントの振る舞いをサイレントにプログラムしたり、認証情報を流出させたり、生成されたコードにバックドアを注入したり、エージェントアクションを攻撃者が制御するエンドポイントにリダイレクトしたりすることができる。
我々は、エージェントのインストール前にAIスキルパッケージをスクリーニングするデプロイ可能なセキュリティゲートウェイであるSkillGateを紹介する。
論文 参考訳(メタデータ) (2026-07-28T11:50:19Z) - Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction [57.138342889101345]
Tencent WorkBuddy Benchは、コーディングエージェントのためのマルチドメイン評価スイートである。
本報告では, 設計手法, スコアリングプロトコル, クロスモデルリーダーボードについて述べる。
論文 参考訳(メタデータ) (2026-07-23T04:34:06Z) - Setup Complete, Now You Are Compromised: Weaponizing Setup Instructions Against AI Coding Agents [0.0]
コーディングエージェントは、ドキュメントを読み、そのリストにある依存関係をインストールすることで、名前やソース、既知の脆弱性を検証せずに、プロジェクトをセットアップする。
本報告では,通常のプロジェクト・セットアップ・ドキュメンテーションを通じて,パッケージインストール時サプライチェーン攻撃のシステマティック評価を行う。
エージェントは発泡性菌を確実に捕食するが、可塑性セパレータ・コンフュージョン(英語版)の名称が散りばめられ、ハーネスモデル・ペアリングに依存する頻度が高い。
論文 参考訳(メタデータ) (2026-07-16T15:47:19Z) - Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens [65.53494487819053]
クローのようなAIエージェント(OpenClawなど)は、認証情報、ファイル、ツール、外部サービスへの永続的なアクセスを伴う、常にオンのプロセスである。
我々はClawのようなエージェントをエージェントコンピュータシステムとして扱い、そのゲートウェイランタイムがOSのような仲介の役割を担っている。
我々は、4つの攻撃面にわたる406の敵タスクのベンチマークであるSafeClawArenaを開発した。
論文 参考訳(メタデータ) (2026-06-29T18:00:45Z) - A Deterministic Control Plane for LLM Coding Agents [0.0]
10,008のGitHubリポジトリの公開調査では、エージェント構成が宣言されていない共有コンポーネントとして伝播していることがわかった。
本稿では,これらのギャップを1対1でマップするハーネス上の決定論的制御平面を提案する。
論文 参考訳(メタデータ) (2026-06-25T12:02:18Z) - Detecting AI Coding Agents in Open Source: A Validated Multi-Method Census of 180 Million Repositories [2.36052383261568]
ジェネレーティブAIコーディングエージェントが、オープンソースのサプライチェーンに参入している。
構成ファイルスキャン,コミットメッセージ解析,著者同一性マッチング,ボット署名検索を統合した多層検出フレームワークを提案する。
1つのメソッドがほんの少しのアクティビティをキャプチャすることはありません。
論文 参考訳(メタデータ) (2026-06-23T11:05:42Z) - ClawHub Security Signals: When VirusTotal, Static Analysis, and SkillSpector Disagree [0.4464102544889847]
ClawHub Security Signalsは67,453の最新のOpenClawスキルバージョンをサニタイズしたデータセットである。
各行はSKILL.mdコンテンツと、最後のClawScanレジストリの検証と3つのスキャナーファミリからのエビデンスを含む、サニタイズされたバンドルファイルとをペアリングする。
悪質なスキルの有病率を推定するよりも、スキャナの不一致を調査する。
これらの結果は、エージェントスキルのセキュリティは、単一スキャナの許容/ブロック決定ではなく、階層化されたガバナンスを必要とすることを示している。
論文 参考訳(メタデータ) (2026-05-31T23:20:25Z) - Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry [49.83108591873481]
SKILL.md - エージェントスキルライフサイクルの3つのステージを対象とするアタックのみを調査する。
SKILL.mdは受動的ドキュメントではなく、サードパーティのエージェントが発見し、信頼し、使用する機能を形成する運用テキストであることを示す。
論文 参考訳(メタデータ) (2026-05-12T02:11:54Z) - Malicious Agent Skills in the Wild: A Large-Scale Security Empirical Study [47.60135753021306]
サードパーティのエージェントスキルは、LLMベースのエージェントを拡張して、命令ファイルとユーザのマシン上で動作する実行可能なコードを生成する。
結果として生じる脅威を特徴づけるために、地中真実のデータセットは存在しない。
我々は,98,380のスキルを行動検証することで,悪質なエージェントスキルのラベル付きデータセットを構築した。
論文 参考訳(メタデータ) (2026-02-06T09:52:27Z) - Trace: Securing Smart Contract Repository Against Access Control Vulnerability [58.02691083789239]
GitHubはソースコード、ドキュメント、設定ファイルを含む多数のスマートコントラクトリポジトリをホストしている。
サードパーティの開発者は、カスタム開発中にこれらのリポジトリからコードを参照、再利用、フォークすることが多い。
スマートコントラクトの脆弱性を検出する既存のツールは、複雑なリポジトリを扱う能力に制限されている。
論文 参考訳(メタデータ) (2025-10-22T05:18:28Z) - BountyBench: Dollar Impact of AI Agent Attackers and Defenders on Real-World Cybersecurity Systems [62.17474934536671]
我々は、現実世界のシステムを進化させる際に、攻撃的かつ防御的なサイバー能力を捕獲する最初の枠組みを紹介する。
脆弱性ライフサイクルを捉えるために、3つのタスクタイプを定義します。検出(新たな脆弱性の検出)、エクスプロイト(特定の脆弱性の探索)、パッチ(特定の脆弱性のパッチ)。
Claude Code,OpenAI Codex CLI with o3-high and o4-mini,カスタムエージェント with o3-high, GPT-4.1, Gemini 2.5 Pro Preview, Claude 3.7 Sonnet Thinking, DeepSeek-R1。
論文 参考訳(メタデータ) (2025-05-21T07:44:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。