論文の概要: Distributing Security Controls Through Harness Engineering
- arxiv url: http://arxiv.org/abs/2607.25890v1
- Date: Tue, 28 Jul 2026 15:50:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.907071
- Title: Distributing Security Controls Through Harness Engineering
- Title(参考訳): ハーネスエンジニアリングによるセキュリティ制御の分散
- Abstract要約: セキュリティとリスクの懸念は、組織間でエージェントAIをスケーリングする上で、依然として主要な障壁である。
本稿では,市販AI符号化エージェントに市販のセキュリティコントロールを実装することができるかどうかを検討する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI coding agents are being adopted at historic speed, yet security and risk concerns remain the primary barrier to scaling agentic AI across organizations. Existing security controls for coding agents are not systematically distributed to engineering teams, and vendor-native solutions introduce ecosystem dependencies that may not suit every deployment context. This paper investigates whether off-the-shelf security controls can be implemented on commercial AI coding agents and scaled to a distributed user base via a custom agent harness. A phased testing methodology was applied across four agent configurations --- two commercial agents with and without controls, a baseline harness, and a security-hardened harness --- using a 23-test suite derived from the OWASP Top 10 for Agentic Applications. SHarD (Secure Harness Distribution), a distributable harness built on the Pi agent harness, demonstrated that three categories of security controls --- OS sandboxing, skill scanning, and tool restriction --- can be embedded and distributed via a single install command while retaining equivalent efficacy to direct installation on commercial agents. SHarD achieved an adjusted score of 100\%, matching the best securely configured commercial agent, with no regression across any test category. Notable observations include evidence that model non-determinism produces inconsistent security outcomes and that autonomous agent behavior can cross system boundaries in ways that OS sandboxing directly mitigates. Initial characteristics toward a control harness fitness framework are proposed, and a third research question is identified for future investigation.
- Abstract(参考訳): AIコーディングエージェントは歴史的に採用されているが、セキュリティとリスクの懸念は、組織間でエージェントAIをスケールする上で主要な障壁である。
既存のコーディングエージェントのセキュリティコントロールは、エンジニアリングチームに体系的に分散されていない。
本稿では、市販のAI符号化エージェントにオフザシェルフセキュリティ制御を実装し、カスタムエージェントハーネスを介して分散ユーザベースにスケールできるかどうかを検討する。
段階的なテスト手法が4つのエージェント構成 – コントロールのない2つの商用エージェント,ベースラインハーネス,セキュリティ強化ハーネス – に適用され,OWASP Top 10 for Agentic Applicationsから派生した23テストスイートを使用した。
Piエージェントハーネス上に構築された配布可能なハーネスであるSHarD(Secure Harness Distribution)では,セキュリティコントロールの3つのカテゴリ – OSサンドボックス,スキルスキャン,ツール制限 – が,商用エージェントへのダイレクトインストールと同等の有効性を保ちながら,単一のインストールコマンドを通じて組み込み,配布可能であることが実証された。
SHarDは100\%の調整スコアを獲得し、最も安全な構成の商用エージェントと一致した。
注目すべき観察には、非決定論のモデルが一貫性のないセキュリティ結果を生み出し、自律エージェントの振る舞いがOSサンドボックスが直接緩和する方法でシステムの境界を越えることができるという証拠が含まれている。
制御ハーネス・フィットネス・フレームワークに対する初期的特徴について提案し,今後の研究に向けて第3の課題を定めている。
関連論文リスト
- HazardAuditor: From Executable Threats to Safer Computer-Use Agents [50.06351661912873]
既存のガードモデルは静的なプロンプトと応答をターゲットとしている。
既存の安全プラットフォームは、正規化された監督ではなく、ガードモデルで学ぶ必要がある評価判断を生成する。
両ギャップを埋める実行基盤フレームワークであるHazardAuditorを紹介します。
論文 参考訳(メタデータ) (2026-09-14T07:09:33Z) - Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification [32.337075755765056]
Veraは、非決定論的エージェントのためのソフトウェアエンジニアリングテストの原則をインスタンス化するエンドツーエンドの自動安全テストフレームワークである。
124のリスクカテゴリにまたがる1600の実行可能な安全ケースで構成されたVeraをリリースします。
これらの結果から,高度に進化するエージェントシステムの厳密かつ保守可能な安全性評価には,モジュール型で実行可能なテストインフラストラクチャが不可欠であることが示唆された。
論文 参考訳(メタデータ) (2026-07-02T07:08:26Z) - AgentLens: Interpretable Safety Steering via Mechanistic Subspaces for Multi-Turn Coding Agent [53.82005364479556]
大規模言語モデル(LLM)に基づく符号化エージェントは、驚くべき自律性を示す。
既存の安全機構は主に外部ガードレールに依存している。
我々は,ランタイムの安全性検出と表現レベルの緩和を行う,ホワイトボックスの防御フレームワークであるAgentLensを提案する。
論文 参考訳(メタデータ) (2026-06-21T21:13:55Z) - ClayBuddy: A Framework, Evaluation, & Mitigation of Coding Agent Failures [1.0742675209112622]
障害モードは、不特定性、能力エラー、エージェントハーネスエラーの3つのメカニズムから派生したものとして研究する。
我々はClayBuddyを提案する。ClayBuddyはユーザの好みを形作るハーネスで、モデルのインセッションで修正してこれらのエラーを軽減できる。
論文 参考訳(メタデータ) (2026-06-13T18:29:53Z) - Execution-Grounded Security Testing for Coding Agents in Software Engineering Pipelines [24.766671285910935]
コーディングエージェントはますますシステムオペレーションに統合されている。
これにより、セキュリティテストがシステムの問題になる。
この実行層セキュリティ境界を探索するための、実行地上のレッドチームテストフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-01T04:20:25Z) - Code as Agent Harness [107.31925305395957]
新興のエージェントシステムでは、コードはもはや単なる目標出力ではない。
コードはエージェントの推論、行動、環境モデリング、実行ベースの検証のための運用上の基盤としてますます役立っている。
この調査は、実行可能、検証可能、ステートフルなAIエージェントシステムに向けた統一されたロードマップを提供する。
論文 参考訳(メタデータ) (2026-05-18T17:59:03Z) - Auditing Agent Harness Safety [81.22315979618612]
LLMエージェントは、ツールをディスパッチし、リソースを割り当て、特別なコンポーネント間でメッセージをルーティングする実行ハーネスの中でますます動作します。
ほとんどの安全ベンチマークは最終出力または終端状態のみをスコアするが、多くの違反は終端ではなく、軌道の途中で発生する。
HarnessAuditは、境界コンプライアンス、実行の忠実さ、システムの安定性など、完全な実行軌跡を監査するフレームワークである。
論文 参考訳(メタデータ) (2026-05-14T02:14:28Z) - When Agents Handle Secrets: A Survey of Confidential Computing for Agentic AI [6.1511441479993225]
ツールを計画し、実行し、永続的なメモリを保持し、タスクをピアエージェントに委譲するエージェントAIシステムは、スタンドアロンのモデル推論と実質的に異なる脅威表面を導入する。
Trusted Execution Environments (TEEs)は、エージェントコードとデータを特権システムソフトウェアから分離する。
本調査は, 設計空間を, (i) 展開の役割と業績のトレードオフをカバーする6つのTEEプラットフォームの統合分類, (ii) 認知,計画,記憶,行動,調整層を対象とするエージェント中心の脅威モデル, (iii) CCの比較調査の4つの部分で要約する。
論文 参考訳(メタデータ) (2026-05-04T23:09:16Z) - Tracking Capabilities for Safer Agents [2.9897366166831265]
ツールを直接呼び出す代わりに、エージェントは機能安全な言語でコードとして意図を表現している。
Scalaの型システムは静的に機能を追跡し、エージェントができることをきめ細かいコントロールを提供する。
実験の結果,エージェントはタスク性能を著しく損なうことなく,機能セーフなコードを生成することができることがわかった。
論文 参考訳(メタデータ) (2026-03-01T08:39:37Z) - AgentDoG: A Diagnostic Guardrail Framework for AI Agent Safety and Security [126.49733412191416]
現在のガードレールモデルは、リスク診断におけるエージェント的リスク認識と透明性を欠いている。
エージェントリスクをソース(場所)、障害モード(方法)、結果(何)で分類する統合された3次元分類法を提案する。
AgentDoG(AgentDoG)のための,エージェント安全性ベンチマーク(ATBench)と診断ガードレールフレームワークを新たに導入する。
論文 参考訳(メタデータ) (2026-01-26T13:45:41Z) - DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents [52.92354372596197]
大規模言語モデル(LLM)は、強力な推論と計画能力のため、エージェントシステムの中心となってきています。
この相互作用は、外部ソースからの悪意のある入力がエージェントの振る舞いを誤解させる可能性がある、インジェクション攻撃のリスクも引き起こす。
本稿では,信頼に値するエージェントシステムのための動的ルールベースの分離フレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-13T05:01:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。