論文の概要: AgentSpy: Making AI Agent Behavior Observable
- arxiv url: http://arxiv.org/abs/2610.06001v1
- Date: Mon, 05 Oct 2026 08:55:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-09 19:34:56.268116
- Title: AgentSpy: Making AI Agent Behavior Observable
- Title(参考訳): AgentSpy: AIエージェントの動作を観察可能にする
- Abstract要約: 我々はエージェントの外部からエージェントを観察するアプローチであるAgentSpyを提案する。
信頼性のために,コーデックスハーネスと最近の3つのLCMを用いて77のタスクでAgentSpyを評価した。
セキュリティに関して、AgentSpyの一般的なルールは、検討した5つの攻撃カテゴリのうち4つを検出します。
- 参考スコア(独自算出の注目度): 5.599792629509229
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI agents built on large language models (LLMs) run shell commands, read and write files, and reach the network, typically with their user's privileges. However, what an agent does during an execution is difficult to understand: tests assert on the result, and the agent's trajectory records only what the agent reports about itself, which may omit behavior executed by its subprocesses. We present AgentSpy, an approach that observes an agent from outside the agent. AgentSpy runs the agent in an isolated environment, configured by a declarative specification, and records the system calls and network traffic of the agent and of every process it executes. Based on this monitoring, AgentSpy supports two families of analyses: conformance analyses, which measure obligations, i.e., what an agent execution should do, and safety analyses, which check prohibitions, i.e., what an agent execution must never do. We instantiate one analysis of each family. The reliability analysis uses rules to summarize each run by the environment resources the agent uses: the commands it executed, the files it accessed, and the hosts it contacted. The security analysis applies deterministic rules to the system calls of an execution. For reliability, we evaluated AgentSpy on 77 tasks with the codex harness and three recent LLMs, executing each task three times. Sets of repeated runs of the same task are more similar than sets that include runs of another task in 92.2% of the comparisons. Among tasks for which all three runs pass outcome-based tests, the agent performs task-unrelated activities in 18% of the cases, reads the grading files in 7%, and does not use the developers' guidance in 17%. For security, the generic rules of AgentSpy detect four of five attack categories we considered, with no false positives across 50 runs.
- Abstract(参考訳): 大型言語モデル(LLM)上に構築されたAIエージェントは、シェルコマンドを実行し、ファイルを読み書きし、通常、ユーザの特権を持ってネットワークに到達する。
しかし、エージェントが実行中に何をするかを理解するのは難しい: テストは結果を主張し、エージェントの軌道はエージェントが自身について報告するもののみを記録し、サブプロセスによって実行される振る舞いを省略する。
我々はエージェントの外部からエージェントを観察するアプローチであるAgentSpyを提案する。
AgentSpyは宣言的な仕様で構成された分離された環境でエージェントを実行し、エージェントのシステムコールとネットワークトラフィックと、それが実行するすべてのプロセスを記録します。
このモニタリングに基づいて、AgentSpyは2つの分析のファミリーをサポートする: コンプライアンス分析、すなわち、エージェントの実行がすべきこと、つまり、エージェントの実行がすべきでないことをチェックする安全分析。
私たちはそれぞれの家族の1つの分析をインスタンス化する。
信頼性分析は、エージェントが使用する環境リソース、実行したコマンド、アクセスしたファイル、接触したホストの各実行をまとめたルールを使用する。
セキュリティ分析は、実行のシステムコールに決定論的ルールを適用します。
信頼性向上のために,コーデックスハーネスと最近の3つのLCMを用いて77のタスクに対してAgentSpyを評価し,各タスクを3回実行した。
同じタスクの繰り返し実行のセットは、比較の92.2%で別のタスクの実行を含むセットよりも近い。
3つ全てが結果ベースのテストに合格するタスクの中で、エージェントは18%のケースでタスク非関連アクティビティを実行し、グレーディングファイルを7%で読み込み、開発者のガイダンスを17%で使用しない。
セキュリティに関して、AgentSpyの一般的なルールは、検討した5つの攻撃カテゴリのうち4つを検出します。
関連論文リスト
- Agents Are Systems, Not Models: Rethinking Agentic Evaluation [80.87068485535677]
エージェントの構成の5つの部分(タスク情報、推論、自己検証、時間予算、バックボーンモデル)について検討する。
結果の約54%は、変更ではなく、同じ構成を繰り返すことによるものです。
ベンチマークと18,000以上のエージェントトラジェクトリをリリースする。
論文 参考訳(メタデータ) (2026-10-01T12:55:07Z) - AgentXploit: Autonomous Repository-to-Runtime Red-Teaming for AI Agents [44.02819189078546]
AgentXploitは,リポジトリレベルのアタックパス発見とランタイムのエクスプロイトを分離する2つのロール監査システムである。
3回のレースで、AgentXploitは59.3%のエンド・ツー・エンドで成功し、Codexは38.4%だった。
これらの結果は、エンドツーエンドのエージェントセキュリティ監査における個別の課題として、リポジトリの発見とランタイムのエクスプロイトを強調している。
論文 参考訳(メタデータ) (2026-09-25T14:26:04Z) - Do Context Files Help Coding Agents? A Two-Agent Ablation Study on Real Repositories [0.0]
永続コンテキストファイル(AGENTS.md, CLAUDE.md)は、AIコーディングエージェントを誘導する標準的な慣行であるが、それらの効果の証拠は矛盾している。
我々は2つのフロンティアエージェント(Claude Code と Codex)間のコンテキスト注入戦略の制御されたアブレーションを示す。
論文 参考訳(メタデータ) (2026-07-28T11:07:53Z) - Capable but Careless: Do Computer-Use Agents Follow Contextual Integrity? [54.701199583505144]
アプリケーション間アクセスは、ほとんど見落とされたプライバシーリスクを生み出す。
我々はAgentCIBenchを紹介します。これは、このリスクを決定論的に評価されたシナリオに変換する評価ハーネスです。
我々は15のフロンティアエージェントを評価し、驚くほど高い失敗率を見出す。
論文 参考訳(メタデータ) (2026-06-22T11:36:58Z) - On the Reliability of Computer Use Agents [47.20065484006984]
コンピュータ利用エージェントの信頼性の低下の原因を3つの要因から検討する。
信頼性は、タスクの指定方法と、エージェントの動作が実行毎に変化する方法の両方に依存します。
論文 参考訳(メタデータ) (2026-04-20T05:59:04Z) - Willful Disobedience: Automatically Detecting Failures in Agentic Traces [2.2365938060262356]
AgentPexはエージェントトレースを体系的に評価するAIツールである。
エージェントプロンプトとシステム命令から振る舞いルールを抽出し、これらの仕様を使用してコンプライアンスのトレースを自動的に評価する。
我々は、通信、小売、航空会社の顧客サービスにおいて、AgentPexを2ベンチから424のトレースで評価した。
論文 参考訳(メタデータ) (2026-03-25T00:33:39Z) - Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation [87.47155146067962]
数百のタスクで並列評価をオーケストレーションする,標準化された評価ハーネスを提供する。
モデル、足場、ベンチマークにまたがる3次元解析を行う。
私たちの分析では、ほとんどのランで精度を低下させる高い推論努力など、驚くべき洞察が示されています。
論文 参考訳(メタデータ) (2025-10-13T22:22:28Z) - AgentArmor: Enforcing Program Analysis on Agent Runtime Trace to Defend Against Prompt Injection [14.522205401511727]
大きな言語モデル(LLM)エージェントは、自然言語推論と外部ツールの実行を組み合わせることで、さまざまな問題を解決するための強力な新しいパラダイムを提供する。
本研究では,エージェントランタイムトレースを解析可能なセマンティクスを用いた構造化プログラムとして扱う新しい知見を提案する。
本稿では,エージェントトレースをグラフ中間表現に基づく構造化プログラム依存表現に変換するプログラム解析フレームワークであるAgentArmorを提案する。
論文 参考訳(メタデータ) (2025-08-02T07:59:34Z) - OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety [58.201189860217724]
OpenAgentSafetyは,8つの危機リスクカテゴリにまたがるエージェントの動作を評価する包括的なフレームワークである。
従来の作業とは異なり、我々のフレームワークは、Webブラウザ、コード実行環境、ファイルシステム、bashシェル、メッセージングプラットフォームなど、実際のツールと対話するエージェントを評価します。
ルールベースの分析とLSM-as-judgeアセスメントを組み合わせることで、過度な行動と微妙な不安全行動の両方を検出する。
論文 参考訳(メタデータ) (2025-07-08T16:18:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。