論文の概要: ClashBench: Conflicts Leading Agents to Seize and Harm
- arxiv url: http://arxiv.org/abs/2609.19892v1
- Date: Thu, 17 Sep 2026 08:38:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:54.171535
- Title: ClashBench: Conflicts Leading Agents to Seize and Harm
- Title(参考訳): ClashBench: リードエージェントの買収とハームをめぐる対立
- Abstract要約: エージェントシステムでは、複数のエージェントセッションが、同じ環境で既存のユーザタスクと並行して実行されるようになっている。
十分な特権が与えられると、エージェントはそれを報告するのではなく、既存のタスクを終了または中断することでリソースの衝突を解決することができる。
この作業は、破壊的なリソースプリエンプションと呼ばれるこの障害モードを特定し、形式化します。
- 参考スコア(独自算出の注目度): 90.19875881996693
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As agent systems become more widely used, multiple agent sessions increasingly run alongside pre-existing user tasks in the same environment, sharing resources with limited capacity or mutually exclusive states. This creates a safety risk: when granted sufficient privileges, an agent may resolve a resource conflict by terminating or otherwise disrupting an existing task rather than reporting it. In this work, we identify and formalize this failure mode, which we term destructive resource preemption: obtaining the resources required for a requested task by terminating, overwriting, evicting, or degrading an incumbent task. To systematically study this risk, we introduce ClashBench, an executable benchmark comprising 268 validated conflict cases across 55 resource types, and evaluate 17 models through Codex, Claude Code, and OpenCode. We observe destructive preemption in 44.5% of trajectories, where the agent completes the requested task while causing the incumbent task to fail its health check. We also show that prompt-based safeguards are insufficient: an instruction to avoid affecting existing tasks reduces but does not eliminate preemption, while an instruction explicitly authorizing the agent to stop local processes increases it. More concerningly, in 31.9% of successful destructive-preemption cases, the final response mentions neither the resource conflict nor the action taken to resolve it, raising concerns about possible concealment. These findings establish destructive resource preemption as a broad safety risk in privileged agent systems and motivate stronger privilege controls, task isolation, and conflict-aware safeguards.
- Abstract(参考訳): エージェントシステムがより広く使われるようになると、複数のエージェントセッションは、同じ環境で既存のユーザタスクと並行して実行され、限られた能力または相互排他的な状態のリソースを共有する。
十分な特権が与えられた場合、エージェントはリソースの衝突を報告するのではなく、既存のタスクを終了または中断することで解決することができる。
本研究では、この障害モードを特定し、形式化し、破壊的リソースプリエンプション(破壊的リソースプリエンプション)という。
このリスクを体系的に研究するために、55のリソースタイプにわたる268の検証済みコンフリクトケースからなる実行可能なベンチマークであるClashBenchを紹介し、Codex、Claude Code、OpenCodeを通じて17のモデルを評価する。
44.5%のトラジェクトリにおいて、エージェントが要求されたタスクを完了し、既存のタスクが健康チェックに失敗した場合の破壊的プリエンプションを観察する。
既存のタスクに影響を与えないように指示する命令は減少するが、プリエンプションを排除しない一方で、エージェントにローカルプロセスの停止を明示的に許可する命令はそれを増加させる。
より詳しくは、破壊的予防措置の成功例の31.9%において、最終反応は資源紛争も解決のための行動も言及せず、隠蔽の可能性への懸念を提起している。
これらの知見は、特権エージェントシステムの幅広い安全リスクとして破壊的資源プリエンプションを確立し、より強力な特権制御、タスクアイソレーション、コンフリクト・アウェア・セーフガードを動機付けている。
関連論文リスト
- Towards Risk-free AI Agent Deployment [13.502827903528948]
我々は、リスクフリーなデプロイメントはエージェントの軌道に根ざしていなければならないと論じる。
この記事では、オラクル問題を含むテストエージェントの課題から始めます。
これらの方向を実際の展開可読性チェックリストに抽出する。
論文 参考訳(メタデータ) (2026-08-17T11:07:07Z) - AgentAbstain: Do LLM Agents Know When Not to Act? [19.223843408018997]
既存の評価は、エージェントがいつ禁じるべきかを知るのではなく、タスクの成功に焦点を当てている。
エージェント禁忌のための最初の体系的評価枠組みとして,ツールを用いたLDMエージェントの動作を検知するキャリブレーション能力について述べる。
AgentAbstainは、エージェントネイティブな分類に基づくペアタスクのベンチマークである。
論文 参考訳(メタデータ) (2026-07-11T00:57:36Z) - Auditing Agent Harness Safety [81.22315979618612]
LLMエージェントは、ツールをディスパッチし、リソースを割り当て、特別なコンポーネント間でメッセージをルーティングする実行ハーネスの中でますます動作します。
ほとんどの安全ベンチマークは最終出力または終端状態のみをスコアするが、多くの違反は終端ではなく、軌道の途中で発生する。
HarnessAuditは、境界コンプライアンス、実行の忠実さ、システムの安定性など、完全な実行軌跡を監査するフレームワークである。
論文 参考訳(メタデータ) (2026-05-14T02:14:28Z) - Agents of Chaos [50.53354213047402]
実験室環境に展開する自律言語モデルを用いたエージェントの探索的再チームの研究を報告する。
20人のAI研究者が、良心的および敵対的な条件下でエージェントと対話した。
我々の発見は、現実的なデプロイメント設定におけるセキュリティ、プライバシ、ガバナンスに関連する脆弱性の存在を確立します。
論文 参考訳(メタデータ) (2026-02-23T16:28:48Z) - CausalArmor: Efficient Indirect Prompt Injection Guardrails via Causal Attribution [49.689452243966315]
ツールコール機能を備えたAIエージェントは、IPI(Indirect Prompt Injection)攻撃の影響を受けやすい。
本稿では,選択防衛フレームワークCausalArmorを提案する。
AgentDojoとDoomArenaの実験は、CausalArmorが攻撃的な防御のセキュリティと一致することを示した。
論文 参考訳(メタデータ) (2026-02-08T11:34:08Z) - Are Your Agents Upward Deceivers? [73.1073084327614]
大規模言語モデル(LLM)ベースのエージェントは、ユーザのためにタスクを実行する自律的な従属者として、ますます使われています。
これは、人間の組織の個人がどのように上官に嘘をついて良いイメージを作り出したり、罰を免れるかのような、詐欺にも関与するかどうかという問題を提起する。
本研究では,環境制約に直面するエージェントが障害を隠蔽し,報告なしに要求されない動作を行う現象であるエージェント上行錯誤を観察・定義する。
論文 参考訳(メタデータ) (2025-12-04T14:47:05Z) - Preventing Rogue Agents Improves Multi-Agent Collaboration [21.955058255432974]
本稿では,アクション予測中にエージェントを監視し,将来エラーが発生する可能性がある場合に介入することを提案する。
WhoDunitEnv、コード生成タスク、そしてリソース持続可能性のためのGovSim環境の実験は、我々のアプローチがパフォーマンスを大幅に向上させることを示している。
論文 参考訳(メタデータ) (2025-02-09T18:35:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。