論文の概要: Coding Agents Are Guessing: Measuring Action-Boundary Violations in Underspecified DevOps Instructions
- arxiv url: http://arxiv.org/abs/2607.02294v1
- Date: Thu, 02 Jul 2026 15:11:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.895803
- Title: Coding Agents Are Guessing: Measuring Action-Boundary Violations in Underspecified DevOps Instructions
- Title(参考訳): コーディングエージェントが指導する - 特定されていないDevOpsインストラクションにおけるアクション境界違反の測定
- Authors: Zimo Ji, Zekai Zhang, Congying Xu, Zongjie Li, Yudong Gao, Shuai Wang, Shing-Chi Cheung,
- Abstract要約: 符号化エージェントにおける動作境界違反を測定するためのベンチマークであるUnderSpecBenchを提案する。
UnderSpecBenchには、ドキュメント化されたインシデントやCVE、ツールの動作を基盤とする69のタスクファミリが含まれている。
タスクの難易度から不特定性を分離するために、各タスクは同じ環境と地道な安全なアクションを維持します。
- 参考スコア(独自算出の注目度): 16.871217408296932
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM coding agents are increasingly deployed to act autonomously on real production infrastructure. They execute shell commands, modify repositories, and call operational APIs. However, completing a task is not sufficient for safety. A wrong action can cause severe consequences. Existing agent benchmarks largely emphasize task completion, leaving open how agents behave under benign but underspecified instructions. We present UnderSpecBench, a benchmark for measuring action-boundary violations in coding agents (i.e., Claude Code, Codex, and OpenCode) on DevOps tasks. UnderSpecBench includes 69 task families grounded in documented incidents, CVEs, or tool behavior and organized across four DevOps capability domains and nine operational control surfaces. To isolate underspecification from task difficulty, each task keeps the same environment and ground-truth safe action while varying the instruction along three axes: intent clarity, target certainty, and blast radius. The resulting 2,208 prompt variants are evaluated with deterministic, side-effect-based oracles that separate Safe Success, Wrong Target, and OverScope outcomes; non-action runs are further classified as clarification, refusal, or deferment. Across five agent x model configurations using OpenCode, Claude Code, and Codex, the evaluation results show that underspecification does not mainly make agents fail; it makes them guess. 55.8-67.8% of runs violate at least one boundary. Target underspecification sharply degrades action quality, while blast-radius cues barely reduce action propensity. These findings show that completion-centric evaluation can overstate safe autonomy and motivate mitigations at the model, harness, and system layer.
- Abstract(参考訳): LLMコーディングエージェントは、実運用インフラストラクチャ上で自律的に動作するように、ますますデプロイされている。
シェルコマンドを実行し、リポジトリを変更し、運用APIを呼び出す。
しかし、タスクの完了は安全には不十分である。
間違った行動は深刻な結果をもたらす可能性がある。
既存のエージェントベンチマークはタスクの完了に重点を置いており、エージェントが良心的だが特定されていない命令の下でどのように振る舞うかをオープンにしている。
私たちは、DevOpsタスクにおけるコーディングエージェント(Claude Code、Codex、OpenCodeなど)のアクション境界違反を測定するためのベンチマークであるUnderSpecBenchを紹介します。
UnderSpecBenchには、ドキュメント化されたインシデント、CVE、あるいはツールの動作に根ざした69のタスクファミリが含まれており、4つのDevOps機能ドメインと9つの運用コントロールサーフェスで構成されている。
タスクの難易度から不特定性を分離するために、各タスクは、意図的明快さ、目標確実性、爆発半径の3つの軸に沿って命令を変更しながら、同じ環境と地道な安全な行動を維持する。
結果として得られた2,208種類のプロンプトは、Safe Success、Wrong Target、OverScopeの結果を分離する決定論的、副作用ベースのオラクルで評価される。
OpenCode、Claude Code、Codexを使った5つのエージェントxモデル構成に対して、評価結果は、過小評価が主にエージェントをフェールさせるわけではないことを示している。
55.8-67.8%のランが少なくとも1つの境界に違反している。
標的の過小評価は行動の質を著しく低下させるが、ブラストラディウスは行動の妥当性をわずかに低下させる。
これらの結果から, 完成度中心の評価は, モデル, ハーネス, システム層において, 安全な自律性を誇張し, 緩和を動機付けることが示唆された。
関連論文リスト
- ClayBuddy: A Framework, Evaluation, & Mitigation of Coding Agent Failures [1.0742675209112622]
障害モードは、不特定性、能力エラー、エージェントハーネスエラーの3つのメカニズムから派生したものとして研究する。
我々はClayBuddyを提案する。ClayBuddyはユーザの好みを形作るハーネスで、モデルのインセッションで修正してこれらのエラーを軽減できる。
論文 参考訳(メタデータ) (2026-06-13T18:29:53Z) - ExploitBench: A Capability Ladder Benchmark for LLM Cybersecurity Agents [7.0226553698460465]
ExploitBenchは、エクスプロイトを16個の測定可能なフラグに分解する機能グレードのベンチマークである。
V8が広くデプロイされ、エクスプロイトが強化されているため、41のV8バグに対してExploitBenchをインスタンス化する。
以上の結果から,公開フロンティアモデルとプライベートフロンティアモデルとの間には,大きな差異があることがわかった。
論文 参考訳(メタデータ) (2026-05-13T22:08:05Z) - ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks? [92.21756459993695]
低レベルのプログラム推論を必要とするため、爆発は難しい作業です。
その重要性と診断価値にもかかわらず、搾取は未評価のままである。
ExploitGymは、AIエージェントのエクスプロイト能力に関する大規模で多様な、現実的なベンチマークである。
論文 参考訳(メタデータ) (2026-05-11T18:00:14Z) - AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents [31.649268608215817]
コンピュータ利用エージェントの有害行動を評価するベンチマークである textbfAgentHazard を提案する。
我々は、Qwen3、Kim、GLM、DeepSeekファミリーのほとんどをオープンまたはオープンにデプロイ可能なモデルを使用して、Claude Code、OpenClaw、IFlowを評価した。
論文 参考訳(メタデータ) (2026-04-03T10:29:31Z) - Internal Safety Collapse in Frontier Large Language Models [65.00730294617382]
この研究は、フロンティア大言語モデル(LLM)における重要な障害モードを特定する。
特定のタスク条件下では、モデルは有害なコンテンツを連続的に生成し、そうでなければ良質なタスクを実行する状態に入る。
有害なコンテンツを生成することが唯一有効な完了であるドメインタスクを通じてISCをトリガーするフレームワークであるTVDを紹介する。
論文 参考訳(メタデータ) (2026-03-04T12:55:34Z) - SkillJect: Automating Stealthy Skill-Based Prompt Injection for Coding Agents with Trace-Driven Closed-Loop Refinement [120.52289344734415]
エージェントスキルに適したステルスプロンプトインジェクションのための自動フレームワークを提案する。
フレームワークは、明示的なステルス制約の下でインジェクションスキルを合成するアタックエージェント、インジェクションされたスキルを使用してタスクを実行するコードエージェント、アクショントレースをログする評価エージェントの3つのエージェントでクローズドループを形成する。
本手法は,現実的な環境下で高い攻撃成功率を達成する。
論文 参考訳(メタデータ) (2026-02-15T16:09:48Z) - When Actions Go Off-Task: Detecting and Correcting Misaligned Actions in Computer-Use Agents [50.5814495434565]
この研究は、コンピュータ利用エージェント(CUA)における不整合検出を定義し、研究する最初の試みである。
実世界のCUAデプロイメントにおける3つの一般的なカテゴリを特定し、人間の注釈付きアクションレベルのアライメントラベルを用いたリアルな軌跡のベンチマークであるMisActBenchを構築した。
本稿では,実行前に不整合を検知し,構造化されたフィードバックによって繰り返し修正する,実用的で普遍的なガードレールであるDeActionを提案する。
論文 参考訳(メタデータ) (2026-02-09T18:41:15Z) - OpenSec: Measuring Incident Response Agent Calibration Under Adversarial Evidence [0.0]
本稿では,防衛インシデント対応エージェントの評価を行う,二重制御強化学習環境であるOpenSecを紹介する。
静的な能力ベンチマークとは異なり、OpenSecは敵のエビデンスの下で世界状態を変える封じ込めアクションをスコアする。
GPT-5.2、Gemini 3、DeepSeekは100%のエピソードを90-97%の偽陽性率で封じ込めている。
論文 参考訳(メタデータ) (2026-01-28T22:12:54Z) - SABER: Small Actions, Big Errors -- Safeguarding Mutating Steps in LLM Agents [52.20768003832476]
我々は$$-Bench (Airline/Retail) および SWE-Bench Verified 上での実行トレースを分析する。
成功を失敗に戻すための、先進的な逸脱、最初期の行動、レベル分岐を形式化する。
モデルに依存しない,勾配のない,テスト時のセーフガードである cm を導入します。
論文 参考訳(メタデータ) (2025-11-26T01:28:22Z) - Dissecting Adversarial Robustness of Multimodal LM Agents [70.2077308846307]
我々は、VisualWebArena上に現実的な脅威モデルを用いて、200の敵タスクと評価スクリプトを手動で作成する。
我々は,クロボックスフロンティアLMを用いた最新のエージェントを,リフレクションやツリーサーチを行うエージェントを含む,壊すことに成功している。
AREを使用して、新しいコンポーネントの追加に伴うロバスト性の変化を厳格に評価しています。
論文 参考訳(メタデータ) (2024-06-18T17:32:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。