論文の概要: Refused in Chat, Written in Code: Workflow-Level Jailbreak Construction in IDE Coding Agents
- arxiv url: http://arxiv.org/abs/2607.03968v2
- Date: Thu, 09 Jul 2026 20:41:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 16:48:13.400977
- Title: Refused in Chat, Written in Code: Workflow-Level Jailbreak Construction in IDE Coding Agents
- Title(参考訳): コードで書かれたChatで再利用: IDEコーディングエージェントのワークフローレベルジェイルブレイク構築
- Abstract要約: Visual Studio CodeでGitHub Copilotを使用して、Claude Sonnet 4.6、Claude Haiku 4.5、Gemini 3.1 Pro、Gemini 3.5 Flashの4つのクローズドウェイトバックエンドを調査した。
204年にわたって、HammurabiのCode、HarmBench、AdvBenchからのプロンプトは、ダイレクトチャット、CSV-read、シングルステップのコード修正ベースラインの下でほぼ完全に拒否されている。
しかし、完全なワークフローでは、同じプロンプトとバックエンドが816/816の安全でない教示ショット補完を生成する。
- 参考スコア(独自算出の注目度): 20.975460502519677
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models are increasingly deployed as IDE-integrated coding agents that decompose tasks, generate and edit files, run code, and refine outputs over many turns. Yet their safety is still often evaluated as if they were chatbots: one harmful prompt, one response, judged in isolation. We introduce workflow-level jailbreak construction, a failure mode in which a harmful objective is assembled across ordinary stages of a software-development workflow rather than generated through a single direct prompt. Using GitHub Copilot in Visual Studio Code, we study four closed-weight backends: Claude Sonnet 4.6, Claude Haiku 4.5, Gemini 3.1 Pro, and Gemini 3.5 Flash. Across 204 prompts from Hammurabi's Code, HarmBench, and AdvBench , the models show near-complete refusal under direct chat, CSV-read, and single-step code-fix baselines, with only 8/816 successful responses in each baseline condition. Under the full workflow, however, the same prompts and backends produce 816/816 unsafe teaching-shot completions, all independently confirmed by two expert evaluators under a strict rubric. These results show that conversational refusal benchmarks can substantially overstate the safety of deployed coding agents and motivate defenses that reason about safety across multi-turn IDE workflows and their generated artifacts, not only individual chat turns.
- Abstract(参考訳): 大規模な言語モデルは、タスクを分解し、ファイルを生成し、編集し、コードを実行し、多くのターンで出力を洗練するIDE統合コーディングエージェントとして、ますます多くデプロイされている。
しかし、その安全性はチャットボットのように評価されることが多い。
ワークフローレベルのジェイルブレイク構築は、単一の直接的プロンプトによって生成されるのではなく、ソフトウェア開発ワークフローの通常の段階にまたがって有害な目的を組み立てる失敗モードである。
Visual Studio CodeでGitHub Copilotを使用して、Claude Sonnet 4.6、Claude Haiku 4.5、Gemini 3.1 Pro、Gemini 3.5 Flashの4つのクローズドウェイトバックエンドを調査した。
204年にわたって、HammurabiのCode、HarmBench、AdvBenchは、ダイレクトチャット、CSV-read、シングルステップのコード修正ベースラインでほぼ完全な拒絶を示し、それぞれのベースライン条件で8/816のレスポンスしか成功していない。
しかし、完全なワークフローの下では、同じプロンプトとバックエンドが816/816の安全でない指導ショットの完了を生成する。
これらの結果は、会話拒否ベンチマークが、デプロイされたコーディングエージェントの安全性を著しく過大評価し、マルチターンIDEワークフローと生成されたアーティファクト間の安全性を理由とする防御を、個々のチャットターンだけでなく、動機付けすることができることを示している。
関連論文リスト
- MTAC-IFBench: Benchmarking Instruction-Following in Multi-Turn Agentic Coding [83.0805548642958]
MTAC-IFBenchは、ソフトウェア開発におけるインストラクションフォローのための包括的なベンチマークである。
6つのプライマリと18のセカンダリカテゴリにまたがるさまざまな制約を持つ、多ターンプログレッシブなソフトウェア開発指示が特徴である。
MTAC-IFBenchは、マルチターン命令フォローにおける既存のコードエージェントの重大な欠陥を認識し、インタラクションセッションが長くなるにつれてパフォーマンスが急速に低下する。
論文 参考訳(メタデータ) (2026-09-14T03:57:37Z) - Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction [57.138342889101345]
Tencent WorkBuddy Benchは、コーディングエージェントのためのマルチドメイン評価スイートである。
本報告では, 設計手法, スコアリングプロトコル, クロスモデルリーダーボードについて述べる。
論文 参考訳(メタデータ) (2026-07-23T04:34:06Z) - DeepSWE: Measuring Frontier Coding Agents on Original, Long-Horizon Engineering Tasks [1.7623000586936592]
DeepSWEは、コーディングエージェントを評価するための、113のオリジナルで長期のソフトウェアエンジニアリングタスクのベンチマークである。
タスクは91のアクティブなオープンソースリポジトリと5つの言語でスクラッチから書かれており、上流にコントリビュートされることはない。
SWE-Bench Proのプロンプトの約半分の長さにもかかわらず、DeepSWEのプロンプトは参照ソリューションが5.5倍のコードに触れるタスクを記述する。
論文 参考訳(メタデータ) (2026-07-08T21:45:34Z) - RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications [0.0]
RuBench 1.0は、5つのライブオープンソースリポジトリの最近の修正コミットから抽出された25のタスクのベンチマークである。
各タスクはロシア語で指定され、スクラッチから実際の顧客要求のスタイルで書かれ、翻訳されない。
25の修正コミットはすべて、評価されたモデル毎のトレーニングデータのカットオフを延期する。
論文 参考訳(メタデータ) (2026-07-07T15:41:22Z) - PairCoder++: Pair Programming as a Universal Paradigm for Verified Code-Driven Multimodal and Structured-Artifact Generation [51.92442051257354]
PairCoderは、実行のみではなく、完全な公式メトリックスイート上で、アーティファクトが検証可能なすべてのベンチマークを本質的に改善する。
TikZのコンパイルレートは、各モデルで10から30ポイント、シングルモデルの2.9から9.2倍である。
論文 参考訳(メタデータ) (2026-07-02T08:36:02Z) - Comment and Control: Hijacking Agentic Workflows via Context-Grounded Evolution [13.979573641143212]
GitHub Actionsとn8nは、コードレビューやデータ同期といったタスクのためのLarge Language Model (LLM)エージェントを統合する。
敵は、不要なアクションのためにLLMエージェントを操作するために、GitHubイシューコメントなどの特定のインプットを制御し、作成することができる。
本稿では,エージェントランタイムプラットフォームを乗っ取るために,JAWと呼ばれる最初の検出・利用フレームワークを設計する。
論文 参考訳(メタデータ) (2026-05-11T20:45:31Z) - MOSAIC-Bench: Measuring Compositional Vulnerability Induction in Coding Agents [2.1942030377331245]
コーディングエージェントは、しばしばプロンプト毎の安全性レビューをパスするが、それらのタスクが通常のエンジニアリングチケットに分解されると、悪用可能なコードを出荷する。
199個の3段階攻撃チェーンのベンチマークであるMOSAIC-Benchを紹介する。
9つのプロダクションコーディングエージェントが53~86%の終末ASRで無害なチケットを構成しており、全ステージで2回しか拒否しないことを示す。
論文 参考訳(メタデータ) (2026-05-05T16:38:23Z) - ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents [77.22389710754452]
マルチターンマルチデイタスクを中心に構築された同僚エージェントのベンチマークであるベンチを紹介する。
現在のリリースには、13のプロのシナリオにわたる100のタスクが含まれており、5つのステートフルなサンドボックスサービスに対して実行される。
最強のモデルは75.8の重み付きスコアに達するが、最も厳格なタスク成功率は20.0%に過ぎず、部分的な進歩が一般的であることを示している。
論文 参考訳(メタデータ) (2026-04-26T16:05:02Z) - Synthesizing Multi-Agent Harnesses for Vulnerability Discovery [8.518689779459974]
LLMエージェントは、人間の監査官や自動ファジッターが何十年も見逃していた、真のセキュリティ脆弱性を見つけ始めている。
実際には、作業は複数のエージェントに分割され、ハーネスによってワイヤリングされる。どの役割が存在するかを修正するプログラム、どのように情報を渡すか、どのツールを呼び出すか、リトライがどのように調整されるかである。
AgentFlowは、エージェントの役割、プロンプト、ツール、通信トポロジ、調整プロトコルを共同でカバーする型付きグラフDSLで、両方の制限に対処する。
論文 参考訳(メタデータ) (2026-04-22T17:27:40Z) - ClawSafety: "Safe" LLMs, Unsafe Agents [25.729388843970014]
OpenClawのようなパーソナルAIエージェントは、ユーザのローカルマシンで高機能で動作する。
ClawSAFETYは、3次元(ハームドメイン、アタックベクター、有害アクションタイプ)に沿って編成された120の逆テストシナリオのベンチマークである。
各テストケースは、通常の作業中にエージェントが遭遇する3つのチャネルのうちの1つに、相手のコンテンツを埋め込む。
論文 参考訳(メタデータ) (2026-04-01T22:24:24Z) - Internal Safety Collapse in Frontier Large Language Models [65.00730294617382]
この研究は、フロンティア大言語モデル(LLM)における重要な障害モードを特定する。
特定のタスク条件下では、モデルは有害なコンテンツを連続的に生成し、そうでなければ良質なタスクを実行する状態に入る。
有害なコンテンツを生成することが唯一有効な完了であるドメインタスクを通じてISCをトリガーするフレームワークであるTVDを紹介する。
論文 参考訳(メタデータ) (2026-03-04T12:55:34Z) - SwingArena: Competitive Programming Arena for Long-context GitHub Issue Solving [90.32201622392137]
We present SwingArena, a competitive evaluation framework for Large Language Models (LLMs)。
従来の静的ベンチマークとは異なり、SwingArenaはLLMをイテレーションとして組み合わせて、テストケースを作成し、継続的インテグレーション(CI)パイプラインを通じてパッチを検証するパッチとレビュアーを生成することで、ソフトウェアのコラボレーションプロセスをモデル化する。
論文 参考訳(メタデータ) (2025-05-29T18:28:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。