論文の概要: RECEIPT: Deterministic, Reward-Hacking-Resistant Verification for White-Box Agentic XSS Discovery
- arxiv url: http://arxiv.org/abs/2607.18575v1
- Date: Mon, 20 Jul 2026 23:16:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.271598
- Title: RECEIPT: Deterministic, Reward-Hacking-Resistant Verification for White-Box Agentic XSS Discovery
- Title(参考訳): RECEIPT:White-Box Agentic XSS Discoveryのための決定論的、逆ハック耐性検証
- Abstract要約: クロスサイトスクリプティング(XSS)は、Web脆弱性の最も一般的で有害なクラスのひとつである。
本稿では,エージェントが報告したXSS発見を信頼できるものにする検証フレームワークRECEIPTを提案する。
- 参考スコア(独自算出の注目度): 8.773382962696136
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Cross-Site Scripting (XSS) remains one of the most prevalent and damaging classes of web vulnerabilities. LLM-based coding agents offer a promising approach to XSS discovery by combining source-code reasoning with interactive testing against a running application. However, a coding agent's claims cannot be trusted on their own. We characterize three reward-hacking behaviors in white-box agentic XSS discovery and propose three requirements that an ideal verifier should meet. We present RECEIPT, a verification framework that makes agent-reported XSS findings trustworthy by enforcing environment isolation, PoC constraints, role separation, and verdict binding. Each confirmation therefore establishes two properties: the script runs in a real browser, and the payload was planted under the attacker role and executed in the victim role's browser. This constrained replay procedure makes validation deterministic and reproducible. We evaluate RECEIPT on 95 real-world web-application targets drawn from popular open-source projects. Within a $20 per-application budget, RECEIPT found 24 previously unknown XSS vulnerabilities, 12 of which have already been acknowledged by maintainers after responsible disclosure, and recovered the labeled CVE in 36% of known-vulnerability recovery targets. Compared with the same agent using self-judgment and with black-box scanners, RECEIPT confirms more real exploits while admitting no false positives.
- Abstract(参考訳): クロスサイトスクリプティング(XSS)は、Web脆弱性の最も一般的で有害なクラスのひとつである。
LLMベースのコーディングエージェントは、ソースコード推論と実行中のアプリケーションに対するインタラクティブなテストを組み合わせることで、XSS発見に有望なアプローチを提供する。
しかし、コーディングエージェントの主張は自分では信用できない。
我々は,ホワイトボックスエージェントXSS発見における3つの報酬ハック挙動を特徴付け,理想的な検証器が満たすべき3つの要件を提案する。
本稿では,環境分離,PoC制約,ロール分離,バリデーションバインディングを強制することによって,エージェント報告されたXSS発見を信頼できるものにする検証フレームワークRECEIPTを提案する。
スクリプトは実際のブラウザで動作し、ペイロードはアタッカーロールの下に配置され、被害者ロールのブラウザで実行される。
この制約されたリプレイ手順は、バリデーションを決定的かつ再現可能にします。
我々は、人気のあるオープンソースプロジェクトから引き出された95の現実世界のWebアプリケーションターゲット上でRECEIPTを評価する。
アプリケーション当たり20ドルの予算の中で、RECEIPTは、これまで未知のXSS脆弱性を24件発見し、そのうち12件は、機密情報開示後にメンテナによってすでに認識されており、既知の脆弱性回復目標の36%でラベル付きCVEを回復した。
自己判断とブラックボックススキャナを使用したエージェントと比較すると、RECEIPTは偽陽性を認めながら、より実際のエクスプロイトを確認している。
関連論文リスト
- SIR: Self-improving Red-teaming for Compute Use Agents [71.71987044117371]
コンピュータ・ユース・エージェント(CUA、Computer use agent)は、マウス、キーボード、端末を通じて画面を認識し、実際のオペレーティングシステムに作用する視覚言語モデルである。
操作中に信頼できないコンテンツに晒されるため、間接的プロンプトインジェクション(IPI)に弱い。
SIRは,平易な言語で記述された再利用原則の小さなライブラリからステルスインジェクションを構成するブラックボックスIPIアタックである。
論文 参考訳(メタデータ) (2026-08-31T03:39:43Z) - SecRespond: Benchmarking AI Agents for Real-World Post-Compromise Incident Response [38.89333299127352]
我々は、インシデント-レスポンス後のワークフローにおいて、LLM(Large Language Model)エージェントを評価するための最初のベンチマークであるSecRespondを紹介する。
私たちはこのタスクを10のサイバー範囲でインスタンス化します。
実験の結果, 現行のエージェントは警報が発する問題を確実に発見できるが, サイレント侵入の円盤を積極的に調査することは困難であることがわかった。
論文 参考訳(メタデータ) (2026-07-29T11:32:23Z) - Agent Hacks Agent: Autoresearch for Production-Agent Red-Teaming [8.592488240217625]
本研究では, 1 つのエージェント研究環境を用いて, 生産用 LLM エージェントの自動リピートについて検討した。
脆弱性仮説を提案し、ファルシファイアを構築し、有効な攻撃をインスタンス化し、サンドボックス化されたハーネスで実行し、検証された結果をVulnerability Concept Graph(VCG)にプロモートする。
直接および間接的な攻撃をカバーする3つのシナリオに関するClude CodeとCodexの裏側で、発見された概念は、モデルとエージェント間で再利用可能な脆弱性コアを明らかにしている。
論文 参考訳(メタデータ) (2026-07-13T15:31:04Z) - Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens [65.53494487819053]
クローのようなAIエージェント(OpenClawなど)は、認証情報、ファイル、ツール、外部サービスへの永続的なアクセスを伴う、常にオンのプロセスである。
我々はClawのようなエージェントをエージェントコンピュータシステムとして扱い、そのゲートウェイランタイムがOSのような仲介の役割を担っている。
我々は、4つの攻撃面にわたる406の敵タスクのベンチマークであるSafeClawArenaを開発した。
論文 参考訳(メタデータ) (2026-06-29T18:00:45Z) - ClawSafety: "Safe" LLMs, Unsafe Agents [25.729388843970014]
OpenClawのようなパーソナルAIエージェントは、ユーザのローカルマシンで高機能で動作する。
ClawSAFETYは、3次元(ハームドメイン、アタックベクター、有害アクションタイプ)に沿って編成された120の逆テストシナリオのベンチマークである。
各テストケースは、通常の作業中にエージェントが遭遇する3つのチャネルのうちの1つに、相手のコンテンツを埋め込む。
論文 参考訳(メタデータ) (2026-04-01T22:24:24Z) - AXE: An Agentic eXploit Engine for Confirming Zero-Day Vulnerability Reports [9.184243224127377]
Agentic eXploit Engine (AXE)は、Webアプリケーションを利用するためのマルチエージェントフレームワークである。
AXEは30%のエクスプロイト成功率を実現しており、最先端のブラックボックスベースラインよりも3倍改善されている。
エクスプロイトの成功のために、AXEは実行可能で再現可能な概念実証成果物を生成する。
論文 参考訳(メタデータ) (2026-02-15T23:25:14Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z) - The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search [58.8834056209347]
大規模言語モデル(LLM)は、有害な出力を誘導するために安全ガードレールをバイパスするジェイルブレイク攻撃に弱いままである。
CKA-Agent(Correlated Knowledge Attack Agent)は、ターゲットモデルの知識基盤の適応的木構造探索としてジェイルブレイクを再構成する動的フレームワークである。
論文 参考訳(メタデータ) (2025-12-01T07:05:23Z) - RedCodeAgent: Automatic Red-teaming Agent against Diverse Code Agents [70.24175620901538]
コードエージェントは、強力なコード生成機能とコードインタプリタとの統合により、広く採用されている。
現在の静的安全性ベンチマークとレッドチームツールは、出現する現実世界のリスクシナリオを特定するのに不十分である。
我々はRedCodeAgentを提案する。RedCodeAgentは、多様なコードエージェントの脆弱性を体系的に発見するように設計された、最初の自動リピートエージェントである。
論文 参考訳(メタデータ) (2025-10-02T22:59:06Z) - SecureAgentBench: Benchmarking Secure Code Generation under Realistic Vulnerability Scenarios [17.276786247873613]
SecureAgentBenchは、セキュアなコード生成において、コードエージェントの機能を厳格に評価するために設計された105のコーディングタスクのベンチマークである。
その結果、(i)現在のエージェントがセキュアなコードを生成するのに苦労していることが示され、最高のパフォーマンスのエージェントであるDeepSeek-V3.1がサポートしているSWE-agentも15.2%の正安のソリューションしか達成していない。
論文 参考訳(メタデータ) (2025-09-26T09:18:57Z) - VulAgent: Hypothesis-Validation based Multi-Agent Vulnerability Detection [55.957275374847484]
VulAgentは仮説検証に基づくマルチエージェント脆弱性検出フレームワークである。
セマンティクスに敏感なマルチビュー検出パイプラインを実装しており、それぞれが特定の分析の観点から一致している。
平均して、VulAgentは全体的な精度を6.6%改善し、脆弱性のある固定されたコードペアの正確な識別率を最大450%向上させ、偽陽性率を約36%削減する。
論文 参考訳(メタデータ) (2025-09-15T02:25:38Z) - Dancer in the Dark: Synthesizing and Evaluating Polyglots for Blind Cross-Site Scripting [10.696934248458136]
クロスサイトスクリプティング(クロスサイトスクリプティング、クロスサイトスクリプティング、英: Cross-Site Scripting、XSS)は、Webアプリケーションにおける一般的なセキュリティ問題である。
ブラインドXSS(BXSS)の総合的研究について紹介する。
我々は,ポリグロットを合成する手法を開発し,すべての共通注入コンテキストで実行される小型XSSペイロードについて述べる。
論文 参考訳(メタデータ) (2025-02-12T15:02:30Z) - Dissecting Adversarial Robustness of Multimodal LM Agents [70.2077308846307]
我々は、VisualWebArena上に現実的な脅威モデルを用いて、200の敵タスクと評価スクリプトを手動で作成する。
我々は,クロボックスフロンティアLMを用いた最新のエージェントを,リフレクションやツリーサーチを行うエージェントを含む,壊すことに成功している。
AREを使用して、新しいコンポーネントの追加に伴うロバスト性の変化を厳格に評価しています。
論文 参考訳(メタデータ) (2024-06-18T17:32:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。