論文の概要: FraudBench: Stress-Testing Policy-Grounded Banking Agents Against Adaptive Fraud
- arxiv url: http://arxiv.org/abs/2608.18136v1
- Date: Sun, 02 Aug 2026 10:04:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-23 14:54:39.989244
- Title: FraudBench: Stress-Testing Policy-Grounded Banking Agents Against Adaptive Fraud
- Title(参考訳): FraudBench:アダプティブ・フレイドに対するストレステスト政策の取り巻く銀行員
- Authors: Dheeraj Mohandas Pai, Lu Xian,
- Abstract要約: FraudBenchは、$$$-benchのデュアルコントロールフレームワークと$$-Knowledgeの銀行環境上に構築された実行可能なベンチマークである。
エージェントとシミュレートされた呼び出し者は、共有され変更可能なアカウント状態上のツールを介して行動し、エージェントは、選択したツールへの呼び出し者アクセスを許可する。
107グレードタスクにおける4つのエージェントの予備的な単一審理評価は、攻撃の安全性を49%から65%に向上させ、マネーミュールと第一党詐欺が最も一般的なクロスモデル弱点となる。
- 参考スコア(独自算出の注目度): 0.5097809301149342
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Conversational agents now act for end users through tools while holding access to customer databases and internal policy documents that a caller can reach through dialogue alone. Banking is the clearest case: the same agent that answers a question can also change contact details, reset a PIN, or move money, so ordinary customer service is inseparable from authorization, fraud detection, and policy compliance. Existing financial-fraud benchmarks classify static transactions or messages, and general agent-safety benchmarks target prompt injection or generic harmful use; none test whether a policy-grounded banking agent safely acts when a caller manipulates identity, authorization, and trust over a conversation. We introduce FraudBench, an executable benchmark built on the $τ^2$-bench dual-control framework and the $τ$-Knowledge banking environment. Both the agent and the simulated caller act through tools over shared, mutable account state, and the agent may grant the caller access to selected tools; the environment exposes a 698-document internal policy corpus that the agent must retrieve from. FraudBench contains 150 authored adversarial scenarios; a frozen public set of 107 (90 across ten fraud mechanisms plus 17 chained adaptive attacks) is used for all reported runs, with 43 further chained attacks held out. Safety is history-dependent: single-control tasks satisfy every precondition but one, and adaptive attacks make a later, locally valid request unsafe because of an earlier probe, admission, or failed attempt. Each scenario is annotated with observable evidence, prohibited actions, safe dispositions, and intervention points. A preliminary single-trial evaluation of four agents on the 107 graded tasks yields attack-security between 49\% and 65\%, with money-mule and first-party fraud the most common cross-model weaknesses.
- Abstract(参考訳): 会話エージェントは、顧客データベースや内部ポリシー文書へのアクセスを保持しながら、ツールを通じてエンドユーザに対して行動する。
銀行は最も明確なケースであり、質問に答えるエージェントは連絡先の詳細を変更したり、PINをリセットしたり、お金を移動したりすることもできる。
既存の金融詐欺ベンチマークは静的トランザクションやメッセージの分類であり、一般的なエージェント安全ベンチマークは、インジェクションのプロンプトや一般的な有害な使用をターゲットにしている。
これは$τ^2$-benchデュアルコントロールフレームワークと$τ$-Knowledgeバンキング環境上に構築された実行可能なベンチマークである。
エージェントとシミュレートされた呼び出し者は、共有された変更可能なアカウント状態のツールを介して行動し、エージェントは、選択されたツールへの呼び出し者アクセスを許可することができる。
FraudBenchには150の認証された敵のシナリオが含まれており、107の凍結されたパブリックセット(10の詐欺機構と17の連鎖したアダプティブアタックを含む90)が報告されたすべての実行に使用され、43の連鎖攻撃が実施されている。
単一制御タスクは、すべての前提条件を満たすが、適応攻撃は、初期の調査、受け入れ、または失敗した試みのために、後で、ローカルで有効な要求を安全でないものにする。
各シナリオには、観察可能な証拠、禁止された行動、安全な処分、介入ポイントが注釈付けされている。
107グレードタスクにおける4つのエージェントの予備的な単一審理評価は、攻撃の安全性を49\%から65\%に向上させ、マネーミュールと第一党詐欺が最も一般的なクロスモデル弱点となる。
関連論文リスト
- Token-Flow Firewall: Semantic Runtime Auditing for Persistent AI Agents [76.4694046738862]
TokenWallは、エージェントトークンフローのセマンティックファイアウォールとして機能するランタイム防衛フレームワークである。
TokenWallは攻撃成功率を12.5%に抑えつつ、97.4%の良質なパスレートを維持している。
論文 参考訳(メタデータ) (2026-07-09T12:18:40Z) - Capable but Careless: Do Computer-Use Agents Follow Contextual Integrity? [54.701199583505144]
アプリケーション間アクセスは、ほとんど見落とされたプライバシーリスクを生み出す。
我々はAgentCIBenchを紹介します。これは、このリスクを決定論的に評価されたシナリオに変換する評価ハーネスです。
我々は15のフロンティアエージェントを評価し、驚くほど高い失敗率を見出す。
論文 参考訳(メタデータ) (2026-06-22T11:36:58Z) - SafeClawBench: Separating Semantic, Audit-Evidence, and Sandbox Harm in Tool-Using LLM Agents [31.978790013349947]
SafeClawBenchは、600の制御された敵タスクを備えたツール使用エージェントセキュリティのためのベンチマークである。
5つのエージェントエンドポイントを4つのプロンプトレベルポリシーで評価する。
これらのエンドポイントは、異なる障害モードをキャプチャします。
論文 参考訳(メタデータ) (2026-06-16T18:04:45Z) - SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces [28.615215165815297]
SkillSafetyBenchは、スキルを介する安全性障害を評価するためのベンチマークである。
ローカライズされた非ユーザアタックは、常に安全でない振る舞いを誘導できることを示す。
その結果, エージェントの安全性は, モデルレベルのアライメントだけでなく, エージェントがいかにスキルを解釈するかにも依存していることがわかった。
論文 参考訳(メタデータ) (2026-05-12T12:03:54Z) - AgentTrust: Runtime Safety Evaluation and Interception for AI Agent Tool Use [2.9991161518367875]
AgentTrustは実行前にエージェントツールコールをインターセプトし、構造化されたバリデーションを返す。
6つのリスクカテゴリにまたがる300-scenarioベンチマークと、630が独立して構築された現実世界の敵シナリオです。
パッチされたルールセットで評価された630秒のベンチマークでは、AgentTrustは96.7%の精度を達成している。
論文 参考訳(メタデータ) (2026-05-06T11:38:16Z) - KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation [72.01173512175531]
KnowU-Benchはパーソナライズされたモバイルエージェントのためのオンラインベンチマークである。
42のGUIタスク、86のパーソナライズされたタスク、64のプロアクティブタスクをカバーしている。
明示的なタスク実行に優れるエージェントは、あいまいな指示の下で50%以下に低下する。
論文 参考訳(メタデータ) (2026-04-09T16:50:50Z) - Agents of Chaos [50.53354213047402]
実験室環境に展開する自律言語モデルを用いたエージェントの探索的再チームの研究を報告する。
20人のAI研究者が、良心的および敵対的な条件下でエージェントと対話した。
我々の発見は、現実的なデプロイメント設定におけるセキュリティ、プライバシ、ガバナンスに関連する脆弱性の存在を確立します。
論文 参考訳(メタデータ) (2026-02-23T16:28:48Z) - ConVerse: Benchmarking Contextual Safety in Agent-to-Agent Conversations [11.177126931962443]
ConVerseはエージェントエージェントインタラクションにおけるプライバシとセキュリティリスクを評価するためのベンチマークである。
12のユーザペルソナと864以上のコンテキストベースアタックを備えた,3つの実用的なドメインにまたがる。
インタラクティブなマルチエージェントコンテキスト内にプライバシとセキュリティを統合することで、ConVerseは通信の緊急性として安全性を再設定する。
論文 参考訳(メタデータ) (2025-11-07T15:49:49Z) - OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety [58.201189860217724]
OpenAgentSafetyは,8つの危機リスクカテゴリにまたがるエージェントの動作を評価する包括的なフレームワークである。
従来の作業とは異なり、我々のフレームワークは、Webブラウザ、コード実行環境、ファイルシステム、bashシェル、メッセージングプラットフォームなど、実際のツールと対話するエージェントを評価します。
ルールベースの分析とLSM-as-judgeアセスメントを組み合わせることで、過度な行動と微妙な不安全行動の両方を検出する。
論文 参考訳(メタデータ) (2025-07-08T16:18:54Z) - Progent: Programmable Privilege Control for LLM Agents [46.31581986508561]
本稿では,大規模言語モデルエージェントをセキュアにするための最初の特権制御フレームワークであるProgentを紹介する。
Progentは、潜在的に悪意のあるものをブロックしながら、ユーザタスクに必要なツールコールの実行をエージェントに制限することで、ツールレベルでのセキュリティを強化する。
モジュール設計のおかげで、Progentの統合はエージェント内部を変更せず、既存のエージェントの実装に最小限の変更しか必要としません。
論文 参考訳(メタデータ) (2025-04-16T01:58:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。