論文の概要: Rethinking Fraud Safety Evaluation: Multi-Round Attacks Reveal Safety-Utility Tradeoffs in Graph-Context LLM Defenders
- arxiv url: http://arxiv.org/abs/2605.20759v1
- Date: Wed, 20 May 2026 05:59:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-21 19:19:56.511418
- Title: Rethinking Fraud Safety Evaluation: Multi-Round Attacks Reveal Safety-Utility Tradeoffs in Graph-Context LLM Defenders
- Title(参考訳): 不正安全性評価を再考する - グラフコンテキストLDMデフェンダにおけるマルチラウンド攻撃による安全と実用のトレードオフ
- Authors: Laura Jiang, Reza Ryan, Qian Li, Nasim Ferdosian,
- Abstract要約: 本稿では,リプレイおよび適応型マルチラウンドアタックにおける不正防御者の評価と,ディフェンダーが拒否した場合の対策について述べる。
Fraud-R1で構築された凍結したマルチラウンドスイートでは、グラフコンテキストディフェンダはテキストのみのベースラインに対する早期の安全な拒絶を改善する。
- 参考スコア(独自算出の注目度): 4.1427901594249255
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Single-turn safety evaluation is a poor proxy for real fraud defense, where attackers escalate across multiple rounds. This paper evaluates fraud defenders under replay and adaptive multi-round attacks and measures when a defender refuses, not just whether it eventually refuses. On a frozen multi-round suite built from Fraud-R1, graph-context defenders improve early safe refusal relative to text-only baselines under both replay and adaptive fraud pressure, but they also produce substantially more benign over-refusal. Direct probing of the trained graph encoder, together with paired shuffle-risk ablations on both fraud and benign sides replicated across two seeds on the Qwen-1.5B backbone, localises this cost to how the defender LLM consumes structured context rather than to graph-encoder quality: the encoder cleanly separates fraud from benign, while the LLM responds primarily to the presence of structured graph fields and only secondarily, and asymmetrically, to risk-score magnitude. Temporal graph context is directionally stronger than static and significantly better grounded, but is not yet conclusively superior on the main refusal metrics. The contribution is evaluative and measurement-oriented: robust fraud assessment must be multi-round, must report refusal timing, must account for benign false positives alongside fraud-side safety gains, and must localize observed costs to the graph signal or to how the LLM consumes it.
- Abstract(参考訳): シングルターン安全性評価は、攻撃者が複数のラウンドにまたがってエスカレートする、実際の不正防衛の指標として不十分なものだ。
本稿では,リプレイおよび適応的マルチラウンド攻撃による不正防御者の評価と,最終的に拒否されるかどうかだけでなく,ディフェンダーが拒否される場合の対策について述べる。
Fraud-R1から構築された凍結したマルチラウンドスイートでは、グラフコンテクストディフェンダーは、リプレイと適応詐欺の圧力の下で、テキストのみのベースラインに対して早期に安全な拒絶を改善するが、より良質なオーバーリフレクションを発生させる。
トレーニングされたグラフエンコーダの直接探索と、Qwen-1.5Bのバックボーン上の2つのシードに複製された2つの不正と良性側面のペアによるシャッフルリスクの軽減は、このコストを、ディフェンダーのLLMがグラフエンコーダの品質よりも構造化されたコンテキストを消費する方法にローカライズする。
テンポラルグラフの文脈は静的よりも方向が強く、グラウンドがかなり良いが、メインの拒絶測度では決定的に優れているわけではない。
頑健な詐欺評価は多段階的であり、拒絶のタイミングを報告し、不正側の安全性向上とともに良質な偽陽性を考慮し、観察されたコストをグラフ信号やLLMの消費方法にローカライズしなければならない。
関連論文リスト
- TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning [60.68349524623048]
分解されたジェイルブレイクは、大きな言語モデルにとって重大な脅威となる。
我々はステートフルなデュアルエンコーダ防御フレームワークであるTwinGateを紹介する。
我々は、8600の異なる悪意のある意図にまたがる360万以上の命令の包括的なデータセットを構築した。
論文 参考訳(メタデータ) (2026-04-30T13:44:01Z) - Scalable and Verifiable Federated Learning for Cross-Institution Financial Fraud Detection [0.0]
本研究では,不正検出のためのセキュアアグリゲーションフレームワークであるDynamic Sharded Learning (DSFL)を提案する。
DSFLはトポロジを動的シャーディングに置き換え、O(N2) から m(N2) への複雑さを減らす
インサイダーの脅威を軽減するために,加法的同型コミットメント機構である線形積分タグを導入する。
論文 参考訳(メタデータ) (2026-04-25T20:49:22Z) - TraceGuard: Process-Guided Firewall against Reasoning Backdoors in Large Language Models [19.148124494194317]
我々は,小規模モデルを堅牢な推論ファイアウォールに変換するプロセス誘導型セキュリティフレームワークであるTraceGuardを提案する。
提案手法は,推理トレースを信頼できないペイロードとして扱い,詳細な防衛戦略を確立する。
グレーボックス設定における適応的敵に対する堅牢性を実証し、TraceGuardを実用的で低レイテンシなセキュリティプリミティブとして確立する。
論文 参考訳(メタデータ) (2026-03-02T22:19:13Z) - S-GRec: Personalized Semantic-Aware Generative Recommendation with Asymmetric Advantage [20.189274601152363]
S-GRecは、オンライン軽量ジェネレータをオフラインセマンティックジャッジから切り離して、列車時の監視を行うセマンティックアウェアフレームワークである。
S-GRecは2段階のパーソナライズドセマンティックジャッジ(PSJ)を導入し、解釈可能なアスペクトエビデンスを生成し、ユーザ条件アグリゲーションを学習する。
公開ベンチマークと大規模生産システムに関する大規模な実験は、有効性とスケーラビリティの両方を検証する。
論文 参考訳(メタデータ) (2026-02-11T07:54:26Z) - Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs [54.90315421117162]
完全無害データを用いた新しい毒殺法を提案する。
自己回帰型LPMの因果推論に着想を得て,トリガーと肯定的応答プレフィックスの堅牢な関連性を確立することを目指す。
LLMは最初は同意するように見えるが,その後回答を拒む興味深い抵抗現象を観察する。
論文 参考訳(メタデータ) (2025-05-23T08:13:59Z) - A Label-Free Heterophily-Guided Approach for Unsupervised Graph Fraud Detection [60.09453163562244]
本稿では,非教師付きGFDのための非教師付きグラフ不正検出手法(HUGE)を提案する。
推定モジュールでは、GFD の臨界グラフ特性をキャプチャする HALO と呼ばれる新しいラベルフリーなヘテロフィリー計量を設計する。
アライメントに基づく不正検出モジュールにおいて、ランキング損失と非対称アライメント損失を有する合同GNNアーキテクチャを開発する。
論文 参考訳(メタデータ) (2025-02-18T22:07:36Z) - From Mean to Extreme: Formal Differential Privacy Bounds on the Success of Real-World Data Reconstruction Attacks [54.25638567385662]
機械学習における微分プライバシーは、しばしばメンバーシップ推論に対する保証として解釈される。
DP予算を定量的な保護に翻訳することで、データ再構築の脅威を悪化させることは、依然として困難な課題である。
本稿では、実証された"ゼロスクラッチ"攻撃のメカニズムに合わせた、最初の公式なプライバシー境界を導出することで、臨界ギャップを埋める。
論文 参考訳(メタデータ) (2024-02-20T09:52:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。