論文の概要: Beyond Detection: Evaluating Defensive LLMs Against AI-Generated Social Engineering in Live Turn-by-Turn Interaction
- arxiv url: http://arxiv.org/abs/2608.10239v1
- Date: Mon, 10 Aug 2026 21:17:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:45.814177
- Title: Beyond Detection: Evaluating Defensive LLMs Against AI-Generated Social Engineering in Live Turn-by-Turn Interaction
- Title(参考訳): 検出を超えて:ライブターン・バイ・トゥルンインタラクションにおけるAI生成ソーシャルエンジニアリングに対する防御的LLMの評価
- Abstract要約: ジェネレーティブAIは、ソーシャルエンジニアリングアタックをより流動的で適応的でスケーラブルにする。
我々は信頼連鎖のローカライゼーションを形式化し、アクターの権限、資産管理、検証効率、トランザクションパスで相互作用が失敗するかどうかを特定する。
我々は,20のシナリオファミリー,正当なケース,4つの構造的故障モード,および3つの表面状態にまたがる制御された300ケースのオンライン住宅コーパスを構築した。
- 参考スコア(独自算出の注目度): 42.06723421277899
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Generative AI makes social-engineering attacks more fluent, adaptive, and scalable, increasing the need for LLM-based de- fenders that can protect users during ongoing interactions. We ask whether such defenders identify the structural source of risk or merely react to surface cues. We formalize trust-chain localization: identifying whether an interaction fails at actor authority, asset control, verification sufficiency, or transaction path. We construct a controlled 300-case online-housing corpus spanning 20 scenario families, legitimate cases, four structural failure modes, and three surface conditions. Five defender models are evaluated on the same corpus in state- ful turn-by-turn and one-shot static settings, yielding 1,500 model-case evaluations per protocol and 3,000 in total. No model produced explicit unsafe compliance, yet defensive effectiveness varied sharply: intervention rates ranged from 0% to 96.3%. Protective action and correct structural localization were frequently decoupled, with models sometimes intervening while identifying the wrong trust component or recognizing a structural failure without taking protective action. Asset-control failures were a major localization bottleneck, surface sensitivity varied across models, and live-static differences were model-dependent. These findings show that safe-looking behavior alone is insufficient; live scam resistance must separately measure intervention, timing, structural localization, and false-positive behavior.
- Abstract(参考訳): ジェネレーティブAIは、ソーシャルエンジニアリング攻撃をより流動的で適応的でスケーラブルなものにし、継続的なインタラクション中にユーザを保護するLLMベースのデフェンダーの必要性を高めます。
我々は、そのような防御者がリスクの構造的源を特定できるのか、それとも単に表面的な手がかりに反応するのかを問う。
我々は信頼連鎖のローカライゼーションを形式化し、アクターの権限、資産管理、検証効率、トランザクションパスで相互作用が失敗するかどうかを特定する。
我々は,20のシナリオファミリー,正当なケース,4つの構造的故障モード,および3つの表面状態にまたがる制御された300ケースのオンライン住宅コーパスを構築した。
5つのディフェンダーモデルが、ステートフルなターンバイターンとワンショットの静的設定で同一のコーパス上で評価され、プロトコルごとに1,500のモデルケース評価と3000の合計が得られた。
明確な安全でないコンプライアンスを生んだモデルはないが、防御効果は著しく変化し、介入率は0%から96.3%まで変化した。
保護行動と正しい構造的局所化は、しばしば分離され、モデルが間違った信頼要素を特定しながら介入したり、保護作用を取らずに構造的失敗を認識することもあった。
アセット制御の故障は主要な局所化ボトルネックであり、表面感度はモデルによって異なり、実時間差はモデルに依存していた。
ライブ詐欺抵抗は、介入、タイミング、構造的局在、偽陽性行動を別々に測定する必要がある。
関連論文リスト
- aiXamine: Unified Black-Box Evaluation of Cross-Dimensional Trade-offs in LLM Safety, Security, and Privacy [6.323488051975665]
AiXamineは、セキュリティ、セキュリティ、プライバシを相互依存プロパティとして評価する統合ブラックボックスプラットフォームである。
AiXamineは、自動化されたリチームパイプラインを通じて、9つのサービスにわたる46のテストをオーケストレーションする。
我々は,これまでで最大規模の共同安全性,セキュリティ,プライバシ調査を行い,単一軸評価で見えない3次元の現象を明らかにした。
論文 参考訳(メタデータ) (2026-08-20T20:33:35Z) - Adversarial Attacks for Good: A Survey of Proactive Protection across the Visual Content Lifecycle [65.6642776933861]
この介入点付近で成長した保護パラダイムについて検討する。
ほとんどの保護は、主に静的あるいは弱い適応的な敵に対して検証されている。
我々は、堅牢で構成可能で、デプロイ可能な所有者側の保護のために、クロスステージ対策とオープンな問題を統合することで、閉鎖する。
論文 参考訳(メタデータ) (2026-08-05T00:46:50Z) - Silent Alarm: A J-Space Protocol for Comparing Danger Recognition Across Models and Quantization Levels [0.0]
この研究は、ヤコビ空間を通してモデルの内部表現を測定するプロトコルであるJADRを提案する。
すべてのプロンプトとレイヤに対して、トップkのJスペーストークンを記録します。
これらは6つのシナリオ軸にグループ化され、StrongREJECTに基づく危険サンプルと、XSTestとOKTestから引き出された安全なコントロールを比較します。
論文 参考訳(メタデータ) (2026-07-14T14:08:18Z) - Safety in Self-Evolving LLM Agent Systems: Threats, Amplification, and Case Studies [62.65225104423404]
自己進化エージェントシステムは、敵の影響力が永久に符号化される、質的に新しい脅威の風景を導入します。
モジュール・ライフサイクル・アタック・サーフェス・マトリックスを中心に組織化されたセキュリティとプライバシの分析を行った。
その結果, 自己進化は, 既知のすべての攻撃カテゴリをセッションバウンドからラインパーシスタントに変換することがわかった。
論文 参考訳(メタデータ) (2026-06-22T09:23:50Z) - The Saturation Trap and the Subjectivity of Intervention Timing: Why Affect-Based Triggers and LLM Judges Fail to Time Interventions on Autonomous Agents [0.0]
インターベンションタイミングは信頼性の低い構造であり、シングルアノテータF1を不適切な最適化ターゲットとする。
我々の貢献は、人間のレータ間の信頼性、4つの検出器アーキテクチャ、モデルのLEM-judgeスイープ、再現された飽和効果にまたがるこの問題を、共同でマッピングすることである。
論文 参考訳(メタデータ) (2026-06-02T23:54:27Z) - Detecting Is Not Resolving: The Monitoring Control Gap in Retrieval Augmented LLMs [20.59321114618083]
単一ターン診断はRAGの安全性を体系的に過大評価し、矛盾は安全な解決法とは無関係であり、普遍的な即時修正は存在しないことを示した。
モデルが認識するものと何をするかのギャップは、検索強化されたシステムが高レベルな設定で信頼される前に測定され、クローズされなければならない。
論文 参考訳(メタデータ) (2026-05-26T15:18:43Z) - Security in the Fine-Tuning Lifecycle of Large Language Models: Threats, Defenses,Evaluation, and Future Directions [21.047807094226986]
本稿では,大規模言語モデルの微調整セキュリティに関する体系的な調査を行う。
攻撃と防御を比較するライフサイクルベースのフレームワークを確立する。
我々は、重要なオープンな問題(構成ロバスト防衛、異相防衛構成、行動仮定を超えた埋め込み空間攻撃)を特定し、具体的な今後の研究方向性を提案する。
論文 参考訳(メタデータ) (2026-05-24T13:34:47Z) - Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - TraceSafe: A Systematic Assessment of LLM Guardrails on Multi-Step Tool-Calling Trajectories [20.868825285848196]
安全ガードレールは、自然言語の応答には適しているが、その有効性は、多段階のツール使用軌跡の中では明らかにされていない。
このギャップに対処するために、中間軌道安全性を評価するために特別に設計された最初の包括的なベンチマークであるStructureSafe-Benchを紹介します。
論文 参考訳(メタデータ) (2026-04-08T15:46:14Z) - State-Dependent Safety Failures in Multi-Turn Language Model Interaction [70.52906620450847]
我々は、状態空間の観点から安全性障害を研究し、多くのマルチターン障害が構造化状態の進化から生じることを示す。
本稿では,対話履歴を状態遷移演算子として扱う状態指向診断フレームワークSTARを紹介する。
静的な評価の下で頑健なように見えるシステムは、構造化されたマルチターン相互作用の下で、迅速かつ再現可能な安全破壊を受けることができる。
論文 参考訳(メタデータ) (2026-03-15T12:13:01Z) - Automated Self-Testing as a Quality Gate: Evidence-Driven Release Management for LLM Applications [51.56484100374058]
我々は,エビデンスに基づくリリース決定を伴う品質ゲートを導入する自動自己テストフレームワークを提案する。
内部展開型多エージェント対話型AIシステムの縦型ケーススタディにより,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-03-13T20:44:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。