論文の概要: Same Request, Different Boundary: Evaluating Cybersecurity Assistance across Conversational Contexts
- arxiv url: http://arxiv.org/abs/2609.00578v1
- Date: Tue, 01 Sep 2026 02:16:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.239765
- Title: Same Request, Different Boundary: Evaluating Cybersecurity Assistance across Conversational Contexts
- Title(参考訳): 異なる境界条件の要求 - 会話コンテキスト間でのサイバーセキュリティ支援の評価
- Authors: Rui Yang, Yang Hong, Yichao Xu, Zhengyu Liu, Ziyang Li, Yinzhi Cao,
- Abstract要約: 大規模言語モデル(LLM)は複雑な問題を解決することができるが、リスクの高いドメインでの誤用は深刻な結果をもたらす可能性がある。
3R-Benchは、現実の150のサイバーセキュリティ要求のベンチマークで、2つの対向的な会話設定が強化されている。
- 参考スコア(独自算出の注目度): 25.330089031016076
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) can solve complex problems, but their misuse in high-risk domains can lead to severe consequences. Model providers therefore restrict assistance for potentially harmful requests. Refusing all cybersecurity requests would therefore harm legitimate users. Providers need a mechanism to block malicious use without denying legitimate assistance to defenders. Existing cybersecurity-specific datasets evaluate this mechanism, but none considers the conversational context of a request. We introduce 3R-Bench (Refusal, Repetition, and Revision), a benchmark of 150 real-world cybersecurity requests augmented with two adversarial conversational settings, and evaluate eight LLMs on it. Prior assistant behavior strongly changes responses to an unchanged request: among 376 available pairs from a 400-pair panel, compliance rises from 62.0% after refused history to 85.1% after accepted history. The opposite pattern appears under dialogue decomposition. In comparison, compliance falls from 501/800 direct responses to 172/800 after dialogue; among 738 pairs returning model-authored text in both conditions, the decrease is 45.1 points. Failure feedback recovers only a small fraction of this loss.
- Abstract(参考訳): 大規模言語モデル(LLM)は複雑な問題を解決することができるが、リスクの高いドメインでの誤用は深刻な結果をもたらす可能性がある。
したがってモデルプロバイダは、潜在的に有害な要求に対する支援を制限する。
したがって、すべてのサイバーセキュリティ要求を拒否することは、正当なユーザーを傷つけることになる。
プロバイダは、ディフェンダーへの正当な支援を否定することなく、悪意のある使用をブロックするメカニズムが必要です。
既存のサイバーセキュリティ固有のデータセットは、このメカニズムを評価するが、要求の会話コンテキストを考慮していない。
3R-Bench (Refusal, Repetition, and Revision) は,現実の150件のサイバーセキュリティ要求を2つの対向的な会話設定で強化したベンチマークであり,その上で8つのLCMを評価する。
以前のアシスタントの動作は、400対のパネルから利用可能な376組のペアの中で、歴史を断った後、コンプライアンスが62.0%から歴史を受け入れた後に85.1%に上昇する。
反対のパターンは、対話の分解の下に現れる。
比較すると、コンプライアンスは対話後の501/800直接応答から172/800まで減少し、どちらの条件でも738対のモデルライセンステキストが返される中、45.1ポイントが減少する。
障害フィードバックは、この損失のごく一部を回復します。
関連論文リスト
- TAF-MED: Multi-Turn Safety Refusal Collapse in LLMs Under Declared Self-Treatment Intent [0.0]
我々は,500の固定された3ターンシナリオの医師レビューベンチマークであるTAF-MEDを紹介する。
4000対の会話で8つの大言語モデル(LLM)を評価した。
論文 参考訳(メタデータ) (2026-08-10T21:43:58Z) - PsychoSafe: Eliciting Psychologically-Informed Refusals in Large Language Models [20.805546078350524]
心理的安全リフレームは、証拠に基づく介入戦略に基づく構造化された支援コミュニケーションとして拒絶される。
500のプロンプトの検証セットでは、サイコセーフプロンプトは全体的な拒絶品質をジェネリックベースラインに対して28.1%改善する。
微調整は、ほぼ完全な拒絶と資源参照率を達成するが、応答の関連性は減少する。
論文 参考訳(メタデータ) (2026-06-08T16:19:18Z) - A New Framework for Cybersecurity Refusals in AI Agents [52.94784168139071]
攻撃的セキュリティの文脈において、拒絶境界を確立するための最初の枠組みを提示する。
本研究では,現在のLLMエージェントがWebベースの攻撃的セキュリティシナリオにおいて,適切な拒絶境界にどのように準拠しているかを評価するために,このフレームワークを適用した。
論文 参考訳(メタデータ) (2026-05-31T15:39:39Z) - Code as a Weapon: A Consensus-Labeled Prompt Bank for Measuring Coding-Model Compliance with Malicious-Code Requests [0.0]
符号化特化モデルは、汎用チャットモデルよりも高い拒絶バーをクリアすべきである。
8つのコーパス(ASTRA、CySecBench、AdvBench/harmful_behaviors、JailbreakBench、MalwareBench、RedCode、RCCBench、Scam2Prompt)は5judgeコンセンサスプロトコルで統合され、分類される。
コーディングモデルがより厳格な拒絶基準を満たしているかどうかをテストするための信頼性基準である。
論文 参考訳(メタデータ) (2026-05-27T16:55:15Z) - ProactBench: Beyond What The User Asked For [5.422521416406412]
ProactBenchは、textscEmergent、単一の公開アンカーからの推論、textscCritical、複数のアンカー間での合成、textscRecovery、タスク完了後の前方にある値の3つのフェーズ型に分解する。
我々の情報アシンメトリーは、スタイル強調スコア、漏洩、外部コンテキスト汚染、情報ダンプに対して防御します。
論文 参考訳(メタデータ) (2026-05-09T23:56:04Z) - How Vulnerable Are AI Agents to Indirect Prompt Injections? Insights from a Large-Scale Public Competition [48.32744727426218]
LLMベースのエージェントは、電子メール、ドキュメント、コードリポジトリなどの外部データソースを処理する高利得設定にますますデプロイされている。
これにより間接的なプロンプトインジェクション攻撃が発生し、外部コンテンツに埋め込まれた敵の命令は、ユーザの意識なしにエージェントの動作を操作できる。
この2つの目的を3つのエージェント設定で評価した。
論文 参考訳(メタデータ) (2026-03-16T14:49:36Z) - Defensive Refusal Bias: How Safety Alignment Fails Cyber Defenders [1.038167357593269]
大きな言語モデル(LLM)における安全性の整合性は、主に誤用を防ぐことに焦点を当てている。
我々は、保護的拒否バイアス(Defensive Refusal Bias)について検討する。安全に配慮したフロンティアのLLMは、認証されたサイバーセキュリティタスクの援助を拒否する傾向にある。
システム硬化(43.8%)とマルウェア分析(34.3%)。
論文 参考訳(メタデータ) (2026-03-01T19:53:19Z) - Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs [54.90315421117162]
完全無害データを用いた新しい毒殺法を提案する。
自己回帰型LPMの因果推論に着想を得て,トリガーと肯定的応答プレフィックスの堅牢な関連性を確立することを目指す。
LLMは最初は同意するように見えるが,その後回答を拒む興味深い抵抗現象を観察する。
論文 参考訳(メタデータ) (2025-05-23T08:13:59Z) - AutoReply: Detecting Nonsense in Dialogue Introspectively with
Discriminative Replies [71.62832112141913]
対話モデルは、不適切なメッセージを示す応答の確率を計算し、内観的に自分のメッセージの誤りを検出することができることを示す。
まず、手作りの返信は外交と同じくらい複雑なアプリケーションにおけるナンセンスを検出するタスクに有効であることを示す。
AutoReplyの生成した応答は手作りの応答よりも優れており、慎重に調整された大規模な教師付きモデルと同等に動作することがわかった。
論文 参考訳(メタデータ) (2022-11-22T22:31:34Z) - Counterfactual Off-Policy Training for Neural Response Generation [94.76649147381232]
本稿では,反実的推論による潜在的応答の探索を提案する。
対人学習の枠組みの下での対物反応の訓練は、潜在的応答空間の高逆領域を探索するのに役立つ。
DailyDialogデータセットに関する実証的研究は、我々のアプローチがHREDモデルを大幅に上回っていることを示している。
論文 参考訳(メタデータ) (2020-04-29T22:46:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。