論文の概要: SRD-GUARD: A Defense Framework of LLMs via Semantic Rewriting and Joint Multi-Model Scoring for Latent Intent Exposure
- arxiv url: http://arxiv.org/abs/2609.06540v1
- Date: Sun, 06 Sep 2026 11:26:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.263018
- Title: SRD-GUARD: A Defense Framework of LLMs via Semantic Rewriting and Joint Multi-Model Scoring for Latent Intent Exposure
- Title(参考訳): SRD-GUARD:LLMの防衛フレームワーク
- Abstract要約: SRD-GUARDはパラメータフリーでブラックボックスの防御フレームワークで、セマンティックリライトとコンセンサスに基づくリスクアセスメントを通じて隠された意図を公開する。
Llama-3-8B-UncensoredおよびDeepSeek-V4-Flash上で,UNIATTACK,CIPHER,DeepInceptionに対するSRD-GUARDの評価を行った。
- 参考スコア(独自算出の注目度): 7.121327089434882
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) are increasingly deployed in safety-critical applications, yet jailbreak attacks can conceal harmful intent through role-playing, fictional scenarios, or seemingly benign motivations. Existing inference-time defenses may miss disguised attacks or excessively refuse legitimate requests. We propose SRD-GUARD, a parameter-free, black-box defense framework that exposes concealed intent through semantic rewriting and consensus-based risk assessment. Given an input prompt, SRD-GUARD generates five semantically related rewrites that preserve the underlying objective while removing unnecessary contextual packaging. The original prompt and rewrites are jointly evaluated by multiple independent LLM-based safety scorers on a continuous risk scale. A decision module combines absolute risk thresholds with relative risk changes between the original and rewritten prompts to adaptively intercept, preserve, or warn on requests. We evaluate SRD-GUARD against UNIATTACK, CIPHER, and DeepInception on Llama-3-8B-Uncensored and DeepSeek-V4-Flash using AdvBench and OR-Bench-Hard. SRD-GUARD achieves average DSRs of 91.44% and 100%, with ORRs of 8.00% and 12.00%, respectively. Compared with evaluated baselines, it provides a more favorable DSR--ORR trade-off. Ablation studies show that rewriting exposes concealed harmful intent, joint scoring improves robustness to individual evaluator behavior, and risk-adaptive decision making enables selective handling of ambiguous inputs. These results demonstrate that semantic intent exposure, consensus-based risk assessment, and relative-risk-aware routing provide an effective and selective approach to black-box jailbreak defense. The artifact is available at https://anonymous.4open.science/status/CICD-Guard-D648.
- Abstract(参考訳): 大規模言語モデル(LLM)は、安全クリティカルなアプリケーションにますますデプロイされているが、ジェイルブレイク攻撃はロールプレイング、架空のシナリオ、または一見良心的なモチベーションを通じて有害な意図を隠蔽する可能性がある。
既存の推論時の防御は、偽装された攻撃を見逃したり、正当な要求を過度に拒否することがある。
SRD-GUARDは,セマンティックリライトとコンセンサスに基づくリスクアセスメントを通じて隠蔽意図を公開する,パラメータフリーのブラックボックスディフェンスフレームワークである。
入力プロンプトが与えられた後、SRD-GUARDは、不要なコンテキストパッケージングを除去しながら、基礎となる目的を保存する5つの意味的関連リライトを生成する。
元のプロンプトと書き直しは、連続的なリスクスケールで複数の独立したLCMベースの安全スコアラーによって共同で評価される。
決定モジュールは、絶対リスク閾値と、元のプロンプトと書き直されたプロンプト間の相対的なリスク変化を組み合わせて、リクエストを適応的にインターセプトし、保存し、警告する。
我々は,AdvBenchとOR-Bench-Hardを用いたLlama-3-8B-UncensoredおよびDeepSeek-V4-FlashにおけるUNIATTACK,CIPHER,DeepInceptionに対するSRD-GUARDの評価を行った。
SRD-GUARD の平均 DSR は 91.44% と 100% であり、ORR はそれぞれ 8.00% と 12.00% である。
評価ベースラインと比較すると、より好ましいDSR--ORRトレードオフを提供する。
アブレーション研究では、書き換えは隠された有害な意図を露呈し、共同スコアリングは個々の評価者行動に対する堅牢性を改善し、リスク適応的意思決定は曖昧な入力の選択的ハンドリングを可能にすることが示されている。
これらの結果は、意味的意図の暴露、コンセンサスに基づくリスクアセスメント、および相対リスク対応ルーティングが、ブラックボックスジェイルブレイク防御に対する効果的かつ選択的アプローチを提供することを示した。
このアーティファクトはhttps://anonymous.4open.science/status/CICD-Guard-D648で入手できる。
関連論文リスト
- RAGSentinel: Certifiable Geometric Consensus for Robust Retrieval-Augmented Generation [9.458292549037155]
我々は,ブラックボックスRAGシステムのための,トレーニング不要でラベルのない防衛システムであるRAGSentinelを提案する。
RaGSentinelは、競争精度を維持しながら、攻撃の成功率の低下を一貫して達成する。
論文 参考訳(メタデータ) (2026-08-25T01:44:07Z) - Cognitive Firewall: A Proactive, Zero-Trust, Multi-Gate Framework for LLM Safety [4.989841843916001]
本稿では,プロアクティブなランタイム監視フレームワークであるCognitive Firewallについて述べる。
4つのジェイルブレイクベンチマークと良心的な安全テストセットの実験は、Cognitive Firewallがシングルターン、マルチターン、オーソリティベース、人為的な攻撃で攻撃の成功を大幅に減少させることを示している。
論文 参考訳(メタデータ) (2026-07-01T06:36:29Z) - Robust Critics: Defending LLMs Against Multi-Turn Attacks [36.531210410175646]
マルチターン対話のための安全フレームワークとして,対話批評ガイドサンプリング(DCGS)を提案する。
DCGSは、ユーザの意図が何であるかを、完全な会話履歴に基づいて学習し、それに応じて応答を生成する。
この推論時間再重み付けは、基本方針の指数的傾きを近似し、任意の有限候補プールに対する期待値の改善を保証する。
論文 参考訳(メタデータ) (2026-05-24T05:49:14Z) - Beyond Semantic Relevance: Counterfactual Risk Minimization for Robust Retrieval-Augmented Generation [19.888565537472363]
CoRM-RAG(Counterfactual Risk Minimization for RAG)は、検索と意思決定の安全性を一致させるフレームワークである。
トレーニング中にユーザのバイアスをシミュレートする認知摂動プロトコルを導入し,それを軽量なエビデンス・クリティカルに蒸留する。
このスコアリングモジュールは、対向的なクエリの摂動にも拘わらず、モデルの正しさを判断するために十分な明らかな強度を持つ文書を特定することを学習する。
論文 参考訳(メタデータ) (2026-05-02T07:22:24Z) - DARC: Disagreement-Aware Alignment via Risk-Constrained Decoding [59.16244104797919]
本稿では,リスク制約付き復号法(DARC)*による分散アライメント(Disagreement-Aware Alignment)を提案する。
DARCは応答選択を、分布的に堅牢で、リスクに敏感な意思決定として捉えている。
アライメントベンチマークの実験では、DARCは競合平均品質を維持しながら、不一致と尾のリスクを低減する。
論文 参考訳(メタデータ) (2026-03-09T09:21:29Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z) - Learning to Extract Context for Context-Aware LLM Inference [60.376872353918394]
大型言語モデル(LLM)へのユーザープロンプトは曖昧か不明確であることが多い。
ユーザの意図、事前知識、リスク要因によって形成されるコンテキスト的手がかりは、適切な応答を構成するものに影響を与える。
本稿では,ユーザプロンプト自体からコンテキスト情報を抽出し,活用するフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-12T19:10:08Z) - RADAR: A Risk-Aware Dynamic Multi-Agent Framework for LLM Safety Evaluation via Role-Specialized Collaboration [81.38705556267917]
大規模言語モデル(LLM)の既存の安全性評価手法は、固有の制約に悩まされている。
リスク概念空間を再構築する理論的枠組みを導入する。
マルチエージェント協調評価フレームワークRADARを提案する。
論文 参考訳(メタデータ) (2025-09-28T09:35:32Z) - CPA-RAG:Covert Poisoning Attacks on Retrieval-Augmented Generation in Large Language Models [15.349703228157479]
Retrieval-Augmented Generation (RAG)は、外部知識を取り入れた大規模言語モデル(LLM)を強化する。
既存のRAGシステムに対する中毒法には、一般化の欠如や、敵のテキストにおける流布の欠如など、制限がある。
CPA-RAGは,検索プロセスを操作することで,対象の回答を誘導するクエリ関連テキストを生成するブラックボックスの対向フレームワークである。
論文 参考訳(メタデータ) (2025-05-26T11:48:32Z) - Turning Logic Against Itself : Probing Model Defenses Through Contrastive Questions [50.40122190627256]
非倫理的反応を引き起こすために、対照的な推論を利用する新しいジェイルブレイク手法であるPOATEを導入する。
PoATEは意味論的に意図に反し、敵のテンプレートと統合し、有害なアウトプットを驚くほど微妙に操る。
これに対応するために、悪意のある意図と理性を検出するためにクエリを分解して、有害な応答を評価し、拒否するIntent-Aware CoTとReverse Thinking CoTを提案する。
論文 参考訳(メタデータ) (2025-01-03T15:40:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。