論文の概要: Robust Critics: Defending LLMs Against Multi-Turn Attacks
- arxiv url: http://arxiv.org/abs/2607.20472v1
- Date: Sun, 24 May 2026 05:49:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.187396
- Title: Robust Critics: Defending LLMs Against Multi-Turn Attacks
- Title(参考訳): ロバスト批判:LLMをマルチターン攻撃から守る
- Abstract要約: マルチターン対話のための安全フレームワークとして,対話批評ガイドサンプリング(DCGS)を提案する。
DCGSは、ユーザの意図が何であるかを、完全な会話履歴に基づいて学習し、それに応じて応答を生成する。
この推論時間再重み付けは、基本方針の指数的傾きを近似し、任意の有限候補プールに対する期待値の改善を保証する。
- 参考スコア(独自算出の注目度): 36.531210410175646
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When a user asks a language model something harmful, is it a genuine attack or a misunderstood but well-meaning question? This ambiguity is one of the central challenges of LLM safety. A model that assumes the worst harms legitimate users; one that assumes the best is easily exploited. The problem is compounded in multi-turn dialogue, where an attacker's true intent may only reveal itself gradually across many exchanges, yet existing safety frameworks apply a contextual bandit treatment, ignoring the trajectory of the conversation. To that end, we propose Dialogue Critic Guided Sampling (DCGS), a framework that addresses this by inferring user intent at every turn of dialogue. Instead of applying a fixed rule about what is or is not safe, DCGS learns what the user's intent is likely to be based on the full conversational history and generates responses accordingly. Formally, we model adversarial dialogue as a Markov Decision Process and learn value and regret-based critics at both the individual token and utterance (full response) levels, scoring candidate responses via an action-value critic. We prove that this inference-time reweighting approximates exponential tilting of the base policy, guaranteeing improvement in expected return for any finite candidate pool, a property that group-relative objectives do not exhibit. Evaluated on CARES-18k, WildJailbreak, Redbench, and Harmbench, DCGS outperforms strong robust baselines and frontier models on adversarial dialogue tasks. DCGS also transfers to frontier models, improving their robustness without fine-tuning.
- Abstract(参考訳): ユーザーが言語モデルに何か有害なことを尋ねると、それは本当の攻撃なのか、誤解されているが、よく意味のある質問なのか?
この曖昧さは、LLMの安全性における中心的な課題の1つである。
最悪のユーザーを仮定するモデルは正当なユーザーを害し、最高のユーザーを仮定するモデルは容易に悪用される。
マルチターン対話では、攻撃者の真の意図は、多くの交換所で徐々に明らかにされるが、既存の安全フレームワークでは、会話の軌跡を無視したコンテキスト的盗聴処理が適用されている。
そこで本研究では,対話の毎回,ユーザの意図を推測することで,これに対応するフレームワークであるDialogue Critic Guided Smpling (DCGS)を提案する。
安全でないものに関する一定のルールを適用する代わりに、DCGSは、ユーザの意図が会話履歴全体に基づいて何であるかを学習し、それに応じて応答を生成する。
形式的には、対立する対話をマルコフ決定プロセスとしてモデル化し、個々のトークンと発話(フルレスポンス)レベルの両方で、価値と後悔に基づく批判を学習し、アクション価値の批判を通じて候補応答を評価する。
この推論時間再重み付けは、群相対目標が示さない性質である任意の有限候補プールに対する期待値の改善を保証し、基本方針の指数的傾きを近似することを証明する。
CARES-18k、WildJailbreak、Redbench、Harmbenchで評価されたDCGSは、対向的な対話タスクにおいて強力な堅牢なベースラインとフロンティアモデルより優れている。
DCGSはフロンティアモデルにも移行し、微調整なしで堅牢性を向上させる。
関連論文リスト
- Benchmarking Factual Robustness of LLMs via Multi-conversation Persuasion [0.0]
レッドチームフレームワークは、ターゲットモデルが会話履歴を保持するマルチターン対話におけるモデルを評価する。
textbfSAST-IR (Stateful Attacker, Stateless Target - Iterative Refinement)フレームワークを紹介します。
我々は,textbfmulti-turn (stateless) イテレーションを用いて,最悪の逆数設定をシミュレートする。
単純で多様な攻撃戦略は、スタグングな textbf96% の成功率を達成し、メモリレス防御において深刻な脆さを露呈した。
論文 参考訳(メタデータ) (2026-09-15T07:46:01Z) - SRD-GUARD: A Defense Framework of LLMs via Semantic Rewriting and Joint Multi-Model Scoring for Latent Intent Exposure [7.121327089434882]
SRD-GUARDはパラメータフリーでブラックボックスの防御フレームワークで、セマンティックリライトとコンセンサスに基づくリスクアセスメントを通じて隠された意図を公開する。
Llama-3-8B-UncensoredおよびDeepSeek-V4-Flash上で,UNIATTACK,CIPHER,DeepInceptionに対するSRD-GUARDの評価を行った。
論文 参考訳(メタデータ) (2026-09-06T11:26:08Z) - One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue [55.98008208209856]
マルチターン対話における隠れた悪意のある意図は、大規模言語モデル(LLM)に対する脅威を増大させる
近年の研究では、安全アライメントや外部ガードレールの進歩にもかかわらず、高度なガードレールを備えた近代的な商用モデルでさえも、このような攻撃に対して脆弱であることが示されている。
そこで本研究では,この課題に対処するため,最も早いタイミングで候補応答を届けることによって,蓄積された相互作用が有害な作用を可能にするのに十分であることを示す。
論文 参考訳(メタデータ) (2026-05-07T03:35:31Z) - Aligning Deep Implicit Preferences by Learning to Reason Defensively [22.548051297731416]
優先推論のギャップを埋めるために,批判駆動推論アライメント(CDRA)を提案する。
CDRAはスカラー報酬マッチングタスクから構造化推論プロセスにアライメントを再構成する。
実験により、CDRAは、堅牢な推論を実行しながら、ユーザの真の嗜好を発見し、整合するのに優れていることが示された。
論文 参考訳(メタデータ) (2025-10-13T09:26:47Z) - Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs [54.90315421117162]
完全無害データを用いた新しい毒殺法を提案する。
自己回帰型LPMの因果推論に着想を得て,トリガーと肯定的応答プレフィックスの堅牢な関連性を確立することを目指す。
LLMは最初は同意するように見えるが,その後回答を拒む興味深い抵抗現象を観察する。
論文 参考訳(メタデータ) (2025-05-23T08:13:59Z) - Steering Dialogue Dynamics for Robustness against Multi-turn Jailbreaking Attacks [59.300698230887114]
大規模言語モデル(LLM)は、有害な応答を誘発するために敵のプロンプトが設計されたジェイルブレイク攻撃に対して脆弱であることが示されている。
安全制御理論に基づく安全ステアリングフレームワークを提案し,マルチターン対話における不変安全性を保証する。
論文 参考訳(メタデータ) (2025-02-28T21:10:03Z) - Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models [53.580928907886324]
Reasoning-Augmented Conversationは、新しいマルチターンジェイルブレイクフレームワークである。
有害なクエリを良心的な推論タスクに再構成する。
RACEは,複雑な会話シナリオにおいて,最先端攻撃の有効性を実現する。
論文 参考訳(メタデータ) (2025-02-16T09:27:44Z) - JoTR: A Joint Transformer and Reinforcement Learning Framework for
Dialog Policy Learning [53.83063435640911]
対話政策学習(DPL)は対話モデリングの重要な構成要素である。
フレキシブルな対話行動を生成するための新しいフレームワークであるJoTRを導入する。
従来の方法とは異なり、JoTRはよりダイナミックで適応可能な対話アクション生成を可能にするワードレベルのポリシーを定式化している。
論文 参考訳(メタデータ) (2023-09-01T03:19:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。