論文の概要: TRACE: Trajectory Return Attribution and Contrastive Erasure for Multi-Turn Safety
- arxiv url: http://arxiv.org/abs/2610.01323v1
- Date: Thu, 01 Oct 2026 08:49:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.016678
- Title: TRACE: Trajectory Return Attribution and Contrastive Erasure for Multi-Turn Safety
- Title(参考訳): TRACE:マルチターン安全のためのトラジェクトリリターン属性とコントラスト消去
- Abstract要約: 安全に整合した大規模言語モデル(LLM)は、しばしば有害な要求を拒否するが、同じ目標が複数のターンにまたがると従う。
選好目標は、単一のプロンプトに対する全応答をスコアするので、トレーニングの損失だけでは、目に見えない歴史のリスクをコントロールできない。
我々の分析は、教師付き単一ターンコンテキストにおける抑制が多ターン軌道リスクに束縛される十分な条件を与える。
- 参考スコア(独自算出の注目度): 24.920876389236373
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Safety-aligned large language models (LLMs) often refuse a harmful request but comply once the same goal is spread over several turns. Preference objectives score whole responses to single prompts, so their training loss alone cannot control risk on unseen histories. Our analysis gives sufficient conditions under which suppression at supervised single-turn contexts yields a bound on multi-turn trajectory risk. The bound accounts for coverage, transfer slack, and leakage, and characterizes contraction relative to a base-policy risk budget evaluated on the trained policy's contexts. TRACE (Trajectory Return Attribution and Contrastive Erasure) turns this principle into a token-level objective. On the safe response, each token is weighted by the discounted return of a refusal-attributable advantage. The advantage compares a frozen reference model with its refusal-ablated copy, allowing earlier response tokens to receive credit from later refusal-related evidence. At high-gap positions on rejected responses, TRACE combines the observed token with policy-selected alternatives in the erasure target. A gradient-norm penalty replaces the retain set. Across five open-weight models and seven multi-turn attacks, TRACE gives the lowest attack success rate (ASR) in all 35 model and attack pairs, while the model utility evaluated on MMLU and HellaSwag drop by at most 1\.23 points. Source code can be found in the supplemental material.
- Abstract(参考訳): 安全に整合した大規模言語モデル(LLM)は、しばしば有害な要求を拒否するが、同じ目標が複数のターンにまたがると従う。
選好目標は、単一のプロンプトに対する全応答をスコアするので、トレーニングの損失だけでは、目に見えない歴史のリスクをコントロールできない。
我々の分析は、教師付き単一ターンコンテキストにおける抑制が多ターン軌道リスクに束縛される十分な条件を与える。
境界線は、カバー範囲、転送スラック、漏洩を考慮し、訓練された政策の状況に基づいて評価された基本的政治リスク予算に対する収縮を特徴付ける。
TRACE(Trajectory Return Attribution and Contrastive Erasure)は、この原則をトークンレベルの目的に変換する。
安全応答では、各トークンは、拒絶帰属的な利点の割引された返却によって重み付けされる。
この利点は、凍結された参照モデルと拒絶関連コピーを比較し、初期の応答トークンが後続の拒絶関連証拠からクレジットを受け取ることができる。
拒絶応答における高いゲップ位置において、TRACEは、観測されたトークンと消去対象のポリシー選択された代替品を結合する。
勾配-ノルムのペナルティは、保持セットを置き換える。
5つのオープンウェイトモデルと7つのマルチターン攻撃のうち、TRACEは35のモデルとアタックペアの中で最も低い攻撃成功率(ASR)を与え、MMLUとHellaSwagで評価されたモデルユーティリティは少なくとも1\.23ポイント低下した。
ソースコードは補足資料に記載されている。
関連論文リスト
- Does This Action Still Explain the Task? Reverse Scoring for Diffusion Language Model Agents [25.947103954467874]
拡散ベースの大規模言語モデル(dLLM)は、並列デコーディングを通じて自動回帰エージェントのシーケンシャル遅延ボトルネックを壊すことを約束する。
最近の評価では、この効率はエンボディード・エージェント・コンピテンスに移行しない。
我々は、この失敗とトレーニングなしの治療法について、機械学的に説明します。
論文 参考訳(メタデータ) (2026-09-29T20:54:04Z) - Cross-Session Decomposition Attacks: Scaling Risk and Intent-Aligned Retrieval Defense [49.05879299987137]
言語モデリングの損失の低減は、より有用なモデルを生み出します。
本研究は,このメカニズムの安全性について,独立した相互作用を通じて,良質なサブクエリが要求され,後に禁忌の対象へと再帰される,エンフクロス・セッション分解攻撃(enmphcross-session decomposition attack)における研究である。
我々は、この設定をEmphcompositional safety riskとして定式化し、条件付きリスク-転送境界を証明する。
論文 参考訳(メタデータ) (2026-08-28T05:39:29Z) - Can LLMs Reliably Self-Report Adversarial Prefills, and How? [9.80193616788089]
大規模言語モデル(LLM)は,良質なタスクに対して内観的能力を示すことを示す。
本研究は,モデルが先行応答が逆プレフィル攻撃によって引き起こされたことを確実に認識できるかどうかを検討する。
論文 参考訳(メタデータ) (2026-06-22T17:56:30Z) - BalanceRAG: Joint Risk Calibration for Cascaded Retrieval-Augmented Generation [8.129733777508434]
大規模言語モデル(LLM)は、検索強化世代(RAG)を通して事実性を高めることができる
モデルのみの回答が信頼できる場合には、すべてのクエリにRAGを適用する必要はない。
我々は、しきい値ペアを目標リスクレベルで認証する BalanceRAG を開発した。
論文 参考訳(メタデータ) (2026-05-19T16:38:55Z) - Not All Tokens Are Created Equal: Query-Efficient Jailbreak Fuzzing for LLMs [21.149128115340996]
大規模言語モデル(LLM)は広くデプロイされているが、ポリシー違反の出力を誘発するジェイルブレイクプロンプトに対して脆弱である。
本稿では,トークン対応のジェイルブレイクファジィフレームワークであるTriageFuzzを提案する。
論文 参考訳(メタデータ) (2026-03-24T14:33:36Z) - Thought-Transfer: Indirect Targeted Poisoning Attacks on Chain-of-Thought Reasoning Models [46.18909391478578]
CoT(Chain-of-Thought)推論は,大規模言語モデルの能力向上のための強力なテクニックとして登場した。
我々の研究は、推論モデルにおける新しいタイプの間接的ターゲット・ポジショニング攻撃を公表した。
論文 参考訳(メタデータ) (2026-01-27T00:46:24Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - One Token Embedding Is Enough to Deadlock Your Large Reasoning Model [91.48868589442837]
我々は, LRMの生成制御フローをハイジャックする資源枯渇手法であるDeadlock Attackを提案する。
提案手法は4つの先進LEMにおいて100%の攻撃成功率を達成する。
論文 参考訳(メタデータ) (2025-10-12T07:42:57Z) - Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs [54.90315421117162]
完全無害データを用いた新しい毒殺法を提案する。
自己回帰型LPMの因果推論に着想を得て,トリガーと肯定的応答プレフィックスの堅牢な関連性を確立することを目指す。
LLMは最初は同意するように見えるが,その後回答を拒む興味深い抵抗現象を観察する。
論文 参考訳(メタデータ) (2025-05-23T08:13:59Z) - REINFORCE Adversarial Attacks on Large Language Models: An Adaptive, Distributional, and Semantic Objective [57.57786477441956]
応答の個体群に対する適応的・意味的最適化問題を提案する。
我々の目標は、Llama3の攻撃成功率(ASR)を2倍にし、サーキットブレーカー防御でASRを2%から50%に向上させることである。
論文 参考訳(メタデータ) (2025-02-24T15:34:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。