論文の概要: Hidden in Thought: Transferable Chain-of-Thought Artifacts Induce Harmful Behavior
- arxiv url: http://arxiv.org/abs/2607.15286v1
- Date: Thu, 18 Jun 2026 00:06:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.020073
- Title: Hidden in Thought: Transferable Chain-of-Thought Artifacts Induce Harmful Behavior
- Title(参考訳): 思考に隠された物質:伝達可能な鎖型人工物は有害な振る舞いを引き起こす
- Abstract要約: 有害なチェーン・オブ・シント(CoT)トレースが安全でない振る舞いを伝達し、再利用可能なジェイルブレイク攻撃へと蒸留できるかどうかを検討する。
創発性ミスアライメント生物と拒絶性ジェイルブレイク生物を用いて、有害なCoTを29ドルのオープンソースと5ドルのクローズドソースターゲットに移植する。
以上の結果から, 微量およびパターンレベルの有害な推論伝達は, 最終出力に加えて, 推論コンテキストを評価する防御を動機付けることが示唆された。
- 参考スコア(独自算出の注目度): 20.39995497842159
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We investigate whether harmful chain-of-thought (CoT) traces from compromised language models can transfer unsafe behaviour and be distilled into reusable jailbreak attacks. Using an emergent-misalignment organism and a refusal-ablated jailbroken organism, we transplant harmful CoTs into $29$ open-source and $5$ closed-source targets. Transferred traces raise harmful-response rates above $80\%$ on the most vulnerable open-source models, while semantically mismatched CoTs fail entirely. LLooM concept mining identifies four recurring components of harmful reasoning: proceduralisation, ethical decoupling, evasion, and target--vulnerability framing. Distilling these patterns into reusable system prompts produces effective black-box jailbreaks, outperforming direct CoT transplantation on strongly aligned models by up to an order of magnitude, including a $10\times$ improvement on GPT-4.1 AdvBench. Reasoning-enabled models are more than twice as vulnerable, and output-side safeguards such as Llama-Guard~3 frequently miss harmful generations. Our results show that harmful reasoning transfers at both the trace and pattern levels, motivating defences that evaluate reasoning context in addition to final outputs.
- Abstract(参考訳): 有害なチェーン・オブ・シント(CoT)の言語モデルからの痕跡が、安全でない振る舞いを伝達し、再利用可能なジェイルブレイク攻撃へと蒸留できるかどうかを調査する。
創発性ミスアライメント生物と拒絶性ジェイルブレイク生物を用いて、有害なCoTを29ドルのオープンソースと5ドルのクローズドソースターゲットに移植する。
トランスファートトレースは最も脆弱なオープンソースモデルにおいて80\%以上の有害応答率を上昇させ、セマンティックにミスマッチしたCoTは完全に失敗する。
LLooMの概念マイニングは、手続き化、倫理的疎結合、回避、ターゲット-加重性フレーミングという、有害な推論の4つの繰り返し成分を識別する。
これらのパターンを再利用可能なシステムに蒸留することで、効果的なブラックボックス・ジェイルブレイクを発生させ、GPT-4.1 AdvBenchの改善を含む、強い整列したモデルでの直接CoT移植を最大10倍に向上させる。
推論可能なモデルは脆弱性の2倍以上で、Llama-Guard~3のような出力側のセーフガードは有害な世代を見逃すことが多い。
以上の結果から, 微量およびパターンレベルの有害な推論伝達は, 最終出力に加えて, 推論コンテキストを評価する防御を動機付けることが示唆された。
関連論文リスト
- TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning [60.68349524623048]
分解されたジェイルブレイクは、大きな言語モデルにとって重大な脅威となる。
我々はステートフルなデュアルエンコーダ防御フレームワークであるTwinGateを紹介する。
我々は、8600の異なる悪意のある意図にまたがる360万以上の命令の包括的なデータセットを構築した。
論文 参考訳(メタデータ) (2026-04-30T13:44:01Z) - Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor [19.938570872083652]
大規模言語モデル(LLM)は、Chain-of-Thought(CoT)がユーザによって解釈されるように、ますます多くデプロイされている。
攻撃者はモデルの観測可能なCoTを操作して悪意ある振る舞いをすることができる。
実際には、永続的なCoTハイジャックは3つの大きな課題に直面している。
論文 参考訳(メタデータ) (2026-04-10T11:44:27Z) - Reasoning-Oriented Programming: Chaining Semantic Gadgets to Jailbreak Large Vision Language Models [9.123902853709206]
LVLM(Large Vision-Language Models)は、有害なコンテンツを抑えるために安全アライメントを行う。
本稿では,LVLMを誘導し,良性前提から有害な論理を合成するシステム欠陥を同定する。
提案手法は,ベニグインプットのセマンティック衝突を編成するために,モデルの命令追従機能を利用する。
論文 参考訳(メタデータ) (2026-03-10T06:18:48Z) - TraceGuard: Process-Guided Firewall against Reasoning Backdoors in Large Language Models [19.148124494194317]
我々は,小規模モデルを堅牢な推論ファイアウォールに変換するプロセス誘導型セキュリティフレームワークであるTraceGuardを提案する。
提案手法は,推理トレースを信頼できないペイロードとして扱い,詳細な防衛戦略を確立する。
グレーボックス設定における適応的敵に対する堅牢性を実証し、TraceGuardを実用的で低レイテンシなセキュリティプリミティブとして確立する。
論文 参考訳(メタデータ) (2026-03-02T22:19:13Z) - DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models [50.21378052667732]
我々は、ステップ内およびステップ間ダイナミクスという2つの異なる次元にわたるジェイルブレイク攻撃に対して、dLLM脆弱性の詳細な分析を行う。
デュアルステージアプローチによる脆弱性に対処する,トレーニング不要な防御フレームワークであるDiffuGuardを提案する。
論文 参考訳(メタデータ) (2025-09-29T05:17:10Z) - AdvChain: Adversarial Chain-of-Thought Tuning for Robust Safety Alignment of Large Reasoning Models [62.70575022567081]
本稿では,逆CoTチューニングによる動的自己補正をモデルに教えるアライメントパラダイムであるAdvChainを提案する。
私たちの仕事は、より堅牢で信頼性の高い推論モデルを構築するための新しい方向性を確立します。
論文 参考訳(メタデータ) (2025-09-29T04:27:23Z) - bi-GRPO: Bidirectional Optimization for Jailbreak Backdoor Injection on LLMs [33.470999703070866]
既存のジェイルブレイクのトリガーを埋め込むアプローチは、一般化の貧弱さ、ステルスネスの妥協、文脈的ユーザビリティの低下といった制限に悩まされている。
ジェイルブレイクバックドア注入に適した新しいRLベースのフレームワークであるbi-GRPOを提案する。
論文 参考訳(メタデータ) (2025-09-24T05:56:41Z) - Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs [54.90315421117162]
完全無害データを用いた新しい毒殺法を提案する。
自己回帰型LPMの因果推論に着想を得て,トリガーと肯定的応答プレフィックスの堅牢な関連性を確立することを目指す。
LLMは最初は同意するように見えるが,その後回答を拒む興味深い抵抗現象を観察する。
論文 参考訳(メタデータ) (2025-05-23T08:13:59Z) - Towards Model Resistant to Transferable Adversarial Examples via Trigger Activation [95.3977252782181]
知覚不能な摂動によって特徴づけられる敵対的な例は、彼らの予測を誤解させることで、ディープニューラルネットワークに重大な脅威をもたらす。
本稿では,移動可能な敵例(TAE)に対して,より効率的かつ効果的に堅牢性を高めることを目的とした,新たなトレーニングパラダイムを提案する。
論文 参考訳(メタデータ) (2025-04-20T09:07:10Z) - Turning Logic Against Itself : Probing Model Defenses Through Contrastive Questions [50.40122190627256]
非倫理的反応を引き起こすために、対照的な推論を利用する新しいジェイルブレイク手法であるPOATEを導入する。
PoATEは意味論的に意図に反し、敵のテンプレートと統合し、有害なアウトプットを驚くほど微妙に操る。
これに対応するために、悪意のある意図と理性を検出するためにクエリを分解して、有害な応答を評価し、拒否するIntent-Aware CoTとReverse Thinking CoTを提案する。
論文 参考訳(メタデータ) (2025-01-03T15:40:03Z) - Jailbreaking as a Reward Misspecification Problem [80.52431374743998]
本稿では,この脆弱性をアライメントプロセス中に不特定性に対処する新たな視点を提案する。
本稿では,報酬の相違の程度を定量化し,その有効性を実証する指標ReGapを紹介する。
ReMissは、報酬ミスの空間で敵のプロンプトを生成する自動レッドチームリングシステムである。
論文 参考訳(メタデータ) (2024-06-20T15:12:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。