論文の概要: Large Language Models Generate Harmful Content Using a Distinct, Unified Mechanism
- arxiv url: http://arxiv.org/abs/2604.09544v1
- Date: Fri, 10 Apr 2026 17:58:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-13 17:57:53.995375
- Title: Large Language Models Generate Harmful Content Using a Distinct, Unified Mechanism
- Title(参考訳): 個別統一メカニズムを用いた大規模言語モデルによる有害コンテンツの生成
- Authors: Hadas Orgad, Boyi Wei, Kaden Zheng, Martin Wattenberg, Peter Henderson, Seraphina Goldfarb-Tarrant, Yonatan Belinkov,
- Abstract要約: 我々は、大規模言語モデルにおける有害性の内部組織を調査するための因果的介入として、目標重量刈り(target weight pruning)を用いる。
有害なコンテンツ生成は、害タイプにまたがる一般的な重みのコンパクトなセットに依存し、良質な能力とは別物であることが判明した。
- 参考スコア(独自算出の注目度): 47.12518380954109
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) undergo alignment training to avoid harmful behaviors, yet the resulting safeguards remain brittle: jailbreaks routinely bypass them, and fine-tuning on narrow domains can induce ``emergent misalignment'' that generalizes broadly. Whether this brittleness reflects a fundamental lack of coherent internal organization for harmfulness remains unclear. Here we use targeted weight pruning as a causal intervention to probe the internal organization of harmfulness in LLMs. We find that harmful content generation depends on a compact set of weights that are general across harm types and distinct from benign capabilities. Aligned models exhibit a greater compression of harm generation weights than unaligned counterparts, indicating that alignment reshapes harmful representations internally--despite the brittleness of safety guardrails at the surface level. This compression explains emergent misalignment: if weights of harmful capabilities are compressed, fine-tuning that engages these weights in one domain can trigger broad misalignment. Consistent with this, pruning harm generation weights in a narrow domain substantially reduces emergent misalignment. Notably, LLMs harmful generation capability is dissociated from how they recognize and explain such content. Together, these results reveal a coherent internal structure for harmfulness in LLMs that may serve as a foundation for more principled approaches to safety.
- Abstract(参考訳): 大きな言語モデル(LLM)は、有害な振る舞いを避けるためにアライメントトレーニングを行っているが、結果として生じる保護は不安定である: ジェイルブレイクは、定期的にそれらをバイパスし、狭いドメインの微調整は、広く一般化する ‘emergent misalignment'' を誘導することができる。
この脆さは、有害性に対するコヒーレントな内部組織が根本的な欠如を反映しているかどうかは不明だ。
ここでは, LLMの有害性の内部組織を調査するための因果的介入として, 目標重量刈り法を用いる。
有害なコンテンツ生成は、害タイプにまたがる一般的な重みのコンパクトなセットに依存し、良質な能力とは別物であることが判明した。
配向されたモデルは、表面レベルでの安全ガードレールの脆さにもかかわらず、アライメントが内部的に有害な表現を再現することを示している。
有害な能力の重みが圧縮された場合、これらの重みを1つのドメインで係わる微調整は、広範囲な不整合を引き起こす可能性がある。
これとは対照的に、狭い領域における害発生重量の刈り取りは、創発的不整合を著しく減少させる。
特に、LSMの有害な生成能力は、それらの内容の認識と説明の仕方から分離される。
これらの結果から, LLMの有害性に対するコヒーレントな内部構造が明らかとなり, 安全性に対するより原則化されたアプローチの基礎となる可能性が示唆された。
関連論文リスト
- From Shallow to Deep: Pinning Semantic Intent via Causal GRPO [40.89749712474356]
インテントピンニングを実現するためのフレームワークである Two-Stage Causal-GRPO を提案する。
TSC-GRPOは, 汎用性を保ちつつ, ジェイルブレイク攻撃に対する防御において, ベースラインを著しく上回っていることを示す。
論文 参考訳(メタデータ) (2026-03-03T07:02:20Z) - When Safety Collides: Resolving Multi-Category Harmful Conflicts in Text-to-Image Diffusion via Adaptive Safety Guidance [79.1968671824977]
テキスト・ツー・イメージ(T2I)拡散モデルは高品質な画像を生成する上で大きな進歩を見せている。
本研究では,適応型安全誘導(CASG)を動的に識別・適用する学習自由フレームワークとして,適応型安全誘導(CASG)を提案する。
T2Iの安全性ベンチマークの実験では、CASGの最先端性能が実証され、既存の方法と比較して有害率が最大15.4%低下した。
論文 参考訳(メタデータ) (2026-02-24T13:20:31Z) - Narrow fine-tuning erodes safety alignment in vision-language agents [0.12441041004077093]
生涯にわたるマルチモーダルエージェントは、ポストトレーニングを通じて新しいタスクに継続的に適応しなければならない。
狭い領域の有害なデータセット上の微調整された視覚言語モデルが、深刻な創発的ミスアライメントを引き起こすことを実証する。
論文 参考訳(メタデータ) (2026-02-18T22:47:28Z) - Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures [70.48661957773449]
創発的ミスアライメント(英: Emergent Misalignment)とは、狭い範囲のデータに対する微調整された大きな言語モデルによって、広範囲に不整合な振る舞いが引き起こされる障害モードを指す。
複数のドメインやモデルファミリにまたがって、特定の文字レベルの配置を示すデータの微調整モデルは、誤操作よりもはるかに強く、転送可能な微調整を誘導する。
論文 参考訳(メタデータ) (2026-01-30T15:28:42Z) - Re-Emergent Misalignment: How Narrow Fine-Tuning Erodes Safety Alignment in LLMs [0.0]
安全でないコードに対する微調整は、アライメントに反する内部的な変更を誘発することを示す。
我々は、アライメントの振る舞いを管理するモデルの活性化空間における共有潜在次元を同定する。
論文 参考訳(メタデータ) (2025-07-04T15:36:58Z) - Does Representation Intervention Really Identify Desired Concepts and Elicit Alignment? [73.80382983108997]
表現の介入(Representation intervention)は、大規模言語モデルにおいて基礎となる概念を符号化する表現の発見と修正を目的としている。
介入が忠実であれば、介入されたLLMは有害な概念を消去し、非分配的敵のプロンプトとアウト・オブ・ディストリビューションのジェイルブレイクの両方に対して堅牢であるべきである。
本研究では,有害表現と良性表現の境界を簡易化する概念集中(COCA)を提案する。
論文 参考訳(メタデータ) (2025-05-24T12:23:52Z) - Smoothed Embeddings for Robust Language Models [11.97873981355746]
大規模言語モデル(LLM)は、アライメントを抑え、有害な出力を誘導するジェイルブレイク攻撃に対して脆弱である。
本稿では,埋め込みベクトルにランダムノイズを付加し,各出力トークンの生成時にアグリゲーションを行うRESTAディフェンスを提案する。
本実験は,本手法がベースラインディフェンスと比較して,実用上のトレードオフよりも優れたロバスト性を実現することを示す。
論文 参考訳(メタデータ) (2025-01-27T20:57:26Z) - SafetyAnalyst: Interpretable, Transparent, and Steerable Safety Moderation for AI Behavior [56.10557932893919]
我々は、新しいAI安全モデレーションフレームワークであるSafetyAnalystを紹介する。
AIの振る舞いを考えると、SafetyAnalystはチェーン・オブ・シークレット・推論を使用してその潜在的な結果を分析する。
効果を28個の完全に解釈可能な重みパラメータを使って有害度スコアに集約する。
論文 参考訳(メタデータ) (2024-10-22T03:38:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。