論文の概要: Where Does Toxicity Live? Mechanistic Localization and Targeted Suppression in Language Models
- arxiv url: http://arxiv.org/abs/2605.27997v1
- Date: Wed, 27 May 2026 05:41:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:55.780722
- Title: Where Does Toxicity Live? Mechanistic Localization and Targeted Suppression in Language Models
- Title(参考訳): 毒性はどこに生きるか : 言語モデルにおける機械的局所化と目標抑圧
- Authors: Himanshu Beniwal, Mayank Singh,
- Abstract要約: 大規模言語モデルは、しばしば有毒、憎悪、有害な内容を生成する。
我々は、特定の層やニューロンに毒性を局在させる2つの相補的リトレーニングフリーフレームワークであるMeow2XとTRNEを紹介する。
分析の結果,毒性は初期勾配層に不均等に符号化され,アーキテクチャによって異なり,単一評価装置によって体系的に過小評価されていることがわかった。
- 参考スコア(独自算出の注目度): 1.2040549525117266
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models frequently generate toxic, hateful, or harmful content, yet existing mitigation methods rely on costly retraining or output-level filtering with no mechanistic insight into where toxicity originates internally. We introduce Meow2X and TRNE, two complementary retraining-free frameworks that localize toxicity to specific layers and neurons by analyzing activation differentials between toxic and neutral prompts, then suppress them via inference-time scaling or minimal rank-one weight edits -- without any gradient descent. Evaluations across five LMs, two benchmarks, and 90 configurations using dual safety evaluators demonstrate consistent toxicity reduction while preserving language modeling quality. Our analysis reveals that toxicity is disproportionately encoded in early MLP layers, varies across architectures, and is systematically underestimated by single-evaluator setups -- underscoring the need for multi-evaluator safety assessment. By bridging mechanistic interpretability with practical detoxification, our framework offers a principled path toward safer, more transparent language models.
- Abstract(参考訳): 大規模言語モデルは、しばしば毒性、憎悪、有害な内容を生成するが、既存の緩和法は、毒性が内部でどこから生じるかという機械的な洞察を伴わず、コストのかかる再訓練や出力レベルのフィルタリングに依存している。
有害なプロンプトと中性なプロンプトのアクティベーション差を分析して、特定の層やニューロンに毒性を局在させる2つの相補的リトレーニングフリーフレームワークであるMeow2XとTRNEを紹介します。
5つのLM,2つのベンチマーク,90の構成の2つの安全性評価器による評価は,言語モデリングの品質を維持しながら一貫した毒性の低下を示す。
我々の分析によると、毒性は初期のMLP層で不均等にコード化され、アーキテクチャによって異なり、体系的には単一評価器のセットアップによって過小評価され、マルチ評価器の安全性評価の必要性が強調されている。
実用的なデトックス化による機械的解釈可能性のブリッジにより、我々のフレームワークはより安全で透過的な言語モデルへの原則的な経路を提供する。
関連論文リスト
- Do Prompts Guarantee Safety? Mitigating Toxicity from LLM Generations through Subspace Intervention [6.808534332444413]
大きな言語モデル(LLM)は強力なテキストジェネレータである。
LLMは、一見無害なプロンプトが与えられたとしても、有害または有害な内容物を生成することができる。
これは深刻な安全性の課題であり、現実世界に害を与える可能性がある。
論文 参考訳(メタデータ) (2026-02-06T11:33:17Z) - Cleansing the Artificial Mind: A Self-Reflective Detoxification Framework for Large Language Models [14.566005698357747]
大言語モデル(LLM)は、顕著な生成能力と自己調節機構の出現を明らかにしている。
我々は, LLMの本来の能力を利用して, 有害な内容を検出する, 完全自己反射脱毒フレームワークを導入する。
我々の発見は、真の自己統制型言語モデルの可能性を強調し、より責任と倫理的に導かれたテキスト生成システムへの道を開いた。
論文 参考訳(メタデータ) (2026-01-16T21:01:26Z) - Detoxifying Large Language Models via Autoregressive Reward Guided Representation Editing [77.75609817898035]
大規模言語モデル(LLM)は、様々なタスクにわたって印象的なパフォーマンスを示してきたが、有害なコンテンツの生成には弱いままである。
textscAutoregressive textscReward textscGuided textscRe presentation textscEditing (ARGRE)を提案する。
ARGREは遅延表現空間内の毒性遷移を明示的にモデル化し、安定かつ正確な報酬誘導編集を可能にする。
論文 参考訳(メタデータ) (2025-09-24T03:40:32Z) - Breaking Bad Tokens: Detoxification of LLMs Using Sparse Autoencoders [9.203871622144863]
大規模言語モデル(LLM)は現在、ユーザ向けアプリケーションではユビキタスだが、望ましくない有害な出力を生成する。
我々はスパースオートエンコーダ(SAE)を利用してモデル残差ストリームの毒性関連方向を特定し、ターゲットのアクティベーションステアリングを行う。
論文 参考訳(メタデータ) (2025-05-20T15:55:31Z) - Aligned Probing: Relating Toxic Behavior and Model Internals [78.20380492883022]
言語モデル(LM)の振る舞いを協調する新しい解釈可能性フレームワークであるアライメント・プロブリングを導入する。
本フレームワークを用いて,20以上のOLMo,Llama,Mistralモデルについて検討した。
以上の結果から,LMは,特に下層において,入力およびその後の出力の毒性レベルに関する情報を強くエンコードしていることがわかった。
論文 参考訳(メタデータ) (2025-03-17T17:23:50Z) - Large Language Models can be Strong Self-Detoxifiers [82.6594169242814]
SASA(Self-disciplined Autoregressive Smpling)は、大規模言語モデル(LLM)の毒性低減のための軽量制御復号アルゴリズムである。
SASAは、自己回帰サンプリング戦略を調整することにより、電流出力のマージンを追跡し、有害な部分空間から世代を分離する。
Llama-3.1-Instruct (8B), Llama-2 (7B), GPT2-L model with the RealToxicityPrompts, BOLD, and AttaQ benchmarks。
論文 参考訳(メタデータ) (2024-10-04T17:45:15Z) - Detoxifying Large Language Models via Knowledge Editing [57.0669577257301]
本稿では,Large Language Models (LLM) のデトックス化のための知識編集手法について検討する。
我々は、強力な攻撃プロンプトを持つ9つの安全でないカテゴリをカバーするベンチマーク、SafeEditを構築した。
いくつかの知識編集手法を用いて実験を行い、知識編集がLLMを解毒する可能性を示し、汎用性能に限られた影響を与えていることを示す。
論文 参考訳(メタデータ) (2024-03-21T15:18:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。