論文の概要: Beyond a Global Norm: Personalizing Toxicity Sensitivity in Language Models Without Retraining
- arxiv url: http://arxiv.org/abs/2607.23175v1
- Date: Sat, 25 Jul 2026 12:09:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.007444
- Title: Beyond a Global Norm: Personalizing Toxicity Sensitivity in Language Models Without Retraining
- Title(参考訳): グローバルノルムを超えて:リトレーニングなしの言語モデルにおける毒性感受性のパーソナライズ
- Abstract要約: 本研究は,言語とユーザ固有の毒性感受性を協調する学習自由度法の比較評価である。
PRISMデータセットから得られた毒性感受性目標に対して評価され、すべての手法がアライメントエラーを28~47%低減する。
その結果、アライメントの有効性、パーソナライズ、および一般言語品質の基本的なトレードオフが明らかとなり、毒性感度アライメントが本質的に多目的問題であることを示す。
- 参考スコア(独自算出の注目度): 4.362919441859566
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reducing toxicity is often framed as a global alignment problem, yet perceptions of harmful language are subjective and context-dependent. We present the first comparative evaluation of training-free methods for aligning language generation to user-specific toxicity sensitivities across three inference-time intervention stages: pre-decoding (prompt conditioning and rewriting), in-decoding (token, logit, and representation steering), and post-decoding (candidate re-ranking). Evaluated against toxicity sensitivity targets derived from the PRISM dataset, all methods reduce alignment error by 28-47%. However, the results reveal a fundamental trade-off between alignment effectiveness, personalization, and general language quality, showing how toxicity sensitivity alignment is an inherently multi-objective problem.
- Abstract(参考訳): 毒性の低下は、大域的なアライメントの問題として扱われることが多いが、有害な言語に対する認識は主観的で文脈に依存している。
提案手法は,事前復号化(事前条件付けと書き換え),内復号化(トークン,ロジット,表現ステアリング),後復号化(候補更新)の3段階にわたる,言語生成とユーザ固有の毒性感受性の整合性を示す。
PRISMデータセットから得られた毒性感受性目標に対して評価され、すべての手法がアライメントエラーを28~47%低減する。
しかし, この結果からアライメントの有効性, パーソナライゼーション, および一般言語品質の基本的なトレードオフが明らかとなり, 毒性感度アライメントが本質的に多目的問題であることを示す。
関連論文リスト
- Inference-Time Steering for Cross-Lingual Factual Consistency in LLMs [51.56484100374058]
大規模言語モデル(LLM)は目覚ましい多言語流布を示すが、その内部知識表現はハイリソース言語に対して不均等に偏っている。
我々は,これらのバイアスを推論時に緩和できるかどうかを考察し,対象言語でクエリされたかのように,英語の確率モデルに答えるように強制する。
Gemma 3 12Bの実験では、最も強い全体的な介入、効率性のバランス、安全性、ドメイン外の一般化を促すペルソナが明らかにされている。
論文 参考訳(メタデータ) (2026-07-21T16:15:05Z) - A Survey of Toxicity Detection and Mitigation Strategies for Multilingual Language Models [21.145305563840697]
本研究は多言語モデルに対する毒性検出と解毒に関する研究を合成する。
我々はまず、言語選択、翻訳のピボット、コードスイッチング、正書法の変化、マルチターンインタラクション、そして、安全アライメントを弱めるためにデプロイ後の微調整を利用する脅威モデルをカタログ化する。
次に,タスクの定式化(有害-中性リライト,毒性分類,有害-世代評価),多言語検出アプローチ,緩和戦略を整理する。
論文 参考訳(メタデータ) (2026-06-24T04:24:30Z) - Beyond Content: A Comprehensive Speech Toxicity Dataset and Detection Framework Incorporating Paralinguistic Cues [17.62673716826934]
ToxiAlert-Benchは7つの主要な毒性カテゴリと20のきめ細かい毒性ラベルを付加した大規模オーディオデータセットである。
本稿では,有毒な音声検出に適した多段階トレーニング戦略を持つデュアルヘッドニューラルネットワークを提案する。
実験結果から,パラ言語的特徴の活用は検出性能を著しく向上させることが示された。
論文 参考訳(メタデータ) (2026-05-15T14:17:19Z) - Revisiting Modality Invariance in a Multilingual Speech-Text Model via Neuron-Level Analysis [15.638379666159127]
言語とモダリティの情報を符号化した場所、選択的ニューロンがデコードにどのように影響するか、そしてこの影響がネットワーク全体にどの程度集中しているかについて検討する。
我々は,平均精度ランキングを用いて言語選択性ニューロンとモダリティ選択性ニューロンを同定し,その機能的役割を推定時に中心的置換介入を用いて検討し,言語とモダリティ間のアクティベーション・マグニチュードの不平等を解析した。
論文 参考訳(メタデータ) (2026-01-24T09:22:18Z) - Boosting Accuracy and Interpretability in Multilingual Hate Speech Detection Through Layer Freezing and Explainable AI [0.0]
本研究では,感情分析とヘイトスピーチ検出のための3つのトランスフォーマーモデルの性能について検討した。
評価は英語、韓国語、日本語、中国語、フランス語の5言語で行われている。
モデル決定に対する個々の単語の寄与を強調するために、局所解釈型モデル非依存説明(LIME)フレームワークを統合する。
論文 参考訳(メタデータ) (2026-01-06T04:07:51Z) - Rethinking Toxicity Evaluation in Large Language Models: A Multi-Label Perspective [104.09817371557476]
大規模言語モデル(LLM)は、様々な自然言語処理タスクにおいて印象的な結果を得た。
有害なコンテンツを生み出す可能性には、深刻な安全上の懸念が浮かび上がっている。
毒性検出のための3つの新しいマルチラベルベンチマークを導入する。
論文 参考訳(メタデータ) (2025-10-16T06:50:33Z) - Mechanistic Understanding and Mitigation of Language Confusion in English-Centric Large Language Models [56.61984030508691]
言語混乱に関する最初の機械論的解釈可能性研究について述べる。
混乱点(CP)がこの現象の中心であることを示す。
比較分析によって同定された少数の臨界ニューロンを多言語で調整したニューロンで編集すると、混乱が著しく軽減されることがわかった。
論文 参考訳(メタデータ) (2025-05-22T11:29:17Z) - A comprehensive cross-language framework for harmful content detection
with the aid of sentiment analysis [0.356008609689971]
この研究は、初めて、どんな言語にも適応可能な詳細なフレームワークを紹介します。
フレームワークの重要なコンポーネントは、汎用的で詳細なアノテーションガイドラインの開発である。
感情分析の統合は、有害な言語検出を強化する新しいアプローチである。
論文 参考訳(メタデータ) (2024-03-02T17:13:47Z) - Neural Abstructions: Abstractions that Support Construction for Grounded
Language Learning [69.1137074774244]
言語の相互作用を効果的に活用するには、言語基底に対する2つの最も一般的なアプローチの制限に対処する必要がある。
本稿では,ラベル条件付き生成モデルの推論手順に対する制約のセットであるニューラル・アブストラクションの考え方を紹介する。
この手法により,マインクラフトにおけるオープンエンドハウスタスクのセマンティックな変更をユーザ人口が構築できることが示される。
論文 参考訳(メタデータ) (2021-07-20T07:01:15Z) - Mitigating Biases in Toxic Language Detection through Invariant
Rationalization [70.36701068616367]
性別、人種、方言などの属性に対するバイアスは、毒性検出のためのほとんどのトレーニングデータセットに存在する。
本稿では,論理生成器と予測器から構成されるゲーム理論フレームワークである不変合理化(InvRat)を用いて,特定の構文パターンの素早い相関を除外することを提案する。
本手法は, 語彙属性と方言属性の両方において, 従来のデバイアス法よりも低い偽陽性率を示す。
論文 参考訳(メタデータ) (2021-06-14T08:49:52Z) - TextFlint: Unified Multilingual Robustness Evaluation Toolkit for
Natural Language Processing [73.16475763422446]
NLPタスク(TextFlint)のための多言語ロバスト性評価プラットフォームを提案する。
普遍的なテキスト変換、タスク固有の変換、敵攻撃、サブポピュレーション、およびそれらの組み合わせを取り入れ、包括的な堅牢性分析を提供する。
TextFlintは、モデルの堅牢性の欠点に対処するために、完全な分析レポートとターゲットとした拡張データを生成します。
論文 参考訳(メタデータ) (2021-03-21T17:20:38Z) - Challenges in Automated Debiasing for Toxic Language Detection [81.04406231100323]
バイアスド・アソシエーションは、有害な言語を検出するための分類器の開発において課題となっている。
我々は最近,有害な言語検出に適用されたテキスト分類データセットとモデルに対するデバイアス法について検討した。
我々の焦点は語彙(例えば、誓い言葉、スラー、アイデンティティの言及)と方言マーカー(特にアフリカ系アメリカ人の英語)である。
論文 参考訳(メタデータ) (2021-01-29T22:03:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。