論文の概要: The Role of Fine-grained Harm Signals in LLM Safety
- arxiv url: http://arxiv.org/abs/2609.19366v2
- Date: Fri, 18 Sep 2026 01:50:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-21 18:40:16.707542
- Title: The Role of Fine-grained Harm Signals in LLM Safety
- Title(参考訳): LLMの安全性における微細ハーム信号の役割
- Abstract要約: 大規模言語モデルにおける内部有害度表現はリスクカテゴリによって異なり、一般的な一般的な害度表現コンポーネントを共有する。
このことは LLM の安全性における一般調和表現以上のカテゴリー特異的成分の役割について疑問を呈する。
3つの命令調整LDMにおいて,11のリスクカテゴリにまたがるカテゴリ残差を伴うアクティベーションステアリングを用いて,有害性をコードするカテゴリ残差がカテゴリーによって異なるか,また,このカテゴリ別パターンがモデル間で類似していることを見出した。
- 参考スコア(独自算出の注目度): 29.025745192229248
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Prior work has shown that internal harmfulness representations in large language models vary across risk categories, while sharing a common general harm representation component. This raises a question about the role of the category-specific component beyond general harm representation in LLM safety. To answer this question, we isolate the category-specific component by removing shared general harmfulness representation from each categorical harmfulness representation, yielding a category residual that is orthogonal to general harmfulness at every layer. Using activation steering with category residuals across 11 risk categories in 3 instruction-tuned LLMs, we find that whether category residuals encode harmfulness varies across categories, and that this category-wise pattern is similar across models. Whether category residuals induce refusal also varies across categories, but this category-wise pattern is more model-dependent. We also find that category residuals increase LLMs' downstream internal alignment with shared general harmfulness representation. Together, these findings demonstrate that more fine-grained category residuals should also be considered beyond shared general harmfulness representation to fully understand LLM safety. More broadly, our findings show that even a direction orthogonal to a concept at one layer can contribute to the concept's downstream amplification.
- Abstract(参考訳): 以前の研究では、大きな言語モデルの内部の有害度表現はリスクカテゴリによって異なり、一般的な害度表現コンポーネントを共有することが示されている。
このことは LLM の安全性における一般調和表現以上のカテゴリー特異的成分の役割について疑問を呈する。
この疑問に答えるために、各カテゴリの有害度表現から共有の一般有害度表現を取り除き、各層における一般有害度に直交するカテゴリ残差を生じることにより、カテゴリ固有の成分を分離する。
3つの命令調整LDMにおいて,11のリスクカテゴリにまたがるカテゴリ残差を伴うアクティベーションステアリングを用いて,有害性をコードするカテゴリ残差がカテゴリーによって異なるか,また,このカテゴリ別パターンがモデル間で類似していることを見出した。
カテゴリー残基が拒絶を誘発するかどうかもカテゴリーによって異なるが、このカテゴリ単位のパターンはよりモデル依存的である。
また, カテゴリー残基がLLMの下流内部アライメントを増加させ, 一般有害度表現の共有も見いだした。
これらの結果から, LLMの安全性を十分に理解するためには, より微細なカテゴリー残基も共有の一般的な有害度表現を超えて考慮すべきであることが示唆された。
より広い範囲で見れば、ある層における概念に直交する方向であっても、その概念の下流増幅に寄与することを示している。
関連論文リスト
- Representational alignment yields generalizable safety in language models [34.46128626930711]
プロトタイプに基づく分類が行動適応性に寄与することを示す。
我々は,大規模言語モデルにおける潜在表現と人間の道徳的判断に表される分類とを一致させる表現類似性最適化を開発する。
本研究は,プロトタイプに基づく分類が行動適応性に寄与するという観点からの機能的支援を提供する。
論文 参考訳(メタデータ) (2026-09-03T16:00:16Z) - When Safety Collides: Resolving Multi-Category Harmful Conflicts in Text-to-Image Diffusion via Adaptive Safety Guidance [79.1968671824977]
テキスト・ツー・イメージ(T2I)拡散モデルは高品質な画像を生成する上で大きな進歩を見せている。
本研究では,適応型安全誘導(CASG)を動的に識別・適用する学習自由フレームワークとして,適応型安全誘導(CASG)を提案する。
T2Iの安全性ベンチマークの実験では、CASGの最先端性能が実証され、既存の方法と比較して有害率が最大15.4%低下した。
論文 参考訳(メタデータ) (2026-02-24T13:20:31Z) - Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning [47.868429337792314]
Fine-R1は、ファイングラインド視覚認識用に設計されたR1スタイルのMLLMである。
4ショットのトレーニングだけで、Fine-R1は既存のMLLMよりも優れており、MLLMの推論や、対照的なCLIPモデルも優れている。
論文 参考訳(メタデータ) (2026-02-07T16:16:51Z) - Category-Adaptive Cross-Modal Semantic Refinement and Transfer for Open-Vocabulary Multi-Label Recognition [59.203152078315235]
本稿では,カテゴリ適応型クロスモーダル・セマンティック・リファインメント・アンド・トランスファー(C$2$SRT)フレームワークを提案する。
提案するフレームワークは,2つの相補的モジュール,すなわち,カテゴリ内セマンティックリファインメント(ISR)モジュールと,カテゴリ間セマンティックトランスファー(IST)モジュールから構成される。
OV-MLRベンチマークの実験は、提案されたC$2$SRTフレームワークが現在の最先端アルゴリズムより優れていることを明らかに示している。
論文 参考訳(メタデータ) (2024-12-09T04:00:18Z) - Balanced Classification: A Unified Framework for Long-Tailed Object
Detection [74.94216414011326]
従来の検出器は、分類バイアスによる長期データを扱う際の性能劣化に悩まされる。
本稿では,カテゴリ分布の格差に起因する不平等の適応的是正を可能にする,BAlanced CLassification (BACL) と呼ばれる統一フレームワークを提案する。
BACLは、さまざまなバックボーンとアーキテクチャを持つさまざまなデータセット間で、一貫してパフォーマンス改善を実現している。
論文 参考訳(メタデータ) (2023-08-04T09:11:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。