論文の概要: Representational alignment yields generalizable safety in language models
- arxiv url: http://arxiv.org/abs/2609.04022v1
- Date: Thu, 03 Sep 2026 16:00:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:39.148998
- Title: Representational alignment yields generalizable safety in language models
- Title(参考訳): 表現アライメントは言語モデルにおける一般化可能な安全性をもたらす
- Authors: Lingyu Li, Yan Teng, Yingchun Wang, Xia Hu,
- Abstract要約: プロトタイプに基づく分類が行動適応性に寄与することを示す。
我々は,大規模言語モデルにおける潜在表現と人間の道徳的判断に表される分類とを一致させる表現類似性最適化を開発する。
本研究は,プロトタイプに基づく分類が行動適応性に寄与するという観点からの機能的支援を提供する。
- 参考スコア(独自算出の注目度): 34.46128626930711
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Aligning large language models (LLMs) is essential for their safe deployment. Current alignment methods mainly optimize observable responses, yet models remain vulnerable when the same harmful intent is recast in unfamiliar or adversarial forms that humans can easily recognize. Prototype theory offers an account of this adaptability. Human concepts are represented around central cases, and new instances are categorized according to their graded typicality relative to these prototypes. Here we show that such categorization of moral concepts is weakly preserved in current LLMs. Across 23 LLMs, models often failed to distinguish opposed moral categories or preserve fine-grained typicality within each category. These deficits persist across parameter sizes and alignment stages. We developed representational similarity optimization, which directly aligns the latent representations in LLMs with the categorization expressed in human moral judgements, without supervising generated responses. In matched experiments using the same 251,334 moral annotations, standard behavioral alignment learned the intended moral judgements at the response level while leaving the categorization structure largely unchanged and increasing vulnerability across adversarial evaluations. Reorganizing moral categorization produced more modest gains in explicit judgements but consistently improved adversarial robustness across model scales on diverse benchmarks and attack strategies. Our findings provide functional support for the view that prototype-based categorization contributes to behavioral adaptability. They also show that transferring this representational principle to LLMs yields generalizable safety under adversarial conditions.
- Abstract(参考訳): 大規模言語モデル(LLM)のアラインメントは、安全なデプロイメントには不可欠である。
現在のアライメント手法は主に観測可能な応答を最適化するが、人間が容易に認識できる不慣れな、あるいは敵対的な形で同じ有害な意図が再キャストされた場合、モデルは弱いままである。
原型理論はこの適応性を説明する。
人間の概念は中心的なケースを中心に表現され、新しいインスタンスはこれらのプロトタイプと比較して、それらのグレードの典型性に応じて分類される。
ここでは、このような道徳概念の分類が、現在のLLMにおいて弱い保存状態にあることを示す。
23個のLSMのモデルでは、対立する道徳的カテゴリーを区別したり、各カテゴリーの細かな典型を保存できなかった。
これらの欠陥はパラメータサイズとアライメント段階にわたって持続する。
我々は,LLMにおける潜在表現と人間の道徳的判断に表される分類を,生成した応答を監視せずに直接一致させる表現類似性最適化を開発した。
同じ251,334のモラルアノテーションを用いたマッチング実験において、標準的な行動アライメントは、応答レベルで意図されたモラル判断を学習し、分類構造は大きく変化せず、敵対的評価の脆弱性が増大した。
道徳的分類の再編成は、明確な判断においてより控えめな利益をもたらしたが、様々なベンチマークや攻撃戦略において、モデルスケールにおける敵の堅牢性は一貫して改善された。
本研究は,プロトタイプに基づく分類が行動適応性に寄与するという観点からの機能的支援を提供する。
彼らはまた、この表現原理を LLM に移すことは、敵条件下での一般化可能な安全性をもたらすことを示した。
関連論文リスト
- CV-DCLR: Causal-Visual Dynamic Label Refinement for Robust Zero-Shot Learning [25.21342780360303]
本稿ではCausal-Visual Dynamic Label Refinementフレームワークを提案する。
二重ストリーム相互補正機構を用いて視覚的意味的関連を補正する。
CUB、SUN、AWA2ベンチマークの実験では、CV-DCLRは高いあいまいさのシナリオで最先端の手法を大幅に上回っている。
論文 参考訳(メタデータ) (2026-07-01T12:45:35Z) - To Compare, or Not to Compare: On Methodological Practices in Evaluating Social Bias [61.40435736418359]
異質なベンチマークを標準化する統一的なフレームワークを導入し、孤立した人口統計評価と強制選択比較設定を対比する。
比較設定は、主に不特定文脈によって引き起こされる潜在識別のアグレッシブな触媒として機能することを示す。
最後に、この比較偏見はモデルサイズと正にスケールする一般化された現象であることを示す。
論文 参考訳(メタデータ) (2026-06-23T13:53:50Z) - Does Reasoning Preserve Alignment? On the Trustworthiness of Large Reasoning Models [55.788110316999166]
教師付き微調整, RL を用いた後訓練, および命令調整ベースラインに対する蒸留による推論モデルの比較を行った。
推論モデルはしばしば推論ベンチマークを改善するが、アライメント回帰を示す。
これらの回帰は、KL発散によって測定された命令調整ベースラインからの挙動ドリフトと一致している。
論文 参考訳(メタデータ) (2026-06-09T16:14:27Z) - From Holistic Evaluation to Structured Criteria: Rubrics Across the Evolving LLM Landscape [79.30826980815927]
ルーブリックは、複雑な品質判断を構造化され、実行可能な標準に変換する明示的な基準セットです。
我々は,既存のルーリックデザインを体系的に整理し,その構築と最適化を検証し,評価と訓練をまたいだ役割を解析する。
論文 参考訳(メタデータ) (2026-06-07T13:34:55Z) - Mechanistic Origin of Moral Indifference in Language Models [17.89411060814224]
既存のLLM(Large Language Models)の行動アライメント技術は、表面コンプライアンスと内部の非整合表現の相違を無視することが多い。
我々は、プロトタイプ理論と社会化学101データセットに基づいて構築された251kの道徳的ベクトルを用いて、LLMの潜在表現におけるこの無関心を検証、改善する。
次に、Qwen3-8B上でスパースオートエンコーダを使用し、単意味的道徳的特徴を分離し、そのトポロジ的関係を目的的に再構築し、基幹的道徳的ベクトルと整合させる。
論文 参考訳(メタデータ) (2026-03-16T17:59:17Z) - Probabilistic Aggregation and Targeted Embedding Optimization for Collective Moral Reasoning in Large Language Models [14.425718737962102]
本稿では,複数の LLM の道徳的判断を集合的に定式化した道徳的判断に合成する枠組みを提案する。
我々の集約メカニズムは、連続的な道徳的受容可能性スコア(バイナリラベルの他に)を集合的確率に融合させる。
大規模社会道徳ジレンマデータセットの実験は、我々のアプローチが堅牢なコンセンサスを構築し、個々のモデル忠実性を改善することを示している。
論文 参考訳(メタデータ) (2025-06-17T15:22:21Z) - Estimating Commonsense Plausibility through Semantic Shifts [66.06254418551737]
セマンティックシフトを測定することでコモンセンスの妥当性を定量化する新しい識別フレームワークであるComPaSSを提案する。
2種類の細粒度コモンセンス可視性評価タスクの評価は,ComPaSSが一貫してベースラインを上回っていることを示している。
論文 参考訳(メタデータ) (2025-02-19T06:31:06Z) - Fundamental Tradeoffs between Invariance and Sensitivity to Adversarial
Perturbations [65.05561023880351]
敵の例は誤分類を引き起こすために作られた悪意のある入力である。
本稿では, 相補的障害モード, 不変性に基づく逆数例について検討する。
感度に基づく攻撃に対する防御は、不変性に基づく攻撃に対するモデルの精度を積極的に損なうことを示す。
論文 参考訳(メタデータ) (2020-02-11T18:50:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。