論文の概要: Not All Refusals Are Equal: How Safety Alignment Fails Cybersecurity at Scale
- arxiv url: http://arxiv.org/abs/2607.02714v2
- Date: Tue, 07 Jul 2026 12:39:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 14:37:43.057378
- Title: Not All Refusals Are Equal: How Safety Alignment Fails Cybersecurity at Scale
- Title(参考訳): すべての拒否が平等であるとは限らない: 大規模なサイバーセキュリティがいかに安全を損なうか
- Abstract要約: ここでは,1T-パラメータKim K2の例を例に,ドメイン固有文字化が標準手法で達成可能であることを示す。
モデルの特徴とドメイン固有の消音効果の相関について検討し,安全性トレーニングとアーキテクチャのタイプが最も信頼性の高い予測因子であることを確認した。
- 参考スコア(独自算出の注目度): 5.1398662278838225
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: There is no doubt that safety alignment is an essential step in LLM training. However, conceptually it does not distinguish between various domains and the level of potential harm of a query, which creates significant complications in the fields like cyber security, where a model should not be constrained by its safety circuits to accomplish the goals of legitimate, authorized operations. In this work, we share our findings from a large scale abliteration experiment on 24 open-source LLMs and show that domain-specific abliteration is achievable with standard methodology on the example of a 1T-parameter Kimi K2. Building on recent work showing that refusal in LLMs occupies a multi-dimensional subspace within layers, we find that it is also distributed widely across layers, especially in trillion-parameter MoE architectures, and so we aim to capture the part of it that represents harmful concepts in the cybersecurity domain exclusively. We also investigate the correlation between models' features and the effect of domain-specific abliteration, identifying that the type of safety training and architecture are the most reliable predictors. Finally, we classify the models into 3 abliteration susceptibility tiers and put forward a set of conjectures as to why a particular effect from this intervention might be observed in a given model.
- Abstract(参考訳): LLMトレーニングにおいて、安全アライメントが重要なステップであることは疑いない。
しかし、概念的には、様々なドメインとクエリの潜在的な害のレベルを区別しないため、サイバーセキュリティのような分野において、モデルが正当で認可された操作の目的を達成するために安全回路によって制約されるべきではない、重大な複雑さを生じさせる。
本研究は,24個のオープンソースLCMの大規模アブリーブ化実験から得られた知見を公開し,ドメイン固有のアブリーブ化が1TパラメータK2の例における標準手法で達成可能であることを示す。
LLMの拒絶が層内の多次元部分空間を占めることを示す最近の研究に基づいて、特に1兆マイルのMOEアーキテクチャにおいて、層に広く分散していることが判明した。
また,モデルの特徴とドメイン固有の消音効果の相関について検討し,安全性トレーニングとアーキテクチャのタイプが最も信頼性の高い予測因子であることを確認した。
最後に、これらのモデルを3つのアクセプション・サセプティビリティ・ティアに分類し、この介入による特定の効果が与えられたモデルでなぜ観測されるのかという一連の予想を提示する。
関連論文リスト
- Position: A Three-Layer Probabilistic Assume-Guarantee Architecture Is Structurally Required for Safe LLM Agent Deployment [0.0]
安全な操作を共同で構成する3つの次元:意味的意図とポリシーの遵守、環境の妥当性、動的実現可能性。
コミュニティは、各安全次元が独立して認定されたレイヤによって強制される、コントラクトベースのアーキテクチャで対応する必要があります。
このようなアーキテクチャをスケッチし、確率の連鎖則によって認められる構成系レベルの安全性境界を導出する。
論文 参考訳(メタデータ) (2026-05-18T17:13:41Z) - Enhancing Safety of Large Language Models via Embedding Space Separation [24.821172423424866]
大きな言語モデル(LLM)は印象的な機能を達成したが、有害なプロンプトに対する安全性を保証することは、依然として重要な課題である。
最近の研究によると、LLMにおける有害で安全なクエリの潜伏表現(埋め込み)は、通常線形分離性を示す。
この観測により,埋め込み空間分離(ES2)という表現レベルの微調整手法を提案する。
論文 参考訳(メタデータ) (2026-03-01T07:22:38Z) - Why Does the LLM Stop Computing: An Empirical Study of User-Reported Failures in Open-Source LLMs [50.075587392477935]
オープンソースのDeepSeek、Llama、Qwenのエコシステムから、705の現実世界の失敗に関する大規模な実証的研究を行った。
ホワイトボックスオーケストレーションは、モデルアルゴリズムの欠陥からデプロイメントスタックのシステム的脆弱性へと、信頼性のボトルネックを移動させます。
論文 参考訳(メタデータ) (2026-01-20T06:42:56Z) - From Narrow Unlearning to Emergent Misalignment: Causes, Consequences, and Containment in LLMs [51.800006486987435]
特定領域での未学習を狭くすることで,創発的不適応が生じる可能性が示唆された。
我々の研究は、狭義のドメインアンラーニングが対象のコンセプトに対するコンプライアンス応答をもたらすことを示しているが、EMAを無関係のドメインに広めることもできる。
論文 参考訳(メタデータ) (2025-11-18T00:53:23Z) - Unvalidated Trust: Cross-Stage Vulnerabilities in Large Language Model Architectures [0.0]
本稿では,商業用言語モデルにおける41の繰り返しリスクパターンのメカニズム中心の分類法を提案する。
これらの動作がアーキテクチャ上の障害モードを構成し、文字列レベルのフィルタリングだけでは不十分である、と我々は主張する。
論文 参考訳(メタデータ) (2025-10-30T09:38:45Z) - Towards Reliable and Practical LLM Security Evaluations via Bayesian Modelling [1.0266286487433585]
新しい大規模言語モデル(LLM)アーキテクチャを採用する前に、脆弱性を正確に理解することが重要である。
既存の評価を信頼することは困難であり、しばしばLLMから結論を導き出す。
インジェクション攻撃の迅速化を目的としたLCM脆弱性評価のための,原則的かつ実用的なエンドツーエンドフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-07T09:22:22Z) - Do We Really Need Curated Malicious Data for Safety Alignment in Multi-modal Large Language Models? [83.53005932513155]
MLLM(Multi-modal large language model)は大きな進歩を遂げているが、その安全性は依然として限られている。
そこで我々は, 単純明快な拒絶文に代えて, 少数の良性命令追従データに対して, MLLMを微調整する手法を提案する。
論文 参考訳(メタデータ) (2025-04-14T09:03:51Z) - Fundamental Safety-Capability Trade-offs in Fine-tuning Large Language Models [92.38300626647342]
タスク固有のデータセット上でのLLM(Fun-tuning Large Language Model)は、LLMの第一の用途である。
本稿では,LLMファインチューニング戦略の安全性と能力の相互作用を理解するための理論的枠組みを提案する。
論文 参考訳(メタデータ) (2025-03-24T20:41:57Z) - Combining Domain and Alignment Vectors to Achieve Better Knowledge-Safety Trade-offs in LLMs [67.27279184423723]
我々は、ドメインとアライメントベクトルを補間し、より安全なドメイン固有モデルを作成する、textscMergeAlignと呼ばれる効率的なマージベースのアライメント手法を導入する。
医学やファイナンスの専門家であるLlama3の変種にtextscMergeAlignを適用することで、ドメイン固有のベンチマークを最小限または全く劣化させることなく、大幅なアライメントの改善が得られる。
論文 参考訳(メタデータ) (2024-11-11T09:32:20Z) - Safety Layers in Aligned Large Language Models: The Key to LLM Security [43.805905164456846]
整列 LLM の内部パラメータは、微調整攻撃を受けた場合のセキュリティ劣化に対して脆弱である。
我々の研究は、パラメータレベルでのLLMの整列化におけるセキュリティのメカニズムを明らかにし、モデルの中央に小さな連続した層を識別する。
そこで本稿では, 安全部分調整(SPPFT)方式を提案する。
論文 参考訳(メタデータ) (2024-08-30T04:35:59Z) - What Makes and Breaks Safety Fine-tuning? A Mechanistic Study [64.9691741899956]
安全性の微調整は、大規模な言語モデル(LLM)を、安全なデプロイメントのための人間の好みに合わせるのに役立つ。
安全でない入力の健全な側面をキャプチャする合成データ生成フレームワークを設計する。
これを用いて,3つのよく知られた安全微調整手法について検討する。
論文 参考訳(メタデータ) (2024-07-14T16:12:57Z) - Decomposing Uncertainty for Large Language Models through Input Clarification Ensembling [69.83976050879318]
大規模言語モデル(LLM)では、不確実性の原因を特定することが、信頼性、信頼性、解釈可能性を改善するための重要なステップである。
本稿では,LLMのための不確実性分解フレームワークについて述べる。
提案手法は,入力に対する一連の明確化を生成し,それらをLLMに入力し,対応する予測をアンサンブルする。
論文 参考訳(メタデータ) (2023-11-15T05:58:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。