論文の概要: Silent Alarm: A J-Space Protocol for Comparing Danger Recognition Across Models and Quantization Levels
- arxiv url: http://arxiv.org/abs/2607.12792v1
- Date: Tue, 14 Jul 2026 14:08:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.166407
- Title: Silent Alarm: A J-Space Protocol for Comparing Danger Recognition Across Models and Quantization Levels
- Title(参考訳): Silent Alarm: モデル全体での危険認識と量子化レベルを比較するJ空間プロトコル
- Abstract要約: この研究は、ヤコビ空間を通してモデルの内部表現を測定するプロトコルであるJADRを提案する。
すべてのプロンプトとレイヤに対して、トップkのJスペーストークンを記録します。
これらは6つのシナリオ軸にグループ化され、StrongREJECTに基づく危険サンプルと、XSTestとOKTestから引き出された安全なコントロールを比較します。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Jailbreak-robustness research typically evaluates safety through generated responses using an LLM-as-judge approach. Such evaluations, however, are sensitive to the benchmark's grading procedure and capture only observed behavior on a given set of attacks, without directly revealing the hidden fragility of the underlying safety mechanisms. This work proposes JADR (Jacobian Assessment of Danger Recognition), a protocol that measures a model's internal representation through Jacobian space (J-space, a recently proposed workspace of verbalizable concepts) before the first response token is generated. For every prompt and layer we record the top-k J-space tokens; these are grouped into six behavioral scenario axes and compared between a danger sample based on StrongREJECT and a safe control drawn from XSTest and OKTest. The method does not call on an external judge model: the computation runs entirely locally, on the activations of the model under evaluation, which lets us compare both different models against each other and modifications of a single model -- quantization and fine-tuning in particular -- on the same terms. The final comparison rests on the proposed SafetyAUC metric, complemented with bootstrap confidence intervals. The protocol is applied to six models (Qwen3-1.7B, Qwen3-4B, Qwen3-8B, Qwen3-Uncensored-4B, Qwen3-SafeRL-4B, Gemma 2 9B) across three weight-representation regimes -- BF16, INT8, and INT4 -- and checked against an independent behavioral evaluation with the StrongREJECT grader. The metric separates models with a strong versus a weak internal safety mechanism with statistical significance and captures substantively different effects across quantization regimes.
- Abstract(参考訳): ジェイルブレイク・ロバストネスの研究は通常、LLM-as-judgeアプローチを用いて生成された応答を通じて安全性を評価する。
しかし、そのような評価はベンチマークのグレーディング手順に敏感であり、基礎となる安全メカニズムの隠れた脆弱性を直接明らかにすることなく、与えられた一連の攻撃に対する観察された振る舞いのみをキャプチャする。
本稿では,JADR(Jacobian Assessment of Danger Recognition)を提案する。このプロトコルは,第1応答トークンを生成する前に,ジャコビアン空間(J空間,最近提案された言語化可能な概念のワークスペース)を通じてモデルの内部表現を測定するプロトコルである。
これらのトークンは6つの行動シナリオ軸にグループ化され、StrongREJECTに基づく危険サンプルとXSTestとOKTestから引き出された安全なコントロールを比較します。
計算は、評価中のモデルのアクティベーションに基づいて完全にローカルに実行されるので、異なるモデルの相互比較と、1つのモデルの修正 -- 特に量子化と微調整 -- を同じ用語で比較することができます。
最後の比較は、ブートストラップの信頼区間を補完するセーフティAUCの基準に基づいている。
このプロトコルは6つのモデル(Qwen3-1.7B、Qwen3-4B、Qwen3-8B、Qwen3-Uncensored-4B、Qwen3-SafeRL-4B、Gemma 2 9B)に適用され、3つの重み表現規則(BF16、INT8、INT4)にまたがって適用され、StrongREJECTグレーダによる独立した行動評価にチェックされる。
この計量は、統計的重要性を持つ強い内部安全機構と弱い内部安全機構を持つモデルを分離し、量子化系全体で実質的に異なる効果を捉える。
関連論文リスト
- Detecting Safety Training Modification in Language Models via Activation Analysis [0.0]
本稿では,アクティベーション空間における安全関連概念の幾何学的構造を測定することで,言語モデルにおける安全訓練の修正を検出するツールであるAMSを紹介する。
4つのアーキテクチャファミリにまたがる14のモデル構成のAMSを検証する。
メカニスティック分析は、アクティベーション空間のシグネチャによって区別される安全訓練の修正の4つのクラス分類を識別する。
論文 参考訳(メタデータ) (2026-08-06T03:57:38Z) - Breaking the Rounding Trap: Securing LLMs against Quantization-Conditioned Backdoors [11.27557330957057]
モデル量子化は、大規模言語モデルを実際にデプロイする際のストレージと推論コストを削減するための重要なテクニックである。
近年の研究では、量子化によって引き起こされる離散化と丸め誤差を敵に利用して、量子化条件付きバックドアアタックを構築することが示されている。
本手法では,有意なラウンドリング動作を微妙に制御するために,誤差誘導型ラウンドリングの反転制約,出力分布の整合性,および重み付き正規化を組み合わせたラウンドリング制御変数を導入する。
論文 参考訳(メタデータ) (2026-06-28T07:06:46Z) - Can LLMs Reliably Self-Report Adversarial Prefills, and How? [9.80193616788089]
大規模言語モデル(LLM)は,良質なタスクに対して内観的能力を示すことを示す。
本研究は,モデルが先行応答が逆プレフィル攻撃によって引き起こされたことを確実に認識できるかどうかを検討する。
論文 参考訳(メタデータ) (2026-06-22T17:56:30Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - VATS: Exploiting Implicit Authority in Error-Path Injection via Systematic Mutation [0.3222802562733787]
VATS (Vulnerability Analysis of Tool Streams) は、7つの構造的および言語的次元にわたる逆ペイロードを進化させる突然変異駆動型フレームワークである。
Gemini 3.1 Pro, GPT-5.5, GLM-5.1, Qwen3-Coderの4つのフロンティアモデルに対して, エラーパスインジェクションが標準間接インジェクションの成功率を3倍にすることを示す。
論文 参考訳(メタデータ) (2026-06-06T06:07:52Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - OrgForge-IT: A Verifiable Synthetic Benchmark for LLM-Based Insider Threat Detection [0.0]
本稿では,決定論的シミュレーションエンジンが基底真理を維持し,言語モデルが表面の散文のみを生成する検証可能な合成ベンチマークを提案する。
コーパスは51日の模擬日、2,904回のテレメトリ記録を96.4%のノイズレートで記録し、単面と単日のトリアージ戦略を破るために設計された4つの検出シナリオをカバーしている。
論文 参考訳(メタデータ) (2026-03-23T19:03:53Z) - Attributing and Exploiting Safety Vectors through Global Optimization in Large Language Models [50.91504059485288]
本報告では,全頭部のグローバルな最適化により,安全クリティカルな注意点を同時に識別するフレームワークを提案する。
我々は,アクティベーション・リマッチによって同定された安全ベクトルを利用する,新しい推論時ホワイトボックス・ジェイルブレイク法を開発した。
論文 参考訳(メタデータ) (2026-01-22T09:32:43Z) - What Matters For Safety Alignment? [38.86339753409445]
本稿では,AIシステムの安全アライメント能力に関する総合的研究について述べる。
本研究では,6つの重要な内在モデル特性と3つの外部攻撃手法の影響を系統的に検討し,比較した。
LRMs GPT-OSS-20B, Qwen3-Next-80B-A3B-Thinking, GPT-OSS-120Bを最も安全な3つのモデルとして同定した。
論文 参考訳(メタデータ) (2026-01-07T12:31:52Z) - A Granular Study of Safety Pretraining under Model Abliteration [64.24346997570275]
本稿では,リフレクションに敏感な方向を除去する軽量プロジェクション技術であるモデルアブリーブレーションについて検討する。
我々は、バランスのとれた有害かつ無害なケースで100のプロンプトを発行し、複数の判断を用いて**Refusal*または***Non-Refusal*として応答を分類し、判断の忠実さを検証する。
本研究は,データ中心の安全コンポーネントが失語中も頑健であるチェックポイントレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-10-03T07:01:45Z) - DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models [50.21378052667732]
我々は、ステップ内およびステップ間ダイナミクスという2つの異なる次元にわたるジェイルブレイク攻撃に対して、dLLM脆弱性の詳細な分析を行う。
デュアルステージアプローチによる脆弱性に対処する,トレーニング不要な防御フレームワークであるDiffuGuardを提案する。
論文 参考訳(メタデータ) (2025-09-29T05:17:10Z) - What Makes and Breaks Safety Fine-tuning? A Mechanistic Study [64.9691741899956]
安全性の微調整は、大規模な言語モデル(LLM)を、安全なデプロイメントのための人間の好みに合わせるのに役立つ。
安全でない入力の健全な側面をキャプチャする合成データ生成フレームワークを設計する。
これを用いて,3つのよく知られた安全微調整手法について検討する。
論文 参考訳(メタデータ) (2024-07-14T16:12:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。