論文の概要: Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal
- arxiv url: http://arxiv.org/abs/2609.04482v1
- Date: Thu, 03 Sep 2026 21:03:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.819945
- Title: Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal
- Title(参考訳): 安全対策 : LLMの安全対策のための境界型自己蒸留法
- Abstract要約: 市民の家庭教師と公職のアシスタントは、同じトピック内で異なるバウンダリを必要とするベースモデルを共有することができる。
我々はこれを狭い境界安全性として定式化し、制御されたトピック生成、カバレッジ修復、配布内補償データ、およびトレーニングと評価のための有害な良性ペアを組み合わせたオフラインの自己生成フレームワークを導入する。
- 参考スコア(独自算出の注目度): 1.8531140061496822
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Safety alignment is usually posed as a topic-level question: is this subject harmful? Deployments ask a narrower one. A civics tutor and a public-sector assistant may share a base model yet need different boundaries inside the same topic, refusing targeted political manipulation while still answering factual questions about the same election. We formulate this as narrow-boundary safety and introduce an offline self-generated framework combining controlled topic generation, coverage repair, in-distribution compensation data, and harmful-benign pairs for training and evaluation. Single-shot generation leaves 19.88% of prompts without accepted refusal traces, whereas escalating retries leave 0.20%. On political persuasion with Qwen3-8B, training on refusal data completed through Escalate increases target-domain refusal from 9.47% to 84.75% and reduces the mean unsafe-response rate across three broader harmfulness benchmarks from 26.26% to 0.14%, but increases XSTest over-refusal from 2.00% to 74.00%. In a separate matched comparison, replacing external responses with verified target-model responses reduces over-refusal from 15.20% to 5.20%. Boundary-pair data reduces comply-side over-refusal on held-out pairs from 32.94% to 4.16%, while harmful-side refusal decreases only from 91.88% to 87.72%. These results show that data composition controls the safety and usability trade-off, and that safety alignment should be evaluated on both sides of the intended refusal boundary.
- Abstract(参考訳): 安全アライメントは通常、トピックレベルの質問として提起される。
デプロイメントはより狭いものを求める。
市民の家庭教師と公職補佐官は、同じ話題の中で異なる境界線を必要とする基本モデルを共有することができる。
我々はこれを狭い境界安全性として定式化し、制御されたトピック生成、カバレッジ修復、配布内補償データ、およびトレーニングと評価のための有害な良性ペアを組み合わせたオフラインの自己生成フレームワークを導入する。
単発生成では19.88%のプロンプトが拒絶トレースを受けていないが、エスカレート再試薬は0.20%である。
Qwen3-8Bによる政治的説得では、Escalateで完了した拒絶データのトレーニングにより、ターゲットドメインの拒絶率は9.47%から84.75%に増加し、3つの広範囲な有害度ベンチマークの平均非安全応答率は26.26%から0.14%に減少するが、XSTestの過剰拒絶率は2.00%から74.00%に増加した。
別のマッチング比較では、外部応答を検証対象モデル応答に置き換えると、過剰な拒絶が15.20%から5.20%に減少する。
境界対のデータにより、保留ペアのコンプライアンス側の過剰拒絶は32.94%から4.16%に減少し、有害側拒絶は91.88%から87.72%に減少する。
これらの結果から,データ構成が安全性とユーザビリティのトレードオフを制御し,かつ,意図した拒絶境界の両側で安全アライメントを評価することが示唆された。
関連論文リスト
- EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents [74.54929751174289]
EvoSafeHarnessは、ターゲットドメイン内の凍結モデルのためのデプロイ可能なハーネスを合成する、安全固有の最適化フレームワークである。
これは平均攻撃成功率を3.3ポイントのユーティリティコストで45.6%から10.0%に下げる。
また、Agent-SafetyBenchでは、すべての犠牲者に対してベストスコアを獲得している。
論文 参考訳(メタデータ) (2026-09-05T05:56:41Z) - Barrier Function Conformal Safety Clearance Certification with CVaR for Driving Trajectory Selection [0.0]
この枠組みは、アリプランナーが選択した軌道を評価し、そのプランタイムマージンと安全クリアランスのギャップを校正する。
評価されたすべての統計の中で、正確なクリアランスのカバレッジは93.3-96.7%の目標よりも高い。
論文 参考訳(メタデータ) (2026-08-27T02:11:43Z) - Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs [54.96236442484317]
リスクのある知識はモデルに保持でき、特権制御トークンによって行動的に守られることを示す。
Token Inoculation という手法はバインディング・アンド・ブランチ方式を導入している。
論文 参考訳(メタデータ) (2026-07-21T02:15:39Z) - PsychoSafe: Eliciting Psychologically-Informed Refusals in Large Language Models [20.805546078350524]
心理的安全リフレームは、証拠に基づく介入戦略に基づく構造化された支援コミュニケーションとして拒絶される。
500のプロンプトの検証セットでは、サイコセーフプロンプトは全体的な拒絶品質をジェネリックベースラインに対して28.1%改善する。
微調整は、ほぼ完全な拒絶と資源参照率を達成するが、応答の関連性は減少する。
論文 参考訳(メタデータ) (2026-06-08T16:19:18Z) - SafeDiffusion-R1: Online Reward Steering for Safe Diffusion Post-Training [47.04114541434947]
拡散モデルは、事前学習中に学習した安全でないコンテンツを除去するために広く研究されている。
既存の手法では、安全でないテキストと安全な画像の基底と負の/正のイメージのペアを組み合わせて、高価な教師付きデータを必要とするため、スケールするのは現実的ではない。
ポストトレーニングによるデータ不足とモデル劣化に対処する新しいオンライン強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-18T17:50:04Z) - Owner-Harm: A Missing Threat Model for AI Agent Safety [0.0]
既存のAI安全性ベンチマークは、一般的な犯罪被害に焦点を当てている。
本稿では,8つのカテゴリのエージェント動作がデプロイを損なう,正式な脅威モデルである Owner-Harm を提案する。
論文 参考訳(メタデータ) (2026-04-20T10:11:26Z) - DART: Mitigating Harm Drift in Difference-Aware LLMs via Distill-Audit-Repair Training [18.22030439716779]
安全のために調整された大きな言語モデル(LLM)は、しばしば人口統計の違いを認めない。
このアイデンティティ・ブラインドネスは、誤った応答、不必要な拒絶、あるいは一般的な"equal-treatment"デフォルトをもたらす。
DART(Distill-Audit-Repair Training)を導入する。
論文 参考訳(メタデータ) (2026-04-18T05:28:53Z) - Measuring the Permission Gate: A Stress-Test Evaluation of Claude Code's Auto Mode [9.116800340266066]
Claude Codeの自動モードは、AIコーディングエージェントに最初にデプロイされたパーミッションシステムである。
Anthropicは、生産トラフィックに対して0.4%の偽陽性率と17%の偽陰性率を報告している。
本研究では, 個々の行動レベルでの状態変化行動253件を, オラクル・グラウンドの真理に対して評価した。
論文 参考訳(メタデータ) (2026-04-04T17:56:30Z) - AI Security Beyond Core Domains: Resume Screening as a Case Study of Adversarial Vulnerabilities in Specialized LLM Applications [71.27518152526686]
大きな言語モデル(LLM)はテキストの理解と生成に優れており、コードレビューやコンテンツモデレーションといった自動タスクに最適である。
LLMは履歴書やコードなどの入力データに隠された「逆命令」で操作でき、意図したタスクから逸脱する。
本稿では,特定の攻撃タイプに対して80%以上の攻撃成功率を示すとともに,この脆弱性を再開スクリーニングで評価するためのベンチマークを提案する。
論文 参考訳(メタデータ) (2025-12-23T08:42:09Z) - Refusal Falls off a Cliff: How Safety Alignment Fails in Reasoning? [68.82210578851442]
メカニスティックな解釈可能性レンズによる推論モデルにおいて、なぜ安全アライメントが失敗するのかを考察する。
トークン位置における拒絶意図の追跡のための線形探索手法を用いて,textbfrefusal cliff と呼ばれる現象を発見した。
提案手法は,最大断崖を示す訓練例を識別し,推論モデルの安全性を向上する手法であるtextbfCliff-as-a-Judge を提案する。
論文 参考訳(メタデータ) (2025-10-07T15:32:59Z) - A Granular Study of Safety Pretraining under Model Abliteration [64.24346997570275]
本稿では,リフレクションに敏感な方向を除去する軽量プロジェクション技術であるモデルアブリーブレーションについて検討する。
我々は、バランスのとれた有害かつ無害なケースで100のプロンプトを発行し、複数の判断を用いて**Refusal*または***Non-Refusal*として応答を分類し、判断の忠実さを検証する。
本研究は,データ中心の安全コンポーネントが失語中も頑健であるチェックポイントレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-10-03T07:01:45Z) - G$^2$uardFL: Safeguarding Federated Learning Against Backdoor Attacks
through Attributed Client Graph Clustering [116.4277292854053]
Federated Learning (FL)は、データ共有なしで協調的なモデルトレーニングを提供する。
FLはバックドア攻撃に弱いため、有害なモデル重みがシステムの整合性を損なう。
本稿では、悪意のあるクライアントの識別を属性グラフクラスタリング問題として再解釈する保護フレームワークであるG$2$uardFLを提案する。
論文 参考訳(メタデータ) (2023-06-08T07:15:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。