論文の概要: Multimodal Safety Evaluation Should Measure Controllability Beyond Classification
- arxiv url: http://arxiv.org/abs/2610.06452v1
- Date: Mon, 05 Oct 2026 14:55:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-09 08:12:01.721517
- Title: Multimodal Safety Evaluation Should Measure Controllability Beyond Classification
- Title(参考訳): マルチモーダル安全性評価は、分類を超えて制御可能性を測定するべきである
- Abstract要約: VLMの安全性は入力レベルの分類と出力レベルの分類によって評価される。
マルチモーダル安全性評価は,行動分類と並行して,制御可能性プロファイルを報告すべきである。
LlavaGuard と Qwen3.5 で、このプロファイルをスパースな特徴分解でインスタンス化する。
- 参考スコア(独自算出の注目度): 22.976915512276292
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: VLM safety is commonly evaluated through input- and output-level classification. Such classification is necessary, but it does not reveal whether a safety state is accessible or controllable inside the model. We argue that multimodal safety evaluation should therefore report a \emph{controllability profile} alongside behavioral classification, separating representation-level detectability, cross-modal specificity, intervention sensitivity, and benign-preserving selectivity. Using implicit toxicity as a stress case, we instantiate this profile on LlavaGuard and Qwen3.5 with sparse feature decompositions. LlavaGuard admits localized handles with a narrow benign-preserving intervention range and modest downstream safety gains, whereas Qwen3.5 supports strong representation-level readout but no comparable selective-control regime under the tested operators. These results show that internal readout and controllability can diverge. Future multimodal safety benchmarks should therefore report not only behavioral safety metrics, but also whether safety-relevant internal signals can be intervention-tested and controlled within a validated operating range.
- Abstract(参考訳): VLMの安全性は入力レベルの分類と出力レベルの分類によって評価される。
このような分類が必要であるが、モデル内で安全状態がアクセス可能か制御可能かは明らかにされていない。
マルチモーダル安全性評価は, 行動分類とともに, 表現レベルの検出性, 相互特異性, 介入感度, 良性保持選択性を分離し, 自己制御性プロファイルを報告すべきである。
LlavaGuard と Qwen3.5 では, 暗黙の毒性をストレスケースとして用いた。
LlavaGuardは、狭い良性保存介入範囲と穏やかな下流安全ゲインを持つローカライズドハンドルを認めている。
これらの結果は、内部の読み出しと制御性が分散可能であることを示している。
したがって、将来のマルチモーダル安全ベンチマークでは、行動安全基準だけでなく、安全に関連する内部信号の介入テストや、検証された運用範囲内での制御も報告すべきである。
関連論文リスト
- Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning [2.481804875781114]
適応型大言語モデル(LLM)は,ユーザ要求の内容に基づいて安全行動を示すことが期待されている。
システムプロンプトに割り当てられた異なる特性の下で、同じ要求が実質的に異なる安全性決定を導出できることを示す。
論文 参考訳(メタデータ) (2026-08-12T06:33:55Z) - When Behavioral Safety Evaluation Fails: A Representation-Level Perspective [23.598318016787147]
大規模言語モデル(LLM)の安全性は、しばしば行動レベルで評価され、内部の堅牢性の限られた証拠を提供する。
我々は,この相違を監査ギャップとして定式化し,介入時の行動安全と頑健さの相違を考察した。
パラメータと潜伏空間のソフトな介入を通してモデルロバスト性をテストするための介入に基づく評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-06T08:10:56Z) - Do Models Share Safety Representations? Cross-Model Steering for Safe Visual Generation [52.122731171289665]
クロスモデル安全ステアリングのための最初のフレームワークを紹介する。
私たちのパイプラインは、ターゲット側の安全でないデータにアクセスしません。
多様なソース・ターゲット・モデル・ペア間のテキスト・ツー・イメージとテキスト・ツー・ビデオ生成におけるアプローチを評価する。
論文 参考訳(メタデータ) (2026-06-03T18:00:04Z) - Furina: Fragmented Uncertainty-Driven Refusal Instability Attack [9.678677899786718]
大規模言語モデル (LLM) とマルチモーダル・大規模言語モデル (MLLM) の安全性の整合性は、概ね2つのしきい値のメカニズムとして機能すると考えられている。
我々は、安全行動は、小さな摂動が決定論的結果よりも拒絶決定を引き起こす不安定な領域に支配されていることを明らかにすることによって、この仮定に挑戦する。
この不安定性を特徴付けるために,外部信号と内部信号を組み合わせたマルチメトリック診断フレームワークを開発した。
Furinaは、モデル固有の最適化なしに、断片化されたシーンアンコールプロンプトを通じて意図的にこのシグネチャを誘導するジェイルブレイク攻撃である。
論文 参考訳(メタデータ) (2026-05-24T11:35:12Z) - Selective Safety Steering via Value-Filtered Decoding [54.87935112120107]
大型言語モデル(LLM)は人間の価値観に合わせるように訓練されているが、その世代は安全上の制約に反する可能性がある。
既存のデコード時のステアリング手法は、しばしば不要に介入し、ベースモデルの下で安全であった世代を変更する。
安全でない応答の安全性を向上しつつ、そのような不要な介入を減らすための新しいテストタイムステアリング手法を提案する。
論文 参考訳(メタデータ) (2026-05-14T12:13:08Z) - Evaluating Prompt Injection Defenses for Educational LLM Tutors: Security-Usability-Latency Trade-offs [51.56484100374058]
ガードレールの設計には、敵の堅牢性、良質なタスクのユーザビリティ、応答レイテンシの明確なトレードオフが伴う。
決定論的パターンフィルタ,構造検証,コンテキストサンドボックス,セッションレベルの動作チェックを組み合わせた,ドメイン固有のマルチレイヤセーフガードパイプラインの評価を行った。
NeMoは16.22パーセントのFPRと1.5パーセントのレイテンシで0パーセントのバイパスに達し、Prompt Guardは38.48パーセントのFPRと3.60パーセントのバイパスを実現している。
論文 参考訳(メタデータ) (2026-03-29T18:52:01Z) - Safe Transformer: An Explicit Safety Bit For Interpretable And Controllable Alignment [41.47485992177247]
我々は,事前学習型言語モデルを拡張するモジュール型アプローチであるSafe Transformerを提案する。
安全ビットは、モデルの安全分類の解釈可能な信号と制御可能なスイッチの両方として機能する。
赤チームのベンチマークでは、Safe Transformerがほぼゼロのアタック成功率を達成する。
論文 参考訳(メタデータ) (2026-03-06T02:54:16Z) - Qwen3Guard Technical Report [127.69960525219051]
Qwen3Guardは、多言語安全ガードレールモデルである。
生成的Qwen3Guardは、きめ細かい三級判定を可能にする命令追従タスクとして安全分類をキャストする。
Stream Qwen3Guardは、リアルタイム安全監視のためのトークンレベルの分類ヘッドを導入している。
論文 参考訳(メタデータ) (2025-10-16T04:00:18Z) - Safe Vision-Language Models via Unsafe Weights Manipulation [75.04426753720551]
我々は、異なるレベルの粒度で安全性を評価する新しい指標セットであるSafe-Groundを導入し、安全性の評価を見直した。
我々は異なる方向を採り、トレーニングなしでモデルをより安全にできるかどうかを探り、Unsafe Weights Manipulation (UWM)を導入します。
UWMは、セーフとアンセーフのインスタンスのキャリブレーションセットを使用して、セーフとアンセーフのコンテンツのアクティベーションを比較し、後者を処理する上で最も重要なパラメータを特定する。
論文 参考訳(メタデータ) (2025-03-14T17:00:22Z) - SafetyAnalyst: Interpretable, Transparent, and Steerable Safety Moderation for AI Behavior [56.10557932893919]
我々は、新しいAI安全モデレーションフレームワークであるSafetyAnalystを紹介する。
AIの振る舞いを考えると、SafetyAnalystはチェーン・オブ・シークレット・推論を使用してその潜在的な結果を分析する。
効果を28個の完全に解釈可能な重みパラメータを使って有害度スコアに集約する。
論文 参考訳(メタデータ) (2024-10-22T03:38:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。