論文の概要: SSP-Bench: A Hybrid Data Generation Framework for Safety, Security, and Privacy Evaluation
- arxiv url: http://arxiv.org/abs/2609.25352v1
- Date: Mon, 21 Sep 2026 19:44:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.092985
- Title: SSP-Bench: A Hybrid Data Generation Framework for Safety, Security, and Privacy Evaluation
- Title(参考訳): SSP-Bench: 安全性、セキュリティ、プライバシ評価のためのハイブリッドデータ生成フレームワーク
- Abstract要約: SSP-Benchは、大規模言語モデルのための動的ベンチマークフレームワークである。
ドメインの一貫性を維持しながら、オンデマンドで評価インスタンスを生成する。
24モデルと4つのSSPサービスにわたる静的評価の体系的な失敗を明らかにする。
- 参考スコア(独自算出の注目度): 6.907956420499119
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Evaluation of large language models (LLMs) for safety, security, and privacy (SSP) relies heavily on static benchmarks, which suffer from score saturation, data contamination, and aggregation artifacts, and fail to capture sensitivity to linguistic variation. As a result, models that perform well on fixed test sets often fail under semantically equivalent rephrasings. We introduce SSP-Bench, a dynamic benchmarking framework that generates evaluation instances on demand while preserving domain consistency. The framework ensures label validity through externally grounded sources, enforces scope via service-specific validation, and calibrates difficulty using a multi-model steering panel. Benchmark construction is formulated as a multi-objective optimization problem over difficulty, separability, novelty, and diversity. Across 24 models and four SSP services, SSP-Bench reveals systematic failures of static evaluation, including near-zero correlation in safety rankings due to construct mixing, strong safety--over-refusal coupling, and hidden within-family regressions. These results show that static benchmarks can misrepresent model behavior, motivating dynamic, deployment-relevant evaluation.
- Abstract(参考訳): 安全性、セキュリティ、プライバシ(SSP)のための大規模言語モデル(LLM)の評価は静的ベンチマークに大きく依存しており、スコア飽和、データ汚染、アグリゲーションアーティファクトに悩まされ、言語的変動に対する感受性を捉えられなかった。
その結果、固定テストセットでうまく機能するモデルは、意味論的に等価な言い換えで失敗することが多い。
SSP-Benchは、ドメインの一貫性を維持しながら、オンデマンドで評価インスタンスを生成する動的ベンチマークフレームワークである。
このフレームワークは、外部の接地されたソースを通じてラベルの有効性を保証し、サービス固有のバリデーションを通じてスコープを強制し、マルチモデルステアリングパネルを使用して困難を校正する。
ベンチマーク構成は、難易度、分離性、新規性、多様性に対する多目的最適化問題として定式化されている。
24モデルと4つのSSPサービスにわたって、SSP-Benchは、構成混合による安全性ランキングのほぼゼロの相関、強い安全性-オーバー・リファレンス結合、家族内回帰などの静的評価の体系的失敗を明らかにしている。
これらの結果から,静的ベンチマークはモデル動作を誤表現し,動的かつデプロイメント関連評価を動機付けることが示唆された。
関連論文リスト
- StabilityBench: Benchmarking Instability in LLMs [5.633712097504611]
本論文では,シングルターンベンチマークをマルチターンインタラクション履歴に変換するベンチマーク演算子であるStable Benchを提案する。
本研究では, 数学的推論, 健康質問応答, 安全性の4つのベンチマークに適用し, 9つの大言語モデルを評価する。
以上の結果から,これらのインジェクションのモデル性能は安定的に不安定であり,4つのベンチマークのうち3つに対してかなりの性能劣化が認められた。
論文 参考訳(メタデータ) (2026-07-17T16:09:37Z) - Navigating the Sea of LLM Evaluation: Investigating Bias in Toxicity Benchmarks [0.36748639131154315]
本研究は、確立されたベンチマーク設定の堅牢性を調査し、本質的なバイアスを測定する方法を検討する。
本実験では,評価設定が変更された場合のベンチマーク動作に有意な差がみられた。
モデル固有の不安定性を観察し、より堅牢で包括的な安全性評価フレームワークの必要性を明確に示す。
論文 参考訳(メタデータ) (2026-05-11T14:27:39Z) - SAIF: A Stability-Aware Inference Framework for Medical Image Segmentation with Segment Anything Model [11.410993498576936]
Segment Anything Model (SAM)は、スケーラブルな医療画像セグメンテーションを可能にするが、フリーズバックボーンとしてデプロイされた場合、推論時の不安定さに悩まされる。
本研究では,プロンプトとしきい値の不確実性を明示的にモデル化し,ロバスト性を向上させるためのトレーニングフリーかつプラグアンドプレイ型推論フレームワークであるStable-Aware Inference Framework (SAIF)を提案する。
論文 参考訳(メタデータ) (2026-03-13T19:15:34Z) - Evaluating LLM Safety Under Repeated Inference via Accelerated Prompt Stress Testing [0.0]
信頼性工学にインスパイアされた深度指向評価フレームワークであるAPST(Accelerated Prompt Stress Testing)を紹介する。
APSTは、制御された運用条件下で同じプロンプトを繰り返しサンプリングし、遅延故障モードを発生させる。
同様のベンチマークアライメントスコアを持つモデルでは,繰り返しサンプリングを行うと,経験的失敗率が大きく異なることが判明した。
論文 参考訳(メタデータ) (2026-02-12T10:09:13Z) - AgentNoiseBench: Benchmarking Robustness of Tool-Using LLM Agents Under Noisy Condition [72.24180896265192]
本稿では,騒音環境下でのエージェントモデルのロバスト性を評価するためのフレームワークであるAgentNoiseBenchを紹介する。
まず、実世界のシナリオにおけるバイアスと不確実性の詳細な分析を行う。
次に,環境騒音をユーザノイズとツールノイズの2つの主要なタイプに分類する。
この分析に基づいて,既存のエージェント中心ベンチマークに制御可能なノイズを注入する自動パイプラインを開発した。
論文 参考訳(メタデータ) (2026-02-11T20:33:10Z) - Not All Preferences Are Created Equal: Stability-Aware and Gradient-Efficient Alignment for Reasoning Models [52.48582333951919]
ポリシー更新の信号対雑音比を最大化することにより、アライメントの信頼性を高めるために設計された動的フレームワークを提案する。
SAGE(Stability-Aware Gradient Efficiency)は、モデル能力に基づいて候補プールをリフレッシュする粗いきめ細かいカリキュラムメカニズムを統合する。
複数の数学的推論ベンチマークの実験により、SAGEは収束を著しく加速し、静的ベースラインを上回っていることが示された。
論文 参考訳(メタデータ) (2026-02-01T12:56:10Z) - Adaptive Dual-Weighting Framework for Federated Learning via Out-of-Distribution Detection [53.45696787935487]
Federated Learning (FL)は、大規模分散サービスノード間の協調的なモデルトレーニングを可能にする。
実世界のサービス指向デプロイメントでは、異種ユーザ、デバイス、アプリケーションシナリオによって生成されたデータは本質的にIIDではない。
FLoodは、オフ・オブ・ディストリビューション(OOD)検出にインスパイアされた新しいFLフレームワークである。
論文 参考訳(メタデータ) (2026-02-01T05:54:59Z) - SVeritas: Benchmark for Robust Speaker Verification under Diverse Conditions [54.34001921326444]
話者検証(SV)モデルは、セキュリティ、パーソナライゼーション、アクセス制御システムにますます統合されている。
既存のベンチマークでは、これらの条件のサブセットのみを評価しており、他は完全に欠落している。
SVeritasは、録音時間、自発性、コンテンツ、ノイズ、マイクロホン距離、残響、チャンネルミスマッチ、オーディオ帯域幅、コーデック、話者年齢、スプーフィングおよび敵攻撃に対する感受性などのストレス下でのSVシステムの評価を行う総合的な話者検証タスクベンチマークスイートである。
論文 参考訳(メタデータ) (2025-09-21T14:11:16Z) - Prompt Stability in Code LLMs: Measuring Sensitivity across Emotion- and Personality-Driven Variations [40.12950482269347]
本稿では,感情テンプレートと人格テンプレートを用いた意味論的に等価なプロンプト変種を生成するフレームワークであるPromptSEを提案する。
本研究は、性能と安定性が、主に分離された最適化目標として振る舞うことを示す。
PromptSEは、デプロイとモデル選択のためのパフォーマンス安定性トレードオフの定量化を可能にする。
論文 参考訳(メタデータ) (2025-09-17T04:17:42Z) - SeCodePLT: A Unified Platform for Evaluating the Security of Code GenAI [58.29510889419971]
コード生成大型言語モデル(LLM)のセキュリティリスクと能力を評価するための既存のベンチマークは、いくつかの重要な制限に直面している。
手動で検証し、高品質なシード例から始める、汎用的でスケーラブルなベンチマーク構築フレームワークを導入し、ターゲット突然変異を通じて拡張する。
このフレームワークをPython、C/C++、Javaに適用すると、44のCWEベースのリスクカテゴリと3つのセキュリティ機能にまたがる5.9k以上のサンプルデータセットであるSeCodePLTが構築されます。
論文 参考訳(メタデータ) (2024-10-14T21:17:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。