論文の概要: Swiss-Bench 003: Evaluating LLM Reliability and Adversarial Security for Swiss Regulatory Contexts
- arxiv url: http://arxiv.org/abs/2604.05872v1
- Date: Tue, 07 Apr 2026 13:29:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.858293
- Title: Swiss-Bench 003: Evaluating LLM Reliability and Adversarial Security for Swiss Regulatory Contexts
- Title(参考訳): スイス・ベンチ003:スイス規制文脈におけるLLMの信頼性と対抗的セキュリティの評価
- Authors: Fatih Uenal,
- Abstract要約: 本稿では,D7とD8を加えてHAAS(Helvetic AI Assessment Score)を6次元から8次元に拡張したSwiss-Bench 003(SBP-003)を紹介する。
私は4つの言語で808のスイス特化アイテムに対して10のフロンティアモデルを評価します。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: The deployment of large language models (LLMs) in Swiss financial and regulatory contexts demands empirical evidence of both production reliability and adversarial security, dimensions not jointly operationalized in existing Swiss-focused evaluation frameworks. This paper introduces Swiss-Bench 003 (SBP-003), extending the HAAS (Helvetic AI Assessment Score) from six to eight dimensions by adding D7 (Self-Graded Reliability Proxy) and D8 (Adversarial Security). I evaluate ten frontier models across 808 Swiss-specific items in four languages (German, French, Italian, English), comprising seven Swiss-adapted benchmarks (Swiss TruthfulQA, Swiss IFEval, Swiss SimpleQA, Swiss NIAH, Swiss PII-Scope, System Prompt Leakage, and Swiss German Comprehension) targeting FINMA Guidance 08/2024, the revised Federal Act on Data Protection (nDSG), and OWASP Top 10 for LLMs. Self-graded D7 scores (73-94%) exceed externally judged D8 security scores (20-61%) by a wide margin, though these dimensions use non-comparable scoring regimes. System prompt leakage resistance ranges from 24.8% to 88.2%, while PII extraction defense remains weak (14-42%) across all models. Qwen 3.5 Plus achieves the highest self-graded D7 score (94.4%), while GPT-oss 120B achieves the highest D8 score (60.7%) despite being the lowest-cost model evaluated. All evaluations are zero-shot under provider default settings; D7 is self-graded and does not constitute independently validated accuracy. I provide conceptual mapping tables relating benchmark dimensions to FINMA model validation requirements, nDSG data protection obligations, and OWASP LLM risk categories.
- Abstract(参考訳): スイスの金融および規制の文脈における大規模言語モデル(LLMs)の展開は、既存のスイスに焦点を当てた評価フレームワークで共同で運用されていない、生産の信頼性と敵のセキュリティの両方の実証的な証拠を要求する。
本稿では,D7(Self-Graded Reliability Proxy)とD8(Adversarial Security)を追加することにより,HAAS(Helvetic AI Assessment Score)を6次元から8次元に拡張するスイス・ベンチ003(SBP-003)を提案する。
Swiss TruthfulQA、Swiss IFEval、Swiss SimpleQA、Swiss NIAH、Swiss PII-Scope、System Prompt Leakage、Swiss German Comprehension)、FINMA Guidance 08/2024、改訂されたデータ保護に関する連邦法(nDSG)、LLMのOWASP Top 10を含む4つの言語(ドイツ語、フランス語、イタリア語、英語)で、808のスイス固有の項目を対象とした10のフロンティアモデルを評価します。
自己評価のD7スコア(73-94%)は、外部で判定されたD8セキュリティスコア(20-61%)よりも広いマージンで高いが、これらのディメンションは非比較可能なスコアレギュレーションを使用する。
システム・プロンプト・リーク抵抗は24.8%から88.2%の範囲で、PII抽出防御は全モデルで14-42%である。
Qwen 3.5 Plusは最高自己階調D7スコア(94.4%)、GPT-oss 120Bは最低コストモデルであるにもかかわらず最高D8スコア(60.7%)を達成している。
すべての評価は、プロバイダのデフォルト設定下でゼロショットであり、D7は自己グレードされ、独立して検証された精度を構成しない。
本稿では,ベンチマーク次元をFINMAモデル検証要件,nDSGデータ保護義務,OWASP LLMリスクカテゴリに関連付ける概念マッピングテーブルを提案する。
関連論文リスト
- SecPI: Secure Code Generation with Reasoning Models via Security Reasoning Internalization [50.71047638695205]
RLM(Reasoning Language Model)は、プログラミングにおいてますます使われている言語モデルである。
しかし、最先端のRLMでさえ、生成されたコードに重大なセキュリティ脆弱性を頻繁に導入する。
我々は、構造化されたセキュリティ推論を内部化するためのRTMを教える微調整パイプラインであるSecPIを提案する。
論文 参考訳(メタデータ) (2026-04-04T04:29:11Z) - Seclens: Role-specific Evaluation of LLM's for security vulnerablity detection [0.0]
SecLens-Rは、35の共有次元を7つの測定カテゴリに分けて構成するマルチステークホルダー評価フレームワークである。
93のオープンソースプロジェクトから派生した406タスクのデータセット上で,SecLens-Rを用いて12のフロンティアモデルを評価する。
結果は、利害関係者の視点でかなりの変動を示し、決定スコアは同じモデルで最大31ポイント異なる。
論文 参考訳(メタデータ) (2026-04-02T05:25:50Z) - Swiss-Bench SBP-002: A Frontier Model Comparison on Swiss Legal and Regulatory Tasks [0.0]
既存のベンチマークでは、適用されたスイスの規制タスクにおけるフロンティアモデルのパフォーマンスを評価していない。
スイス・ベンチ(Swiss-Bench)は、スイスの3つの規制ドメインにまたがる395のエキスパート工芸品のトリンガルベンチマークである。
私は、構造化された3次元スコアリングフレームワークを使用して、2026年3月からの10つのフロンティアモデルを評価します。
論文 参考訳(メタデータ) (2026-03-24T18:41:07Z) - OOD-MMSafe: Advancing MLLM Safety from Harmful Intent to Hidden Consequences [64.01706941950489]
現在の安全パラダイムは、主に悪意のある意図や状況違反をターゲットとしている。
我々は,自律型および実施型エージェントのロバスト展開に不可欠なパラダイムである,結果駆動型安全に向けた安全フロンティアのシフトを提案する。
本稿では,トークンレベルの自己蒸留報酬の動的参照として,モデル固有の推論を統合したCASPO(Consequence-Aware Safety Policy Optimization)フレームワークを開発する。
論文 参考訳(メタデータ) (2026-03-10T14:16:43Z) - A Safety Report on GPT-5.2, Gemini 3 Pro, Qwen3-VL, Grok 4.1 Fast, Nano Banana Pro, and Seedream 4.5 [101.4233736714284]
大規模言語モデル(LLM)とマルチモーダル大規模言語モデル(MLLM)は、言語とビジョンをまたいだ推論、認識、生成において大きな進歩をもたらした。
GPT-5.2, Gemini 3 Pro, Qwen3-VL, Grok 4.1 Fast, Nano Banana Pro, Seedream 4.5-assesing each across language, vision- language and image generation。
論文 参考訳(メタデータ) (2026-01-15T15:52:52Z) - OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models [54.80460603255789]
マルチモーダル時代に設計された,最も包括的なコンテンツ安全性評価テストスイートであるOutSafe-Benchを紹介する。
OutSafe-Benchには、4つのモダリティにまたがる大規模なデータセットが含まれており、18,000以上のバイリンガル(中国語と英語)テキストプロンプト、4500のイメージ、450のオーディオクリップ、450のビデオが9つの重要なコンテンツリスクカテゴリで体系的に注釈付けされている。
このデータセットに加えて,多次元クロスリスクスコア(Multidimensional Cross Risk Score, MCRS)も導入した。
論文 参考訳(メタデータ) (2025-11-13T13:18:27Z) - When Code Crosses Borders: A Security-Centric Evaluation of LLM-based Code Translation [19.602248745676544]
既存の評価は、主に機能レベルでの統語的または機能的正当性に注目し、セキュリティの重要な次元を無視している。
LLMに基づくコード翻訳のセキュリティへの影響を評価するために設計された最初のデータセットであるSTEDを構築した。
5つのプログラミング言語にまたがる720のセキュリティ関連コードサンプルと、CVE/NVDから派生した9つの高インパクトCWEカテゴリで構成されている。
論文 参考訳(メタデータ) (2025-09-08T10:08:48Z) - INSEva: A Comprehensive Chinese Benchmark for Large Language Models in Insurance [48.22571187209047]
INSEvaは、保険におけるAIシステムの知識と能力を評価するために設計された中国のベンチマークである。
INSEvaは、ビジネス領域、タスクフォーマット、難易度、認知知識次元をカバーする多次元評価分類を特徴としている。
本ベンチマークでは,オープンエンド応答における忠実度と完全度の両方を評価するための調整された評価手法を実装した。
論文 参考訳(メタデータ) (2025-08-27T03:13:40Z) - SafeLawBench: Towards Safe Alignment of Large Language Models [18.035407356604832]
大きな言語モデル(LLM)の安全性を評価するための明確な基準が欠如している。
SafeLawBenchは、法的基準に基づいて、安全リスクを3つのレベルに分類する。
24,860のマルチチョイス質問と1,106のオープンドメイン質問回答(QA)タスクで構成されている。
論文 参考訳(メタデータ) (2025-06-07T03:09:59Z) - SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models [107.82336341926134]
SALAD-Benchは、大規模言語モデル(LLM)を評価するために特別に設計された安全ベンチマークである。
それは、その大規模な、豊富な多様性、三つのレベルにまたがる複雑な分類、多目的機能を通じて、従来のベンチマークを超越している。
論文 参考訳(メタデータ) (2024-02-07T17:33:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。