論文の概要: Efficient Safety Benchmarking via Item Response Theory
- arxiv url: http://arxiv.org/abs/2606.20626v1
- Date: Tue, 26 May 2026 17:35:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 23:06:05.667074
- Title: Efficient Safety Benchmarking via Item Response Theory
- Title(参考訳): 項目応答理論による安全ベンチマークの効率化
- Authors: Fabio Spagliardi, Mírian Silva, Ayan Datta, Aiden Zhou, Vamshi Bonagiri, Diogo Cruz,
- Abstract要約: 我々は、広く使用されている安全ベンチマークのスイートを分析し、より効率的な安全性評価に3つの貢献をする。
項目応答理論(IRT)は,モデル間の差異を解消する能力を推定し,安全性ベンチマーク上の解釈可能な構造を復元することを示した。
第2に、各モデルの応答に基づいて動的に情報的項目を選択する適応的項目選択が、全ベンチマークランキングを近似することを示す。
第3に、モデル間で再利用可能なアイテムの固定された情報サブセットを抽出する実用的な手順を導入し、適応的選択の代替手段を提供する。
- 参考スコア(独自算出の注目度): 0.4036506515685838
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Safety benchmarks for language models are typically evaluated using static paradigms that treat all items as equally informative for all models, an assumption that is particularly problematic for adversarial, highly heterogeneous safety items. Applied in full to modern benchmark suites, the current evaluation procedures would require on the order of $10^5$ responses, most of which provide little ranking signal. We analyze a suite of widely used safety benchmarks and make three contributions toward more efficient safety evaluation. First, we show that Item Response Theory (IRT) recovers interpretable structure on safety benchmarks, with ability estimates resolving differences among models that cluster at the ceiling of raw safety metrics. Second, we show that adaptive item selection, which dynamically chooses informative items for each model based on its responses, approximates full-benchmark rankings while reducing evaluation cost by at least 80% on benchmarks where Spearman's $ρ>$90% with full-benchmark is attainable, and by up to 99.9% on AIR-Bench 2024. Third, we introduce a practical procedure for extracting a fixed, informative subset of items reusable across models, providing an alternative to adaptive selection with savings of up to 99.8% on AIR-Bench 2024. Together, these results establish that psychometric methods enable benchmark-aware reductions in evaluation costs across the safety evaluation pipeline.
- Abstract(参考訳): 言語モデルの安全性ベンチマークは、通常、全ての項目を全てのモデルに対して等しく有益であるものとして扱う静的パラダイムを用いて評価される。
最新のベンチマークスイートに完全に適用した場合、現在の評価手順では10^5$のレスポンスが要求される。
我々は、広く使用されている安全ベンチマークのスイートを分析し、より効率的な安全性評価に3つの貢献をする。
まず, 品目応答理論(IRT)は, 安全基準の解釈可能な構造を復元し, 生の安全指標の天井に集結するモデル間の差を解消する能力の推定を行う。
第2に,各モデルの応答に基づいて情報項目を動的に選択する適応項目選択は,フルベンチマークランキングを近似し,スピアマンのフルベンチマークによる$ρ>$90%,AIR-Bench 2024での最大99.9%のベンチマークで評価コストを少なくとも80%削減することを示した。
第3に,AIR-Bench 2024 で最大 99.8% の節約が可能な適応選択の代替として,モデル間で再利用可能な固定情報サブセットを抽出する実用的な方法を提案する。
これらの結果から,安全性評価パイプライン全体の評価コストをベンチマーク対応で削減できることが確認された。
関連論文リスト
- Reliable to Expressive: A Curriculum for Rubric-Following Safety Judges [2.8523456804049885]
安全審査員は、進化する基準に対してモデルアウトプットを評価するためにますます配置される。
最近のメタ評価研究は、プロンプトとルーブリックの変動下では脆く保たれていることを示している。
本稿では,インスタンス条件の動的ルーブリックと,信頼性と表現性を備えたカリキュラムを組み合わせたトレーニング戦略を提案する。
論文 参考訳(メタデータ) (2026-06-08T08:02:57Z) - Taxonomy and Consistency Analysis of Safety Benchmarks for AI Agents [6.787194586338237]
エージェント安全ベンチマークを評価機器として用いた最初の系統解析を行った。
カバレッジマトリックスは、幅広いリスクカバレッジを示すが、方法論的な収束は限定的である一方で、分類学的分析では、サンドボックス、制約付き、しばしば安全のみの評価に集中した行動的ベンチマークコアが示される。
ランドスケープ全体では、ベンチマークの選択は矛盾する安全性の結論を導き、カバレッジカウントはしばしばオーバーステート評価の深さ、環境忠実度形状が報告される安全性、フィールドがエージェント内部リスクよりも外部に不均等に課せられること、メートル法フラグメンテーション制限の比較、そして効果的に不当なままである。
論文 参考訳(メタデータ) (2026-04-11T04:25:19Z) - When Prompt Optimization Becomes Jailbreaking: Adaptive Red-Teaming of Large Language Models [1.5049442691806052]
大規模言語モデル (LLMs) は、ハイテイクなアプリケーションにますます統合されている。
既存の安全性評価は、非適応的な敵を暗黙的に仮定して、有害なプロンプトの固定されたコレクションに依存している。
本研究では,現代言語モデルの脆弱性を,自動的,対角的,即時的な改善のために検討する。
論文 参考訳(メタデータ) (2026-02-21T05:35:26Z) - ReLE: A Scalable System and Structured Benchmark for Diagnosing Capability Anisotropy in Chinese LLMs [37.23311145049677]
本稿では,機能異方性(Capability Anisotropy)を診断するためのスケーラブルなシステムであるReLEを提案する。
我々は,207,843サンプルからなる領域$times$ Capability SymbolicMatrixの304モデルを評価した。
論文 参考訳(メタデータ) (2026-01-24T09:57:59Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z) - Fantastic Bugs and Where to Find Them in AI Benchmarks [28.604919035475188]
本稿では, 応答パターンの統計的解析を利用して, 潜在的に無効な質問にフラグを付ける手法を提案する。
我々のアプローチは、平均スコアがモデル性能を十分に要約する、AI評価で一般的に使用されるコア仮定に基づいています。
提案手法は,9つの広く使用されているベンチマークにおいて,最大84%の精度で問題のある問題を特定するために専門家のレビューをガイドする。
論文 参考訳(メタデータ) (2025-11-20T22:49:21Z) - Advancing Embodied Agent Security: From Safety Benchmarks to Input Moderation [52.83870601473094]
エンボディード・エージェントは、複数のドメインにまたがって大きな潜在能力を示す。
既存の研究は主に、一般的な大言語モデルのセキュリティに重点を置いている。
本稿では, エンボディエージェントの保護を目的とした新しい入力モデレーションフレームワークを提案する。
論文 参考訳(メタデータ) (2025-04-22T08:34:35Z) - ASSERT: Automated Safety Scenario Red Teaming for Evaluating the
Robustness of Large Language Models [65.79770974145983]
ASSERT、Automated Safety Scenario Red Teamingは、セマンティックなアグリゲーション、ターゲットブートストラップ、敵の知識注入という3つの方法で構成されている。
このプロンプトを4つの安全領域に分割し、ドメインがモデルの性能にどのように影響するかを詳細に分析する。
統計的に有意な性能差は, 意味的関連シナリオにおける絶対分類精度が最大11%, ゼロショット逆数設定では最大19%の絶対誤差率であることがわかった。
論文 参考訳(メタデータ) (2023-10-14T17:10:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。