論文の概要: Item Response Theory for AI Safety
- arxiv url: http://arxiv.org/abs/2608.05086v1
- Date: Wed, 05 Aug 2026 17:25:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:44.046013
- Title: Item Response Theory for AI Safety
- Title(参考訳): AI安全のための項目応答理論
- Authors: Joshua Fonseca Rivera, Neil Shah, David Demitri Africa, Konstantinos Voudouris,
- Abstract要約: アイテム反応理論 (IRT) は、心理測定値が推定された項目のパフォーマンスから潜伏者を測定する統計ツールキットである。
IRTは安全ベンチマークを読み、減らし、監査するための既製のツールキットです。
- 参考スコア(独自算出の注目度): 23.16156306184828
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Language models differ in how safely they behave and these differences are measured by safety benchmarks. But aggregated benchmark scores are hard to trust and interpret, because benchmarks duplicate one another, correlate heavily, and models may sandbag when they detect evaluation. To address these issues, we draw on Item Response Theory (IRT), a statistical toolkit for measuring these latents from performance on items with inferred psychometric properties. We fit IRT models to eight safety benchmarks across 192 language models, the largest psychometric analysis of LLM safety evaluations to date, and contribute three results. First, we find that three interpretable factors of refusal strictness, truthfulness, and contextual harm explain most of the variance between models across benchmarks. Second, psychometrically selected items recover full benchmark scores with lower error than random subsets of the same size, and roughly ten adaptively chosen items suffice for several individual benchmarks, cutting evaluation cost by 97-99%. Third, IRT supports audits of individual models, showing that it can be used to detect naive sandbagging and changes of model behind APIs. Overall, we show IRT is a ready-made toolkit for reading, reducing, and auditing safety benchmarks, which we recommend frontier labs and evaluators adopt.
- Abstract(参考訳): 言語モデルは、それらがいかに安全に振る舞うかによって異なり、これらの違いは安全ベンチマークによって測定される。
しかし、集約されたベンチマークスコアは信頼と解釈が難しい。ベンチマークは互いに重複し、相関が強く、モデルが評価を検出するとサンドバッグになる可能性があるからだ。
これらの問題に対処するために,評価された心理測定特性を持つ項目のパフォーマンスから,これらの潜伏者を測定する統計ツールキットであるIRT(Item Response Theory)を参考にしている。
IRTモデルを192言語モデルの8つの安全性ベンチマークに適合させる。
まず、厳密性、真理性、文脈的調和の3つの解釈可能な要因が、ベンチマーク間でのモデルのばらつきの大半を説明する。
第2に、心理学的に選択された項目は、同じサイズのランダムなサブセットよりも低いエラーで完全なベンチマークスコアを回復し、複数のベンチマークで約10項目が適応的に選択され、評価コストが97~99%削減された。
第三に、IRTは個々のモデルの監査をサポートしており、APIの背後にある単純なサンドバッグやモデルの変更を検出するために使用することができる。
全体として、IRTは安全ベンチマークを読み、減らし、監査するための既製のツールキットであり、フロンティア研究所や評価機関が採用することを推奨する。
関連論文リスト
- Can We Trust Item Response Theory for AI Evaluation? [10.509963423246974]
AIベンチマークは、アイテムレベルの統計モデルを活用して、能力の推定、ランクシステム、情報的サンプルの選択、ベンチマーク品質の診断を行う。
IRTツールは当初、人間のテスト用に開発されたが、AIベンチマークには、スキューやクラスタ化、マルチモーダルといった、より少ないモデル、はるかに多くのアイテム、能力分布が含まれることが多い。
本研究では、これらの制度が、AI評価のためのIRTモデリングの信頼性にどのように不適合しているかを検討する。
論文 参考訳(メタデータ) (2026-07-16T16:44:40Z) - Efficient Safety Benchmarking via Item Response Theory [0.4036506515685838]
我々は、広く使用されている安全ベンチマークのスイートを分析し、より効率的な安全性評価に3つの貢献をする。
項目応答理論(IRT)は,モデル間の差異を解消する能力を推定し,安全性ベンチマーク上の解釈可能な構造を復元することを示した。
第2に、各モデルの応答に基づいて動的に情報的項目を選択する適応的項目選択が、全ベンチマークランキングを近似することを示す。
第3に、モデル間で再利用可能なアイテムの固定された情報サブセットを抽出する実用的な手順を導入し、適応的選択の代替手段を提供する。
論文 参考訳(メタデータ) (2026-05-26T17:35:31Z) - BenchBench: Benchmarking Automated Benchmark Generation [10.44497524694021]
BenchBenchは、自動ベンチマーク生成をベンチマークするためのパイプラインとデータセットである。
我々は16.7Kアイテムを生成し、15Kコアアイテムをポストフィルタに保持し、152Kグレードのモデル-イテム応答を生成する。
論文 参考訳(メタデータ) (2026-03-21T13:05:32Z) - When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation [80.66788281323414]
主要モデル開発者のテクニカルレポートから選択した60のLarge Language Model (LLM)ベンチマークのベンチマーク飽和を分析した。
分析の結果、ベンチマークのほぼ半数が飽和しており、ベンチマークの年齢とともに上昇していることがわかった。
専門家によるベンチマークは、クラウドソースのベンチマークよりも飽和に抵抗する。
論文 参考訳(メタデータ) (2026-02-18T16:51:37Z) - Benchmark^2: Systematic Evaluation of LLM Benchmarks [66.2731798872668]
3つの相補的なメトリクスからなる包括的なフレームワークであるBenchmark2を提案する。
数学、推論、知識ドメインにまたがる15のベンチマークで実験を行います。
本分析により,既存のベンチマーク間での有意な品質変化が明らかとなり,選択的なベンチマーク構築が同等な評価性能を達成できることが示されている。
論文 参考訳(メタデータ) (2026-01-07T14:59:03Z) - Fantastic Bugs and Where to Find Them in AI Benchmarks [28.604919035475188]
本稿では, 応答パターンの統計的解析を利用して, 潜在的に無効な質問にフラグを付ける手法を提案する。
我々のアプローチは、平均スコアがモデル性能を十分に要約する、AI評価で一般的に使用されるコア仮定に基づいています。
提案手法は,9つの広く使用されているベンチマークにおいて,最大84%の精度で問題のある問題を特定するために専門家のレビューをガイドする。
論文 参考訳(メタデータ) (2025-11-20T22:49:21Z) - Fluid Language Model Benchmarking [126.92394365620525]
我々は,複数の次元にわたるLMベンチマークを進展させる新しい評価手法であるFluid Benchmarkingを紹介する。
サイコメトリックスにインスパイアされたFluid Benchmarkingは、ベンチマーク項目の相対値がLMの能力レベルに依存するという洞察に基づいている。
効率性,妥当性,分散性,飽和性の4つの次元を検証した結果,Fluid Benchmarkingがすべてにおいて優れた性能を発揮することがわかった。
論文 参考訳(メタデータ) (2025-09-14T05:49:42Z) - Do Large Language Model Benchmarks Test Reliability? [66.1783478365998]
モデル信頼性の定量化について検討する。
信頼性評価におけるこのギャップにより、我々はいわゆるプラチナベンチマークの概念を提案する。
我々は、これらのプラチナベンチマークにおいて、幅広いモデルを評価し、実際、フロンティアLSMは、単純なタスクで失敗を示す。
論文 参考訳(メタデータ) (2025-02-05T18:58:19Z) - SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal [64.9938658716425]
SORRY-Benchは、安全でないユーザ要求を認識し拒否する大規模言語モデル(LLM)能力を評価するためのベンチマークである。
まず、既存の手法では、安全でないトピックの粗い分類を使い、いくつかのきめ細かいトピックを過剰に表現している。
第二に、プロンプトの言語的特徴とフォーマッティングは、様々な言語、方言など、多くの評価において暗黙的にのみ考慮されているように、しばしば見過ごされる。
論文 参考訳(メタデータ) (2024-06-20T17:56:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。