論文の概要: Benchmark Scores Are Pipeline-Dependent: A Reliability Audit of Cybersecurity LLM Benchmarks
- arxiv url: http://arxiv.org/abs/2609.08765v1
- Date: Tue, 08 Sep 2026 14:01:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.673725
- Title: Benchmark Scores Are Pipeline-Dependent: A Reliability Audit of Cybersecurity LLM Benchmarks
- Title(参考訳): ベンチマークスコアはパイプラインに依存している - サイバーセキュリティLLMベンチマークの信頼性監査
- Abstract要約: 大規模言語モデル(LLM)ベンチマークはしばしば安定したスコアを持つ固定データセットとして扱われる。
当社は、プロプライエタリでオープンウェイト、およびサイバーセキュリティ専門のLLMを対象とした8つのサイバーセキュリティベンチマークを監査します。
単一のパイプライン選択は、モデルのスコアを80パーセント以上変更することができる。
- 参考スコア(独自算出の注目度): 0.8149698201875037
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model (LLM) benchmarks are often treated as fixed datasets with stable scores, yet their outcomes depend on configurable evaluation pipelines. We audit eight cybersecurity benchmarks across 10 proprietary, open-weight, and cybersecurity-specialized LLMs. By modeling benchmarks as measurement pipelines, we identify 15 systematic failure modes and show that a single pipeline choice can change a model's score by more than 80 percentage points and substantially alter model rankings. At the cross-benchmark level, two semantically similar task pairs rank the same models differently because of incompatible evaluation conventions. Under an evaluation harness that standardizes pipeline choices while preserving task semantics, nine of 10 models shift by at least three ranks on at least one benchmark. These results show that cybersecurity LLM benchmark scores are pipeline-dependent and motivate pipeline-aware auditing as a core requirement for reliable model evaluation.
- Abstract(参考訳): 大規模言語モデル(LLM)ベンチマークは、安定スコアを持つ固定データセットとして扱われることが多いが、その結果は設定可能な評価パイプラインに依存している。
当社は、プロプライエタリでオープンウェイト、およびサイバーセキュリティ専門のLLMを対象とした8つのサイバーセキュリティベンチマークを監査します。
ベンチマークを測定パイプラインとしてモデル化することにより、15の系統的な障害モードを特定し、単一のパイプライン選択によって80パーセント以上のスコアが変更され、モデルランキングが大幅に変更されたことを示す。
クロスベンチマークレベルでは、2つの意味論的に類似したタスクペアが、互換性のない評価規則のため、同じモデルを異なるランク付けする。
タスクのセマンティクスを維持しながらパイプラインの選択を標準化する評価ハーネスの下で、少なくとも1つのベンチマークで10モデルのうち9モデルが3つずつシフトする。
これらの結果から,LLMベンチマークスコアはパイプラインに依存し,信頼性モデル評価のコア要件としてパイプライン対応監査を動機付けていることがわかった。
関連論文リスト
- The Double Measurement Confound in Agent Benchmarks: De-Scaffolding, Ground-Truth Scoring, and Reliability Beyond the Mean [2.822987192839875]
エージェントベンチマークは、大規模言語モデル(LLM)の比較やデプロイメント決定のガイドにますます使用されている。
実行クリティカルな決定はモデルの代わりに固定された足場によって行われ、スコアラはタスクの正しさを反映しない基準を用いて出力を評価する。
ベンチマークスコアをモデル能力の証拠として解釈できる場合に特徴付ける測定理論の枠組みでこれらの問題を統一する。
論文 参考訳(メタデータ) (2026-09-06T21:23:11Z) - Item Response Theory for AI Safety [23.16156306184828]
アイテム反応理論 (IRT) は、心理測定値が推定された項目のパフォーマンスから潜伏者を測定する統計ツールキットである。
IRTは安全ベンチマークを読み、減らし、監査するための既製のツールキットです。
論文 参考訳(メタデータ) (2026-08-05T17:25:27Z) - Latent Performance Profiling of Large Language Models [47.009623327601226]
隠れたアクティベーションと出力分布からタスクに依存しない診断を導出するフレームワークであるLatent Performance Profiling(LPP)を紹介する。
静的精度スコアとは異なり、LPPは同様のサイズのモデル間で安定でアーキテクチャに敏感なシグネチャを提供する。
類似のベンチマークスコアを持つモデルは、エントロピーや適応性の違いなど、対照的なプロファイルを示すことができることを示す。
論文 参考訳(メタデータ) (2026-05-28T14:41:26Z) - A Unified Framework for the Evaluation of LLM Agentic Capabilities [36.43241368835721]
LLMエージェント能力の公平な評価のための統一的なフレームワークを提案する。
統合された構成システムによって駆動されるこのフレームワークは、様々なベンチマークを標準化された命令-ツール-環境フォーマットに統合する。
我々は15モデルで400Kロールアウトと5Bトークンに対して大規模な実証分析を行う。
論文 参考訳(メタデータ) (2026-05-27T03:20:45Z) - PARM: Pipeline-Adapted Reward Model [60.769414637325326]
リワードモデル(RM)は、大規模言語モデル(LLM)を人間の好みと整合させることの中心であり、高度な復号化戦略を推進している。
これまでの作業はシングルステップ生成に重点を置いていたが、現実のアプリケーションはますますマルチステージパイプラインを採用するようになっている。
我々は、最適化のためのコード生成を通じてこれを調査し、報酬モデルを定式化とソリューション段階の両方に統合するパイプラインを構築する。
論文 参考訳(メタデータ) (2026-04-20T14:29:08Z) - BenchBench: Benchmarking Automated Benchmark Generation [10.44497524694021]
BenchBenchは、自動ベンチマーク生成をベンチマークするためのパイプラインとデータセットである。
我々は16.7Kアイテムを生成し、15Kコアアイテムをポストフィルタに保持し、152Kグレードのモデル-イテム応答を生成する。
論文 参考訳(メタデータ) (2026-03-21T13:05:32Z) - IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation [85.56193980646981]
命令追従のための総合的メタ評価ベンチマークであるIF-RewardBenchを提案する。
各命令に対して、複数の応答間の全てのペアの選好を含む選好グラフを構築する。
IF-RewardBenchの実験は、現在の審査モデルに重大な欠陥を呈している。
論文 参考訳(メタデータ) (2026-03-05T02:21:17Z) - DEP: A Decentralized Large Language Model Evaluation Protocol [51.3646001384887]
分散評価プロトコル(Decentralized Evaluation Protocol, DEP)は、分散化されているが統一され、標準化された評価フレームワークである。
ユーザ、LLM、ベンチマークを分離することで、DEPはモジュラー、プラグ・アンド・プレイの評価を可能にする。
我々は,ブレークポイントの再開,同時要求,混雑制御などの機能をサポートするプロトコル互換ツールキットであるDEP Toolkitを開発した。
論文 参考訳(メタデータ) (2026-03-01T16:10:16Z) - Benchmark^2: Systematic Evaluation of LLM Benchmarks [66.2731798872668]
3つの相補的なメトリクスからなる包括的なフレームワークであるBenchmark2を提案する。
数学、推論、知識ドメインにまたがる15のベンチマークで実験を行います。
本分析により,既存のベンチマーク間での有意な品質変化が明らかとなり,選択的なベンチマーク構築が同等な評価性能を達成できることが示されている。
論文 参考訳(メタデータ) (2026-01-07T14:59:03Z) - Structured Prompting Enables More Robust Evaluation of Language Models [38.53918044830268]
DSPy+HELMフレームワークを提案する。
構造化されたプロンプトがなければ、HELMはLM性能(平均4%)を過小評価し、性能評価はベンチマークによって異なることがわかった。
これは、構造化されたプロンプトを確立された評価フレームワークに体系的に統合する最初のベンチマーク研究である。
論文 参考訳(メタデータ) (2025-11-25T20:37:59Z) - LLMs as Factual Reasoners: Insights from Existing Benchmarks and Beyond [135.8013388183257]
そこで我々は,SummEditsと呼ばれる10ドメインのベンチマークで不整合検出ベンチマークを作成し,実装する新しいプロトコルを提案する。
ほとんどのLLMはSummEditsで苦労しており、パフォーマンスはランダムに近い。
最も優れたモデルであるGPT-4は、推定された人間のパフォーマンスよりも8%低い。
論文 参考訳(メタデータ) (2023-05-23T21:50:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。