論文の概要: What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)
- arxiv url: http://arxiv.org/abs/2608.06202v1
- Date: Thu, 06 Aug 2026 15:58:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.947901
- Title: What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)
- Title(参考訳): Modality, Search, Citations, Implications(安全性評価のための)
- Abstract要約: 私たちは、ChatGPTのチャットUIとOpenAIのAPIの2つのモダリティを、Web検索を有効に/しないで比較した。
例えば、チャットUIレスポンスは、検索を無効にした両方のベンチマークのAPIレスポンスよりも正確ではなかった。
AIの安全性評価は、モダリティ、マルチラン一貫性、探索条件、応答レベルの振る舞いを体系的に考慮すべきである、と我々は主張する。
- 参考スコア(独自算出の注目度): 1.0499611180329804
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model (LLM) benchmark evaluations are routinely used to support claims about model safety, reliability, and deployment readiness. Yet most evaluations rely on a single access modality (model APIs), perform a single run per prompt, and report accuracy as the primary outcome metric, without accounting for conditions such as web search that may have effects on model behavior in deployment. We audit these assumptions for one of the most widely-used LLMs, comparing two modalities, ChatGPT's chat UI and OpenAI's API, with and without web search enabled. We use a stratified total sample of 401 prompts from two popular benchmarks, BBQ and SafetyBench, collecting 4,812 total responses across three repeated runs per prompt. Beyond standard performance measures, we evaluate model output dimensions including response consistency, response text similarity, citation grounding, and abstention behavior. For instance, chat UI responses were less accurate than API responses on both benchmarks with search disabled. Enabling web search reduced accuracy by up to 8 percentage points, and even reversed the direction of modality performance trends for one benchmark. Repeated runs of the same prompt produced inconsistent responses in up to 21\% of prompts. The two modalities also grounded answers in different citations, and abstention behavior was also inconsistent across both modalities. These results illustrate that, even within a model family, reporting only simple accuracy metrics can obscure important forms of model behavioral variation relevant to AI safety assessments. We argue that AI safety evaluations should systematically account for modality, multi-run consistency, search conditions, and response-level behaviors to better reflect how deployed AI systems behave in practice.
- Abstract(参考訳): 大規模言語モデル(LLM)ベンチマーク評価は、モデルの安全性、信頼性、デプロイメントの準備性に関する主張をサポートするために、定期的に使用される。
しかし、ほとんどの評価は、単一のアクセスモダリティ(モデルAPI)に依存し、プロンプト毎に単一の実行を実行し、デプロイ中のモデル動作に影響を与える可能性のあるWeb検索のような条件を考慮せずに、主要な結果の指標として精度を報告します。
この仮定を,ChatGPT のチャット UI と OpenAI の API の2つのモダリティと,Web 検索が有効/不要の2つのモードを比較し,最も広く利用されている LLM の1つについて検証した。
我々は、BBQとSafetyBenchという2つの人気のあるベンチマークから、401のプロンプトの階層化された全サンプルを使用して、プロンプト毎に3回の繰り返し実行で4,812のレスポンスを収集する。
標準性能測定の他に、応答整合性、応答テキスト類似性、励振グラウンド化、禁忌行動を含むモデル出力次元の評価を行う。
例えば、チャットUIレスポンスは、検索を無効にした両方のベンチマークのAPIレスポンスよりも正確ではなかった。
Web検索の精度を最大8ポイント削減し、1つのベンチマークのモダリティパフォーマンストレンドの方向を逆転させた。
同じプロンプトの繰り返し実行は、最大21倍のプロンプトで一貫性のない応答を生成した。
2つのモダリティは異なる引用の答えを根拠にしており、禁忌行動も両方のモダリティ間で矛盾していた。
これらの結果は、モデルファミリ内であっても、単純な精度のメトリクスのみを報告すれば、AIの安全性評価に関連するモデル行動変化の重要な形態が明らかになることを示している。
AIの安全性評価は、実際にデプロイされたAIシステムの振る舞いをよりよく反映するために、モダリティ、マルチラン一貫性、検索条件、応答レベルの振る舞いを体系的に考慮すべきである、と私たちは主張する。
関連論文リスト
- MANTA: Multi-turn Assessment for Nonhuman Thinking & Alignment [0.1452394725421793]
MANTAは、Inspect AIプラットフォーム上に構築された動的マルチターン評価フレームワークである。
Clude-sonnet-4-20250514およびopenai/gpt-4oの評価を行った。
また, LLM-as-judge 評価において, 体系的フォーマットバイアスを示す制御された4要素法であるSTYLEJUDGEを提案する。
論文 参考訳(メタデータ) (2026-04-18T19:51:32Z) - Knowing When Not to Answer: Evaluating Abstention in Multimodal Reasoning Systems [52.83669998269706]
テキストのみの設定で研究されてきたが、まだマルチモーダルに探索されていない。
現在のベンチマークでは、未解決性を無視するか、現実的な障害モードを見逃す粗末なメソッドに依存している。
MM-AQAは、2つの軸に沿った変換によって解答不能なインスタンスを解答可能なインスタンスから構築するベンチマークである。
論文 参考訳(メタデータ) (2026-04-16T09:23:22Z) - vla-eval: A Unified Evaluation Harness for Vision-Language-Action Models [58.633451339058986]
VLAモデルは一般的に、各モデルリポジトリによって独立して維持されるベンチマークスクリプト毎に評価される。
本稿では、ベンチマーク実行からモデル推論を分離するオープンソースの評価ハーネスであるvla evalを紹介する。
完全な評価では、vla eval serveとvla eval runの2つのコマンドしか必要としない。
論文 参考訳(メタデータ) (2026-03-14T14:38:53Z) - The Unlearning Mirage: A Dynamic Framework for Evaluating LLM Unlearning [54.67958855362658]
複雑な構造化クエリを用いたアンラーニングテストを強調する動的フレームワークを提案する。
提案手法はまず,対象モデル(事前学習)から知識を抽出し,単純なクエリからマルチホップチェーンまで,対象プローブを構築する。
本フレームワークは,テストセットを手作業で構築することなく,非学習手法の実用的でスケーラブルな評価を可能にする。
論文 参考訳(メタデータ) (2026-03-11T19:51:33Z) - Demystifying deep search: a holistic evaluation with hint-free multi-hop questions and factorised metrics [89.1999907891494]
We present WebDetective, a benchmark of hint-free multi-hop questions with a control Wikipedia sandbox。
25の最先端モデルに対する我々の評価は、すべてのアーキテクチャにまたがる体系的な弱点を明らかにしている。
私たちはエージェントワークフローであるEvidenceLoopを開発し、ベンチマークが特定する課題を明示的にターゲットしています。
論文 参考訳(メタデータ) (2025-10-01T07:59:03Z) - AHELM: A Holistic Evaluation of Audio-Language Models [78.20477815156484]
マルチモーダルオーディオ言語モデル(ALM)は、インターリーブされた音声とテキストを入力および出力テキストとして取り込む。
AHELMは、PARADEとCoRe-Benchと呼ばれる2つの新しい合成オーディオテキストデータセットを含む、さまざまなデータセットを集約するベンチマークである。
また、モデル間の等価比較を確保するために、プロンプト、推論パラメータ、評価指標を標準化する。
論文 参考訳(メタデータ) (2025-08-29T07:40:39Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - Ensuring Reproducibility in Generative AI Systems for General Use Cases: A Framework for Regression Testing and Open Datasets [0.0]
汎用ユースケースの回帰テストを実行するベンチマークであるGPR-benchを紹介する。
より新しいモデルは一般的に正確性を改善するが、違いは控えめで統計的に有意ではない。
対照的に、簡潔な命令は簡潔さを著しく向上させ、迅速なエンジニアリングの有効性を実証する。
論文 参考訳(メタデータ) (2025-05-02T12:31:43Z) - On the Robust Approximation of ASR Metrics [30.524282767961463]
そこで本研究では,ASR性能指標の近似に新たなアプローチを提案し,真理ラベルの必要性を排除した。
提案手法は,音声および転写表現の統一空間におけるマルチモーダル埋め込みと,高品質なプロキシモデルを組み合わせることで,プロキシメトリクスの計算を行う。
実験結果から, 測定値の絶対差を1桁に近似し, 最新のベースラインを50%以上上回る結果を得た。
論文 参考訳(メタデータ) (2025-02-18T01:10:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。