論文の概要: Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents
- arxiv url: http://arxiv.org/abs/2608.06329v1
- Date: Thu, 06 Aug 2026 17:39:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.987055
- Title: Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents
- Title(参考訳): ベンチマークのベンチマーク:会話エージェントのベンチマークを評価する
- Authors: Noam Koren, Roy Bar-Haim, Abigail Goldsteen,
- Abstract要約: 粗末なベンチマークには、一貫性のないタスク、単純化されたシナリオ、あるいは限られたポリシーカバレッジが含まれます。
ベンチマークの一貫性,複雑性,ポリシのカバレッジを評価するために,LCM判断を用いた参照フリーフレームワークを導入する。
本フレームワークは,合成および手作業による対話エージェントベンチマークを評価するための実践的アプローチを提供する。
- 参考スコア(独自算出の注目度): 3.6300043516541263
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Task-oriented conversational agents are evaluated using curated or automatically generated benchmarks, yet benchmark quality is rarely assessed. Poor benchmarks may contain inconsistent tasks, simplistic scenarios, or limited policy coverage, leading to unreliable evaluations. We introduce a reference-free framework that uses LLM judges to assess benchmark consistency, complexity, and policy coverage, while providing actionable diagnostics of weaknesses. We validate the framework by demonstrating agreement with independent human annotations and by evaluating benchmarks generated by LLMs of varying capabilities, as well as benchmarks subjected to controlled quality-degrading perturbations. Across domains and judge models, the proposed metrics consistently distinguish between benchmark quality levels. We further demonstrate the framework's applicability to manually curated benchmarks. Our framework offers a practical approach for evaluating synthetic and manually curated conversational-agent benchmarks.
- Abstract(参考訳): タスク指向の会話エージェントは、キュレートされたまたは自動生成されたベンチマークを使用して評価されるが、ベンチマークの品質はめったに評価されない。
粗末なベンチマークには、一貫性のないタスク、単純化されたシナリオ、あるいは限られたポリシーカバレッジが含まれており、信頼性の低い評価につながります。
LLM判定器を用いて,ベンチマークの一貫性,複雑性,ポリシカバレッジを評価し,弱点の実用的な診断を行うための参照フリーフレームワークを提案する。
我々は,独立した人的アノテーションとの合意を示すとともに,LLMが生成する様々な能力のベンチマークと,品質劣化の抑制を受けるベンチマークを評価することにより,その枠組みを検証した。
ドメインと判断モデル全体で、提案されたメトリクスは、ベンチマークの品質レベルを一貫して区別する。
さらに、手動でキュレートされたベンチマークに対するフレームワークの適用性を示す。
本フレームワークは,合成および手作業による対話エージェントベンチマークを評価するための実践的アプローチを提供する。
関連論文リスト
- Benchmark Everything Everywhere All at Once [28.30618112297148]
ベンチマーク構築用に設計された完全自律型エージェントシステムであるBenchmark Agentを紹介する。
本フレームワークは,ユーザクエリ分析やサブタスク設計からデータアノテーション,品質管理に至るまで,完全なベンチマーク構築パイプラインを編成する。
テキスト理解やマルチモーダル理解,ドメイン固有の推論など,さまざまな評価シナリオにまたがる15の代表的なベンチマークを作成した。
論文 参考訳(メタデータ) (2026-06-04T17:52:04Z) - DEP: A Decentralized Large Language Model Evaluation Protocol [51.3646001384887]
分散評価プロトコル(Decentralized Evaluation Protocol, DEP)は、分散化されているが統一され、標準化された評価フレームワークである。
ユーザ、LLM、ベンチマークを分離することで、DEPはモジュラー、プラグ・アンド・プレイの評価を可能にする。
我々は,ブレークポイントの再開,同時要求,混雑制御などの機能をサポートするプロトコル互換ツールキットであるDEP Toolkitを開発した。
論文 参考訳(メタデータ) (2026-03-01T16:10:16Z) - Benchmark^2: Systematic Evaluation of LLM Benchmarks [66.2731798872668]
3つの相補的なメトリクスからなる包括的なフレームワークであるBenchmark2を提案する。
数学、推論、知識ドメインにまたがる15のベンチマークで実験を行います。
本分析により,既存のベンチマーク間での有意な品質変化が明らかとなり,選択的なベンチマーク構築が同等な評価性能を達成できることが示されている。
論文 参考訳(メタデータ) (2026-01-07T14:59:03Z) - Deprecating Benchmarks: Criteria and Framework [2.6449913368815516]
ベンチマークを完全にあるいは部分的に非推奨にする時期を決定するための基準と、ベンチマークを非推奨にするフレームワークを提案する。
我々の研究は、特にフロンティアモデルにおいて、厳格で高品質な評価に向けたベンチマークの状況を改善することを目的としている。
論文 参考訳(メタデータ) (2025-07-08T22:29:06Z) - MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks [0.0]
質問と回答(QA)ベンチマークのメタ評価のためのフレームワークであるMEQAを提案する。
我々は,人間とLLM評価器を用いたサイバーセキュリティベンチマークにおいて,この手法を実証する。
私たちは、強力な防御ツールとセキュリティ脅威として、AIモデルの二重性によるテストドメインの選択を動機付けています。
論文 参考訳(メタデータ) (2025-04-18T19:01:53Z) - SEOE: A Scalable and Reliable Semantic Evaluation Framework for Open Domain Event Detection [70.23196257213829]
オープンドメインイベント検出のためのスケーラブルで信頼性の高いセマンティックレベルの評価フレームワークを提案する。
提案フレームワークはまず,現在7つの主要ドメインをカバーする564のイベントタイプを含む,スケーラブルな評価ベンチマークを構築した。
次に,大言語モデル(LLM)を自動評価エージェントとして活用し,意味的類似ラベルのきめ細かい定義を取り入れた意味的F1スコアを計算する。
論文 参考訳(メタデータ) (2025-03-05T09:37:05Z) - Beyond the Singular: The Essential Role of Multiple Generations in Effective Benchmark Evaluation and Analysis [10.133537818749291]
大規模言語モデル(LLM)は、現実世界のアプリケーションにおいて重要なユーティリティを実証している。
LLMの能力を評価するにはベンチマーク評価が不可欠である。
論文 参考訳(メタデータ) (2025-02-13T03:43:33Z) - The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models [94.31327813151208]
BiGGen Benchは、77のタスクにわたるLMの9つの異なる能力を徹底的に評価するために設計された、原則化された世代ベンチマークである。
BiGGen Benchの重要な特徴は、インスタンス固有の評価基準の使用であり、人間の評価のニュアンスな識別を忠実に反映している。
論文 参考訳(メタデータ) (2024-06-09T12:30:30Z) - Don't Make Your LLM an Evaluation Benchmark Cheater [142.24553056600627]
大規模言語モデル(LLM)は人工知能のフロンティアを大幅に進歩させ、モデルキャパシティを著しく向上させた。
モデル性能を評価するために, LLMの能力レベルを測定するための評価ベンチマークを構築するのが典型的な方法である。
評価ベンチマークを用いて不適切なリスクと影響について検討し,評価結果を誤って解釈する。
論文 参考訳(メタデータ) (2023-11-03T14:59:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。