Fugu-MT 論文翻訳(概要): How Should I Build A Benchmark? Revisiting Code-Related Benchmarks For LLMs

論文の概要: How Should I Build A Benchmark? Revisiting Code-Related Benchmarks For LLMs

arxiv url: http://arxiv.org/abs/2501.10711v2
Date: Sun, 26 Jan 2025 05:09:23 GMT
ステータス: 翻訳完了
システム内更新日: 2025-01-28 13:51:06.605679
Title: How Should I Build A Benchmark? Revisiting Code-Related Benchmarks For LLMs
Title（参考訳）: ベンチマークをどのように作るべきか? LLMのコード関連ベンチマークを再考
Authors: Jialun Cao, Yuk-Kit Chan, Zixuan Ling, Wenxuan Wang, Shuqing Li, Mingwei Liu, Ruixi Qiao, Yuting Han, Chaozheng Wang, Boxi Yu, Pinjia He, Shuai Wang, Zibin Zheng, Michael R. Lyu, Shing-Chi Cheung,
Abstract要約: コード関連ベンチマークの開発を包括的に管理するためのガイドラインとして,How2Benchを提案する。私たちは過去10年以内にリリースされた274のベンチマークをプロファイルし、問題を見つけました。多くのベンチマークには、重複したサンプル、不正な参照コード/テスト/プロンプト、削除されていない機密/機密情報を含む抜け穴がある。
参考スコア（独自算出の注目度）: 60.25940747590386
License: http://creativecommons.org/licenses/by/4.0/
Abstract: Various benchmarks have been proposed to assess the performance of large language models (LLMs) in different coding scenarios. We refer to them as code-related benchmarks. However, there are no systematic guidelines by which such a benchmark should be developed to ensure its quality, reliability, and reproducibility. We propose How2Bench, which is comprised of a 55- 55-criteria checklist as a set of guidelines to govern the development of code-related benchmarks comprehensively. Using HOW2BENCH, we profiled 274 benchmarks released within the past decade and found concerning issues. Nearly 70% of the benchmarks did not take measures for data quality assurance; over 10% did not even open source or only partially open source. Many highly cited benchmarks have loopholes, including duplicated samples, incorrect reference codes/tests/prompts, and unremoved sensitive/confidential information. Finally, we conducted a human study involving 49 participants, which revealed significant gaps in awareness of the importance of data quality, reproducibility, and transparency.
Abstract（参考訳）: 異なるコーディングシナリオにおける大規模言語モデル(LLM)の性能を評価するために、様々なベンチマークが提案されている。それらをコード関連のベンチマークと呼んでいる。しかし、そのようなベンチマークが品質、信頼性、再現性を保証するために開発されるべき体系的なガイドラインは存在しない。本稿では,コード関連ベンチマークの開発を包括的に管理するためのガイドラインとして,55-55基準チェックリストからなるHow2Benchを提案する。 HOW2BENCHを使用して、過去10年間にリリースされた274のベンチマークをプロファイルし、問題を発見した。ベンチマークの70%近くはデータ品質保証の措置を取らず、10%以上がオープンソースでも、部分的にはオープンソースでもなかった。多くの高度に引用されたベンチマークには、重複したサンプル、不正な参照コード/テスト/プロンプト、削除されていない機密/機密情報を含む抜け穴がある。最後に,49名の参加者を対象とした人間実験を行い,データ品質,再現性,透明性の重要性を意識する上で,大きなギャップがあることを明らかにした。

関連論文リスト

CoQuIR: A Comprehensive Benchmark for Code Quality-Aware Information Retrieval [31.817325318218003]
CoQuIRは、品質を意識したコード検索を評価するために設計された、最初の大規模多言語ベンチマークである。 CoQuIRは、11のプログラミング言語で42,725のクエリと134,907のコードスニペットに対して、きめ細かい品質のアノテーションを提供する。
論文参考訳（メタデータ） (2025-05-31T13:00:17Z)
VERINA: Benchmarking Verifiable Code Generation [47.9771074559674]
大規模言語モデル(LLM)は、ソフトウェア開発にますます統合されている。検証可能なコード生成は、この制限に対処するための有望なパスを提供する。現在のベンチマークでは、エンドツーエンドの検証可能なコード生成がサポートされていないことが多い。
論文参考訳（メタデータ） (2025-05-29T06:12:52Z)
Information Density Principle for MLLM Benchmarks [59.88484827926759]
本稿では,MLLMの開発において,ベンチマークがどの程度の洞察を得られるかを検討する情報密度の原理を提案する。 1万以上のサンプルの包括的分析により,19個のMLLMベンチマークの情報密度を測定した。実験によると、テストで最新のベンチマークを使用すると、以前のベンチマークよりも多くの洞察が得られるが、情報密度を改善する余地はまだ残っている。
論文参考訳（メタデータ） (2025-03-13T05:58:41Z)
Do Large Language Model Benchmarks Test Reliability? [66.1783478365998]
モデル信頼性の定量化について検討する。信頼性評価におけるこのギャップにより、我々はいわゆるプラチナベンチマークの概念を提案する。我々は、これらのプラチナベンチマークにおいて、幅広いモデルを評価し、実際、フロンティアLSMは、単純なタスクで失敗を示す。
論文参考訳（メタデータ） (2025-02-05T18:58:19Z)
OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning [72.57452266982642]
OCRBench v2は、大規模なバイリンガルテキスト中心のベンチマークである。さまざまなシナリオ31、人間検証された質問回答ペア1万、詳細な評価指標をカバーしている。 LMMのスコアは50未満(合計100点)で、5種類の制限に悩まされている。
論文参考訳（メタデータ） (2024-12-31T07:32:35Z)
MMLU-CF: A Contamination-free Multi-task Language Understanding Benchmark [57.999567012489706]
我々は,MMLU-CFと呼ばれる汚染のない,より困難なベンチマークを提案する。このベンチマークは、意図しないデータ漏洩と悪意のないデータ漏洩の両方を回避することで、LLMの世界の知識に対する理解を再評価する。 GPT-4o は 5 ショットスコア73.4% と 0 ショットスコア71.9% しか達成できない。
論文参考訳（メタデータ） (2024-12-19T18:58:04Z)
BetterBench: Assessing AI Benchmarks, Uncovering Issues, and Establishing Best Practices [28.70453947993952]
我々は、AIベンチマークのライフサイクル全体で46のベストプラクティスを検討し、それに対して24のAIベンチマークを評価するアセスメントフレームワークを開発した。私たちは、大きな品質差があり、よく使われるベンチマークが重大な問題に悩まされていることに気付きました。
論文参考訳（メタデータ） (2024-11-20T02:38:24Z)
Do These LLM Benchmarks Agree? Fixing Benchmark Evaluation with BenchBench [15.565644819269803]
過度に見落とされた方法論的選択がベンチマークコンセンサステスト(BAT)の結果にどのように影響するかを示す。我々は、BAT用のピソンパッケージであるBenchBenchを紹介し、ベンチマークを仲間を使って評価するためのメタベンチマークであるBenchBench- Leaderboardをリリースする。
論文参考訳（メタデータ） (2024-07-18T17:00:23Z)
MR-Ben: A Meta-Reasoning Benchmark for Evaluating System-2 Thinking in LLMs [55.20845457594977]
大規模言語モデル(LLM)は、問題解決と意思決定の能力の向上を示している。本稿ではメタ推論技術を必要とするプロセスベースのベンチマークMR-Benを提案する。メタ推論のパラダイムは,システム2のスロー思考に特に適しています。
論文参考訳（メタデータ） (2024-06-20T03:50:23Z)
ECBD: Evidence-Centered Benchmark Design for NLP [95.50252564938417]
ベンチマーク設計プロセスを5つのモジュールに形式化するフレームワークであるEvidence-Centered Benchmark Design (ECBD)を提案する。各モジュールは、ベンチマーク設計の選択を記述し、正当化し、サポートする必要がある。分析の結果,ベンチマークの妥当性を脅かす可能性のあるベンチマーク設計とドキュメントの共通する傾向が明らかになった。
論文参考訳（メタデータ） (2024-06-13T00:59:55Z)
The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models [94.31327813151208]
BiGGen Benchは、77のタスクにわたるLMの9つの異なる能力を徹底的に評価するために設計された、原則化された世代ベンチマークである。 BiGGen Benchの重要な特徴は、インスタンス固有の評価基準の使用であり、人間の評価のニュアンスな識別を忠実に反映している。
論文参考訳（メタデータ） (2024-06-09T12:30:30Z)
The Fault in our Stars: Quality Assessment of Code Generation Benchmarks [0.5137309756089941]
我々は、異なるコード生成モデルの性能を比較するために使用されるベンチマークの中で、プロンプトの品質について、第一種研究を行う。 9つのコード生成ベンチマークから3,566のプロンプトを分析し、その中の品質問題を特定した。
論文参考訳（メタデータ） (2024-04-15T22:02:58Z)
TRUCE: Private Benchmarking to Prevent Contamination and Improve Comparative Evaluation of LLMs [12.839640915518443]
ベンチマークは LLM を評価するためのデファクト標準であり、その速度、複製性、低コストのためである。最近の研究によると、今日入手可能なオープンソースベンチマークの大部分は、LLMに汚染されたり、リークされたりしている。テストデータセットをプライベートに保持し、モデルにテストデータを公開せずにモデルを評価するソリューションであるPrivate Benchmarkingを提案する。
論文参考訳（メタデータ） (2024-03-01T09:28:38Z)
A Review of Benchmarks for Visual Defect Detection in the Manufacturing Industry [63.52264764099532]
本稿では,既存のベンチマークを用いて,それらの特性とユースケースを比較し,公開する。産業メトリクスの要求と試験手順についての研究は、研究されたベンチマークに提示され、適用されます。
論文参考訳（メタデータ） (2023-05-05T07:44:23Z)
Benchmarks for Automated Commonsense Reasoning: A Survey [0.0]
AIシステムの常識知識と常識推論能力をテストするために、100以上のベンチマークが開発されている。本稿では,AIコモンセンスベンチマークの開発と利用について検討する。
論文参考訳（メタデータ） (2023-02-09T16:34:30Z)
What Will it Take to Fix Benchmarking in Natural Language Understanding? [30.888416756627155]
我々は、NLUベンチマークが満たすべきと議論する4つの基準を定めている。健全な評価エコシステムの復元には、ベンチマークデータセットの設計に大きな進歩が必要だ。
論文参考訳（メタデータ） (2021-04-05T20:36:11Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。