論文の概要: Benchmark Radar: A Living Database and Search Engine for AI Benchmarks and Evaluation
- arxiv url: http://arxiv.org/abs/2609.11115v2
- Date: Sun, 13 Sep 2026 07:02:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:04.905358
- Title: Benchmark Radar: A Living Database and Search Engine for AI Benchmarks and Evaluation
- Title(参考訳): Benchmark Radar: AIベンチマークと評価のためのリビングデータベースと検索エンジン
- Abstract要約: 我々は、AIベンチマークの検索と発見のために、生きたデータベースと検索エンジンであるBenchmark Radarを紹介する。
このシステムは、毎日のベンチマーク論文、リポジトリ、データセット、リリースの発見と検索可能なベンチマークカタログを組み合わせる。
13のコネクタと24のファーストパーティのリサーチおよびエンジニアリングフィード。
- 参考スコア(独自算出の注目度): 12.306597223332345
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Benchmark researchers and developers of large language models (LLMs) and other AI systems need to find relevant evaluations, locate their benchmark datasets and code, and understand the settings behind reported scores. We present Benchmark Radar, a living database and search engine for retrieval and discovery of AI benchmarks, covering LLM evaluation, agentic and tool-use benchmarks, coding, reasoning, safety, and domain-specific evaluations. The system combines daily discovery of benchmark papers, repositories, datasets, and releases with a searchable benchmark catalog, mentions in model cards and technical reports, and score histories. It retains source identities and citations so readers can inspect candidate benchmarks and their evaluation evidence. Daily discovery draws on 37 sources: 13 direct connectors and 24 first-party research and engineering feeds. The catalog contains 1,283 source records drawn from 4 benchmark catalogs and 12,916 numeric observations on 790 records. We describe collection and retrieval, audit the full catalog, and examine benchmark saturation, adoption trends, and the limits of score comparisons. A worked example walks through a complete prior-art search, showing how to query the catalog and inspect benchmark evidence when designing a new evaluation. We release the web dashboard with a benchmark leaderboard, a Pareto frontier view of score against measured use, saturation and trend views, daily feeds, downloadable evidence, a command-line interface (CLI) for offline queries, and reproducible analysis.
- Abstract(参考訳): 大規模言語モデル(LLM)とその他のAIシステムのベンチマーク研究者と開発者は、関連する評価を見つけ、ベンチマークデータセットとコードを見つけ、報告されたスコアの背後にある設定を理解する必要がある。
我々は、LLM評価、エージェントおよびツール使用ベンチマーク、コーディング、推論、安全性、ドメイン固有の評価を網羅する、AIベンチマークの検索と発見のための生きたデータベースおよび検索エンジンであるBenchmark Radarを紹介する。
このシステムは、ベンチマーク論文、リポジトリ、データセット、リリースの日々の発見と検索可能なベンチマークカタログ、モデルカードやテクニカルレポートへの言及、スコアヒストリーを組み合わせている。
ソースのアイデンティティと引用を保持しており、読者は候補ベンチマークとその評価証拠を検査することができる。
13のコネクタと24のファーストパーティのリサーチおよびエンジニアリングフィード。
このカタログには、4つのベンチマークカタログから引き出された1,283のソースレコードと、790のレコードに関する12,916の数値観測が含まれている。
収集と検索、全カタログの監査、ベンチマーク飽和度、採用傾向、スコア比較の限界について述べる。
動作するサンプルは、完全な事前技術検索を通し、カタログのクエリ方法と、新しい評価を設計する際のベンチマーク証拠の検査方法を示している。
ベンチマークリーダーボード、測定済みの使用、飽和度とトレンドビュー、毎日のフィード、ダウンロード可能なエビデンス、オフラインクエリ用のコマンドラインインターフェース(CLI)、再現可能な分析に対するスコアのパレートフロンティアビュー、Webダッシュボードをリリースする。
関連論文リスト
- A Statistical Audit of Physical AI Benchmark Redundancy [0.0]
物理AIモデルは、モデルレポートによって異なるベンチマークスイートで評価され、モデルバイベンチマークマトリックスはスパースのままである。
51のベンチマークと152のモデルのレジストリから,12の物理AIベンチマーク上に51モデルの行列を構築した。
ベンチマークがどの程度の情報を共有しているかを測定し、冗長性の定量的な証拠を示す。
論文 参考訳(メタデータ) (2026-08-26T15:54:15Z) - Unsteady Metrics and Benchmarking Cultures of AI Model Builders [0.2238062620016784]
Benchmarking-Cultures-25は、主要なAIビルダ11から、2025年に139のモデルリリースで強調された231ベンチマークのデータセットである。
我々は,筆者らが測定している指標に基づいて,測定信号の共有フレームワークに統一された分類学マッピング用語を開発した。
論文 参考訳(メタデータ) (2026-05-13T22:39:10Z) - An Embarrassingly Simple Graph Heuristic Reveals Shortcut-Solvable Benchmarks for Sequential Recommendation [50.09718257952108]
Sequentialsolvは、シーケンシャルなパターンとセマンティックなアイテム情報を組み合わせたジェネレーティブなレコメンデーターへと移行している。
これらの手法は、しばしば、広く使われている少数のベンチマークで評価され、重要な疑問を提起する: これらのベンチマークは、現代のジェネレーティブレコメンデーターが提供しようとしている高度なモデリング機能を必要としているか?
我々は、意図的な単純なグラフでベンチマーク監査を行い、最後の1つか2つの項目から、数ホップの項目遷移グラフから候補を検索し、項目間類似度でランク付けする。
論文 参考訳(メタデータ) (2026-05-08T02:00:11Z) - AISafetyBenchExplorer: A Metric-Aware Catalogue of AI Safety Benchmarks Reveals Fragmented Measurement and Weak Benchmark Governance [0.0]
2018年から2026年の間にリリースされた、195のAI安全性ベンチマークの構造化カタログである、AISafetyBenchExplorerを紹介します。
ベンチマークの肥大化は測定基準よりも大きくなっている。
メートル法レベルでは、精度、F1スコア、安全スコア、総合ベンチマークスコアなどのよく知られたラベルが、しばしば実質的な異なる判断、集約ルール、脅威モデルを隠すことを示している。
論文 参考訳(メタデータ) (2026-04-14T15:26:03Z) - Benchmark^2: Systematic Evaluation of LLM Benchmarks [66.2731798872668]
3つの相補的なメトリクスからなる包括的なフレームワークであるBenchmark2を提案する。
数学、推論、知識ドメインにまたがる15のベンチマークで実験を行います。
本分析により,既存のベンチマーク間での有意な品質変化が明らかとなり,選択的なベンチマーク構築が同等な評価性能を達成できることが示されている。
論文 参考訳(メタデータ) (2026-01-07T14:59:03Z) - Finding Diamonds in Conversation Haystacks: A Benchmark for Conversational Data Retrieval [5.620334754517148]
製品インサイトのための会話データを取得するシステムを評価するための,最初の総合的なテストセットであるConversational Data Retrieval(CDR)ベンチマークを提示する。
5つの分析タスクにわたる1.6kクエリと9.1kの会話により、我々のベンチマークは会話データ検索性能を測定するための信頼性の高い標準を提供する。
論文 参考訳(メタデータ) (2025-10-03T12:29:44Z) - How Should We Build A Benchmark? Revisiting 274 Code-Related Benchmarks For LLMs [60.25940747590386]
本稿では,コード関連ベンチマークの開発を包括的に管理するためのガイドラインとして,55の基準チェックリストからなるHow2Benchを提案する。
私たちは過去10年以内にリリースされた274のベンチマークをプロファイルし、問題を見つけました。
ベンチマークの70%近くはデータ品質保証の措置を取らず、10%以上がオープンソースでも、部分的にはオープンソースでもなかった。
論文 参考訳(メタデータ) (2025-01-18T09:51:57Z) - BRIGHT: A Realistic and Challenging Benchmark for Reasoning-Intensive Retrieval [54.54576644403115]
BRIGHTは、関係する文書を検索するために、集中的推論を必要とする最初のテキスト検索ベンチマークである。
私たちのデータセットは、経済学、心理学、数学、コーディングなど、さまざまな領域にまたがる1,384の現実世界のクエリで構成されています。
クエリに関する明示的な推論を取り入れることで、検索性能が最大12.2ポイント向上することを示す。
論文 参考訳(メタデータ) (2024-07-16T17:58:27Z) - A Review of Benchmarks for Visual Defect Detection in the Manufacturing
Industry [63.52264764099532]
本稿では,既存のベンチマークを用いて,それらの特性とユースケースを比較し,公開する。
産業メトリクスの要求と試験手順についての研究は、研究されたベンチマークに提示され、適用されます。
論文 参考訳(メタデータ) (2023-05-05T07:44:23Z) - Hierarchical Catalogue Generation for Literature Review: A Benchmark [36.22298354302282]
本稿では,7.6kの文献レビューカタログと389kの参考論文を収録した,新しい英語階層カタログ・オブ・文学レビューデータセットを構築した。
モデルの性能を正確に評価するために,2つの評価指標を設計する。
論文 参考訳(メタデータ) (2023-04-07T07:13:35Z) - Autoregressive Search Engines: Generating Substrings as Document
Identifiers [53.0729058170278]
自動回帰言語モデルは、回答を生成するデファクト標準として現れています。
これまでの研究は、探索空間を階層構造に分割する方法を探究してきた。
本研究では,検索空間の任意の構造を強制しない代替として,経路内のすべてのngramを識別子として使用することを提案する。
論文 参考訳(メタデータ) (2022-04-22T10:45:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。