論文の概要: carps: A Framework for Comparing N Hyperparameter Optimizers on M Benchmarks
- arxiv url: http://arxiv.org/abs/2506.06143v2
- Date: Thu, 18 Sep 2025 08:10:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-09-19 15:20:14.827654
- Title: carps: A Framework for Comparing N Hyperparameter Optimizers on M Benchmarks
- Title(参考訳): carps: MベンチマークでNのハイパーパラメータオプティマイザを比較するためのフレームワーク
- Abstract要約: carpsはComprehensive Automated Research Performance Studiesのベンチマークフレームワークである。
我々は、ブラックボックス、マルチオブジェクト、マルチオブジェクト、マルチオブジェクトの4つの重要なタイプのHPOタスクに焦点をあてる。
5つのコミュニティベンチマークコレクションから336のタスクと28種類の9つのファミリーで、私たちはこれまでで最大のGotoライブラリを提供しています。
- 参考スコア(独自算出の注目度): 61.79411281702448
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Hyperparameter Optimization (HPO) is crucial to develop well-performing machine learning models. In order to ease prototyping and benchmarking of HPO methods, we propose carps, a benchmark framework for Comprehensive Automated Research Performance Studies allowing to evaluate N optimizers on M benchmark tasks. In this first release of carps, we focus on the four most important types of HPO task types: blackbox, multi-fidelity, multi-objective and multi-fidelity-multi-objective. With 3 336 tasks from 5 community benchmark collections and 28 variants of 9 optimizer families, we offer the biggest go-to library to date to evaluate and compare HPO methods. The carps framework relies on a purpose-built, lightweight interface, gluing together optimizers and benchmark tasks. It also features an analysis pipeline, facilitating the evaluation of optimizers on benchmarks. However, navigating a huge number of tasks while developing and comparing methods can be computationally infeasible. To address this, we obtain a subset of representative tasks by minimizing the star discrepancy of the subset, in the space spanned by the full set. As a result, we propose an initial subset of 10 to 30 diverse tasks for each task type, and include functionality to re-compute subsets as more benchmarks become available, enabling efficient evaluations. We also establish a first set of baseline results on these tasks as a measure for future comparisons. With carps (https://www.github.com/automl/CARP-S), we make an important step in the standardization of HPO evaluation.
- Abstract(参考訳): ハイパーパラメータ最適化(HPO)は、優れた機械学習モデルを開発する上で不可欠である。
本稿では,HPO手法のプロトタイピングとベンチマークを容易にするために,総合的自動研究性能研究のためのベンチマークフレームワークであるcarpsを提案する。
カープの最初のリリースでは、ブラックボックス、マルチ・フィデリティ、マルチ・オブジェクト、マルチ・フィデリティ・マルチ・オブジェクトの4つの重要なタイプのHPOタスクにフォーカスする。
5つのコミュニティベンチマークコレクションからの336タスクと28種類のオプティマイザファミリーの28種類のタスクで、HPOメソッドの評価と比較を行うため、これまでで最大のGotoライブラリを提供する。
Carpsフレームワークは、オプティマイザとベンチマークタスクをまとめる目的で作られた軽量なインターフェースに依存している。
分析パイプラインも備えており、ベンチマーク上でのオプティマイザの評価を容易にする。
しかし、手法の開発と比較をしながら膨大な数のタスクをナビゲートすることは、計算的に不可能である。
これに対応するために、全集合にまたがる空間における部分集合の星差を最小化することにより、代表タスクのサブセットを得る。
その結果,タスクタイプ毎に10~30種類のタスクを初期サブセットとして提案し,ベンチマークが利用可能になるとサブセットを再計算し,効率的な評価を可能にする。
また,これらの課題について,今後の比較のための指標として,最初のベースライン結果のセットを構築した。
carps (https://www.github.com/automl/CARP-S) はHPO評価の標準化において重要なステップとなる。
関連論文リスト
- Coresets Before Score Sets: Evaluation-Unsupervised Prompt Subset Selection for LLM Benchmarks [31.891185002244146]
評価教師なしベンチマークコアセット選択では、選択アルゴリズムはモデル評価結果を使用しない。
この目的のために,決定点プロセス(DPP)に基づくアプローチを含む,様々なサブモジュール関数を開発し,評価する。
提案する目的は評価アントラスト制度に限らず,少数のベンチマークのみを選択しなければならない状況では,同じ目標が一致したり,最先端のベースラインを上回ります。
論文 参考訳(メタデータ) (2026-07-02T18:37:18Z) - optimize_anything: A Universal API for Optimizing any Text Parameter [98.42497715725356]
単一タスク検索をサポートする1つのAIベースの最適化システム、クロスプロブレム転送によるマルチタスク検索、および目に見えない入力への一般化を示す。
LLMに基づく検索によるテキストの最適化は汎用的な問題解決パラダイムであることを示す。
論文 参考訳(メタデータ) (2026-05-19T10:18:12Z) - OpenCompass: A Universal Evaluation Platform for Large Language Models [62.59671563145442]
汎用大規模言語モデル (LLM) は, 技術の進歩において重要なリンクとなっている。
メインストリームベンチマークデータセットは、タスクタイプの多様性、一貫性のない評価基準、データと処理の断片化といった課題に直面している。
本稿では,ワンストップ,スケーラブル,高精度な汎用評価プラットフォームであるOpen LLMをオープンソースとして提案する。
論文 参考訳(メタデータ) (2026-05-19T02:50:11Z) - SparseEval: Efficient Evaluation of Large Language Models by Sparse Optimization [64.95852289011385]
大規模言語モデル(LLM)は拡大を続けており、様々な下流タスクのパフォーマンスは大幅に改善されている。
多数のベンチマークサンプルで推論を行うと、高い計算コストが発生するため、それらの能力を評価するのがますます高価になっている。
SparseEvalは,アンカーウェイトを最適化する勾配降下法を初めて導入し,アンカーセレクションに反復的洗練戦略を採用する手法である。
論文 参考訳(メタデータ) (2026-02-08T11:12:45Z) - BlackboxNLP-2025 MIB Shared Task: Exploring Ensemble Strategies for Circuit Localization Methods [64.5040037515574]
2つ以上の回路ローカライズ手法を組み込むことで性能が向上するかどうかを検討する。
並列アンサンブルでは、各エッジに割り当てられた属性スコアを異なる方法で組み合わせる。
逐次アンサンブルでは、EAP-IGを用いて得られたエッジ属性スコアを、より高価で高精度な回路識別法のためのウォームスタートとして使用する。
論文 参考訳(メタデータ) (2025-10-08T09:39:40Z) - Visual Document Understanding and Question Answering: A Multi-Agent Collaboration Framework with Test-Time Scaling [83.78874399606379]
テスト時間スケーリングを備えたマルチエージェント協調フレームワークであるMACTを提案する。
4つの異なる小規模エージェントから構成され、明確に定義された役割と効果的なコラボレーションがある。
一般および数学的タスクの能力を犠牲にすることなく、より小さなパラメータスケールで優れた性能を示す。
論文 参考訳(メタデータ) (2025-08-05T12:52:09Z) - BOOST: Bayesian Optimization with Optimal Kernel and Acquisition Function Selection Technique [1.0499611180329804]
カーネル獲得ペアの選択を自動化する新しいフレームワークであるBOOSTを提案する。
BOOSTは、様々なカーネル獲得ペアのパフォーマンスを予測し、高価な評価にコミットする前に最も有望なペアを特定する。
論文 参考訳(メタデータ) (2025-08-04T12:08:12Z) - PanMatch: Unleashing the Potential of Large Vision Models for Unified Matching Models [80.65273820998875]
頑健な対応マッチングのための汎用基盤モデルであるPanMatchを提案する。
我々の重要な洞察は、任意の2フレーム対応タスクが2次元変位推定フレームワーク内で処理可能であることである。
PanMatchは、偏差推定アルゴリズムを前例のない一般化能力で実現し、マルチタスク統合を実現する。
論文 参考訳(メタデータ) (2025-07-11T08:18:52Z) - SCAN: Structured Capability Assessment and Navigation for LLMs [54.54085382131134]
textbfSCAN (Structured Capability Assessment and Navigation) は、大規模言語モデルの詳細な特徴付けを可能にする実用的なフレームワークである。
SCANには4つの重要なコンポーネントが含まれている。
TaxBuilder – クエリから機能表示タグを抽出して階層的な分類構造を構築する。
RealMixは、各機能タグに対する十分な評価データを保証するクエリ合成とフィルタリングのメカニズムである。
PC$2$ベースのLCM-as-a-Judge法は従来のLCM-as-a-Judge法と比較して大幅に精度が向上する
論文 参考訳(メタデータ) (2025-05-10T16:52:40Z) - Purifying, Labeling, and Utilizing: A High-Quality Pipeline for Small Object Detection [83.90563802153707]
PLUSNetは高品質のSmallオブジェクト検出フレームワークである。
上流の特徴を浄化するための階層的特徴(HFP)フレームワーク、中流トレーニングサンプルの品質を改善するための多重基準ラベル割り当て(MCLA)、下流タスクを達成するためにより効果的に情報を活用するための周波数分離ヘッド(FDHead)の3つのコンポーネントで構成されている。
論文 参考訳(メタデータ) (2025-04-29T10:11:03Z) - LLaMA-Berry: Pairwise Optimization for O1-like Olympiad-Level Mathematical Reasoning [56.273799410256075]
このフレームワークはMonte Carlo Tree Search (MCTS)と反復的なSelf-Refineを組み合わせて推論パスを最適化する。
このフレームワークは、一般的なベンチマークと高度なベンチマークでテストされており、探索効率と問題解決能力の点で優れた性能を示している。
論文 参考訳(メタデータ) (2024-10-03T18:12:29Z) - BOtied: Multi-objective Bayesian optimization with tied multivariate ranks [33.414682601242006]
本稿では,非支配解と結合累積分布関数の極端量子化との自然な関係を示す。
このリンクにより、我々はPareto対応CDFインジケータと関連する取得関数BOtiedを提案する。
種々の合成および実世界の問題に対する実験により,BOtied は最先端MOBO 取得関数より優れていることが示された。
論文 参考訳(メタデータ) (2023-06-01T04:50:06Z) - Speeding Up Multi-Objective Hyperparameter Optimization by Task
Similarity-Based Meta-Learning for the Tree-Structured Parzen Estimator [37.553558410770314]
本稿では,タスク間のトップドメインの重複によって定義されるタスク類似性を用いて,TPEの取得機能をメタラーニング設定に拡張する。
実験では,表付きHPOベンチマークでMO-TPEを高速化し,最先端の性能が得られることを示した。
論文 参考訳(メタデータ) (2022-12-13T17:33:02Z) - Task Adaptive Parameter Sharing for Multi-Task Learning [114.80350786535952]
Adaptive Task Adapting Sharing(TAPS)は、階層の小さなタスク固有のサブセットを適応的に修正することで、ベースモデルを新しいタスクにチューニングする手法である。
他の手法と比較して、TAPSはダウンストリームタスクに対して高い精度を維持し、タスク固有のパラメータは少ない。
我々は,タスクやアーキテクチャ(ResNet,DenseNet,ViT)を微調整して評価し,実装が簡単でありながら最先端の性能を実現することを示す。
論文 参考訳(メタデータ) (2022-03-30T23:16:07Z) - YAHPO Gym -- Design Criteria and a new Multifidelity Benchmark for
Hyperparameter Optimization [1.0718353079920009]
我々は,700以上の多相HPO問題を構成する9つのベンチマークコレクションからなる,多相HPOメソッドのためのサロゲートベースのベンチマークスイートを提案する。
すべてのベンチマークでは、複数の最適化ターゲットのクエリも可能で、多目的HPOのベンチマークを可能にします。
論文 参考訳(メタデータ) (2021-09-08T14:16:31Z) - Hyperparameter Optimization: Foundations, Algorithms, Best Practices and
Open Challenges [5.139260825952818]
本稿では,グリッドやランダム検索,進化アルゴリズム,ベイズ最適化,ハイパーバンド,レースなどの重要なHPO手法について述べる。
HPOアルゴリズム自体、パフォーマンス評価、HPOとMLパイプラインの結合方法、ランタイムの改善、並列化など、HPOの実行時に行うべき重要な選択について、実用的なレコメンデーションを提供する。
論文 参考訳(メタデータ) (2021-07-13T04:55:47Z) - HPO-B: A Large-Scale Reproducible Benchmark for Black-Box HPO based on
OpenML [5.735035463793008]
我々はHPOアルゴリズムを比較するための大規模ベンチマークであるHPO-Bを提案する。
ベンチマークはOpenMLリポジトリから収集され、事前処理されています。
我々は,非伝達学習および伝達学習HPOの手法の比較のための,明示的な実験的プロトコル,分割,評価方法について詳述する。
論文 参考訳(メタデータ) (2021-06-11T09:18:39Z) - IOHanalyzer: Detailed Performance Analyses for Iterative Optimization
Heuristics [3.967483941966979]
IOHanalyzerは、IOHのパフォーマンスデータを分析、比較、視覚化するための新しいユーザフレンドリーなツールである。
IOHanalyzerは、固定目標実行時間とベンチマークアルゴリズムの固定予算性能に関する詳細な統計を提供する。
IOHanalyzerは、主要なベンチマークプラットフォームから直接パフォーマンスデータを処理できる。
論文 参考訳(メタデータ) (2020-07-08T08:20:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。