論文の概要: Benchmarking on Tasks That Matter: Dataset Selection for Preserving Model Rankings
- arxiv url: http://arxiv.org/abs/2606.27997v1
- Date: Fri, 26 Jun 2026 11:50:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.478665
- Title: Benchmarking on Tasks That Matter: Dataset Selection for Preserving Model Rankings
- Title(参考訳): 課題のベンチマーク:モデルランキングを保存するためのデータセットの選択
- Authors: Rostislav Gusev, Alexey Zaytsev,
- Abstract要約: 機械学習モデルのベンチマークには、多くのデータセットが含まれることが多い。
効率性のためには、代わりに、小さくて代表的なデータセットの評価が好ましい。
本稿では,データセットのサブセットを選択する作業を行うためのフレームワークを紹介し,その選択戦略がグローバルモデルランキングをいかに保持するかを評価する。
- 参考スコア(独自算出の注目度): 0.9870126088784975
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Benchmarks of machine learning models often include many datasets, making evaluation expensive. For efficiency, it is preferable to perform evaluations on small, representative datasets instead. The selection of such subsets typically relies on heuristics and is rarely analyzed for the robustness of the resulting model rankings. We introduce a framework to perform the task of selecting datasets subsets with an evaluation of how different selection strategies preserve the global model rankings. Our framework includes bootstrap aggregation, which provides valid confidence intervals, allowing a principled comparison of selection strategies. We consider clustering, design criteria (A/D-optimality), random baselines, and greedy farthest-first (FAFI). For the latter, we derive upper bounds on selection quality in terms of ranking errors as a function of the number of selected datasets. Empirically, in time series classification (TSC, 112 datasets) and in a supplementary natural language processing benchmark derived from MTEB (57 tasks), several selection strategies improve rank preservation compared with random subsets, including simple FAFI. In contrast, in recommender systems (30 datasets), the improvement of strategies over random selection is small and typically statistically insignificant. For TSC, our best-performing strategy achieves a Spearman correlation of 0.95 with the full benchmark model rankings using only five selected datasets. Additional experiments indicate that the effectiveness of selection approaches depends on both the quality of dataset representations and the scale of the benchmarking regime.
- Abstract(参考訳): 機械学習モデルのベンチマークには、しばしば多くのデータセットが含まれ、評価が高価になる。
効率性のためには、代わりに小さな代表的データセットで評価を行うのが好ましい。
このような部分集合の選択は概してヒューリスティックスに依存しており、結果のモデルランキングの堅牢性についてはほとんど分析されない。
本稿では,データセットのサブセットを選択する作業を行うためのフレームワークを紹介し,その選択戦略がグローバルモデルランキングをいかに保存するかを評価する。
我々のフレームワークには、有効な信頼区間を提供するブートストラップアグリゲーションが含まれており、選択戦略の原則的な比較を可能にする。
クラスタリング、設計基準(A/D-最適性)、ランダムベースライン、グリーディ・ファーテストファースト(FAFI)について検討する。
後者では,選択したデータセットの数を関数としてランク付け誤差の観点から,選択品質の上限を導出する。
実証的に、時系列分類(TSC、112データセット)やMTEB(57タスク)から派生した補足自然言語処理ベンチマークでは、単純なFAFIを含むランダムサブセットと比較して、いくつかの選択戦略がランク保存を改善する。
対照的に、レコメンデーターシステム(30のデータセット)では、ランダム選択よりも戦略の改善は小さく、統計的に重要ではない。
TSCのベストパフォーマンス戦略は,選択した5つのデータセットのみを用いたベンチマークモデルランキングと,Spearmanの0.95の相関性を達成している。
さらなる実験により、選択アプローチの有効性は、データセット表現の品質とベンチマーク体制のスケールの両方に依存することが示されている。
関連論文リスト
- Learning Multi-Indicator Weights for Data Selection: A Joint Task-Model Adaptation Framework with Efficient Proxies [50.39041754816285]
本稿では、下流タスクと特定のモデルの両方にデータ選択を併用する多変数重み学習フレームワークを提案する。
提案手法は,GSM8Kのトレーニングサンプルの30%しか使用せず,フルデータセットチューニングに匹敵する性能を実現する。
論文 参考訳(メタデータ) (2026-05-10T17:30:16Z) - Add-One-In: Incremental Sample Selection for Large Language Models via a Choice-Based Greedy Paradigm [50.492124556982674]
本稿では,新しい選択型サンプル選択フレームワークを提案する。
個々のサンプル品質の評価から、異なるサンプルのコントリビューション値の比較へと焦点をシフトする。
われわれのアプローチをより大きな医療データセットで検証し、現実の応用における実用性を強調した。
論文 参考訳(メタデータ) (2025-03-04T07:32:41Z) - Adapt-$\infty$: Scalable Continual Multimodal Instruction Tuning via Dynamic Data Selection [89.42023974249122]
Adapt-$infty$は、生涯のインストラクションチューニングのための、新しいマルチウェイおよびアダプティブなデータ選択アプローチである。
勾配に基づくサンプルベクトルをグループ化して擬似スキルクラスタを構築する。
セレクタエキスパートのプールから各スキルクラスタの最高のパフォーマンスデータセレクタを選択する。
このデータセレクタは、トレーニングのために各スキルクラスタから最も重要なサンプルのサブセットをサンプリングする。
論文 参考訳(メタデータ) (2024-10-14T15:48:09Z) - An incremental preference elicitation-based approach to learning potentially non-monotonic preferences in multi-criteria sorting [53.36437745983783]
まず最適化モデルを構築し,非単調な選好をモデル化する。
本稿では,情報量測定手法と質問選択戦略を考案し,各イテレーションにおいて最も情報に富む選択肢を特定する。
2つのインクリメンタルな選好に基づくアルゴリズムは、潜在的に単調な選好を学習するために開発された。
論文 参考訳(メタデータ) (2024-09-04T14:36:20Z) - BWS: Best Window Selection Based on Sample Scores for Data Pruning across Broad Ranges [12.248397169100784]
データサブセットの選択は、フルデータセットのトレーニングを近似できる大規模なデータセットの、小さくても情報に富むサブセットを見つけることを目的としている。
難易度スコアに基づいて順序付けされたサンプルから最適なウィンドウサブセットを選択する方法を提案することにより、普遍的で効率的なデータサブセット選択法であるBest Window Selection(BWS)を導入する。
論文 参考訳(メタデータ) (2024-06-05T08:33:09Z) - DsDm: Model-Aware Dataset Selection with Datamodels [81.01744199870043]
標準的なプラクティスは、データ品質という人間の考え方にマッチする例をフィルタリングすることです。
質の高い"データソースとの類似性に応じた選択は、ランダムに選択するデータに比べてパフォーマンスが向上しない(さらに傷つく)可能性がある。
我々のフレームワークは、データ品質に関する手作業による概念を回避し、学習プロセスがターゲットタスクの予測にデータポイントをトレーニングする方法を明確にモデル化する。
論文 参考訳(メタデータ) (2024-01-23T17:22:00Z) - Clustering Indices based Automatic Classification Model Selection [16.096824533334352]
そこで本研究では,候補モデルクラスから自動分類モデル選択を行う手法を提案する。
データセットクラスタリング指標を計算し、学習した回帰器を用いて予測された分類性能を直接予測する。
また,モデル選択法に基づくデータ分類のためのエンドツーエンド自動MLシステムを提案する。
論文 参考訳(メタデータ) (2023-05-23T10:52:37Z) - Contextual Active Model Selection [10.925932167673764]
本稿では,ラベル付けコストを最小限に抑えつつ,事前学習したモデルを積極的に選択する手法を提案する。
目的は、ラベル要求を制限しながら予測を行う最良のモデルを適応的に選択することである。
2つの新しいコンポーネントに依存した文脈的アクティブモデル選択アルゴリズムであるCAMSを提案する。
論文 参考訳(メタデータ) (2022-07-13T08:22:22Z) - Selecting the suitable resampling strategy for imbalanced data
classification regarding dataset properties [62.997667081978825]
医学、情報検索、サイバーセキュリティ、ソーシャルメディアなどの多くのアプリケーションドメインでは、分類モデルの導入に使用されるデータセットは、各クラスのインスタンスの不平等な分布を持つことが多い。
この状況は不均衡データ分類と呼ばれ、少数民族の例では予測性能が低い。
オーバーサンプリングとアンダーサンプリングの技術は、各クラスの例の数とバランスをとることでこの問題に対処する、よく知られた戦略である。
論文 参考訳(メタデータ) (2021-12-15T18:56:39Z) - Multiple-criteria Based Active Learning with Fixed-size Determinantal
Point Processes [43.71112693633952]
本稿では,情報性,代表性,多様性の3つの相補的基準を取り入れた,複数基準に基づく能動学習アルゴリズムを提案する。
提案手法は,他の複数基準のALアルゴリズムよりも性能が優れ,安定であることを示す。
論文 参考訳(メタデータ) (2021-07-04T13:22:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。