論文の概要: A Coreset Selection Framework with Ensemble Aggregation for Image Classification
- arxiv url: http://arxiv.org/abs/2607.09100v1
- Date: Fri, 10 Jul 2026 05:09:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.783727
- Title: A Coreset Selection Framework with Ensemble Aggregation for Image Classification
- Title(参考訳): 画像分類のためのアンサンブルアグリゲーションを用いたコアセット選択フレームワーク
- Abstract要約: コアセット選択とアンサンブルアグリゲーションを組み合わせたフレームワークを提案する。
コアセット選択には、選択したスコアと各間隔からのサンプルに基づいてトレーニングデータを間隔に分割するSCOre-Stratified Selection (SCOSS)を提案する。
アンサンブルは複数の実行からの予測を組み合わせ、それぞれが独立してサンプル化されたトレーニングサブセットで実行される。
- 参考スコア(独自算出の注目度): 3.122537594115402
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The rapid growth of image data has produced large-scale datasets, raising concerns about the time and memory costs of model training. Selecting representative training subsets, however, remains challenging: individual sample contributions are unclear, and model behavior varies across datasets and runs. We address these challenges with a framework that combines coreset selection with an ensemble aggregation over multiple runs. For coreset selection, we propose SCOre-Stratified Selection (SCOSS), which partitions the training data into intervals based on a chosen score and samples from each interval. The ensemble combines predictions from multiple runs, each performed on an independently sampled training subset. As baselines, we use moderate and random selection, each in original and class-balanced versions. We assess the framework with Simple Graph Convolution (SGC) and Support Vector Machine (SVM) classifiers under different sampling ratios. Experiments show that SCOSS is competitive with baselines, often the best choice for SGC, and enables favorable trade-offs between accuracy and efficiency. On the fine-grained dataset, SGC with SCOSS outperforms SVMs when using fewer labeled samples. The code and supplementary materials are publicly available at http://scoss.lucasvalem.com.
- Abstract(参考訳): 画像データの急速な成長により、大規模なデータセットが生成され、モデルトレーニングの時間とメモリコストに対する懸念が高まっている。
個々のサンプルコントリビューションは不明確で、モデルの振る舞いはデータセットや実行によって異なります。
これらの課題に,コアセット選択とアンサンブルアグリゲーションを組み合わせたフレームワークで対処する。
コアセット選択には、選択したスコアと各間隔からのサンプルに基づいてトレーニングデータを間隔に分割するSCOre-Stratified Selection (SCOSS)を提案する。
アンサンブルは複数の実行からの予測を組み合わせ、それぞれが独立してサンプル化されたトレーニングサブセットで実行される。
ベースラインとしては、それぞれがオリジナルバージョンとクラスバランスバージョンで、適度でランダムな選択を使用します。
我々は,SGC(Simple Graph Convolution)とSVM(Support Vector Machine)の分類器を用いて,異なるサンプリング比でフレームワークを評価する。
実験の結果、SCOSSはベースラインと競合し、しばしばSGCにとって最良の選択であり、精度と効率のトレードオフを可能にすることが示されている。
きめ細かいデータセットでは、SCOSSを使用したSGCはラベル付きサンプルが少ない場合にSVMより優れている。
コードと補足資料はhttp://scoss.lucasvalem.comで公開されている。
関連論文リスト
- GLOBE: Trajectory-Aligned Gradient Matching with Structured SparseOptimization for Coreset Selection [4.969458805037944]
ディープニューラルネットワークのオンデバイストレーニングは、大規模データセットの計算とメモリコストに制約される。
本稿では,大域的に最適化されたスパース重み付け問題として,サンプル選択を定式化するトラジェクトリ・アライン・コアセット選択フレームワークGLOBEを提案する。
論文 参考訳(メタデータ) (2026-08-03T09:01:29Z) - Unsupervised Multi-kernel Learning for Automated Algorithm Selection [6.372443691054574]
ブラックボックス最適化におけるアルゴリズム選択のための教師なしモデルに代わる教師なしモデル。
問題インスタンスはクラスタリングの段階でパフォーマンスラベルを使わずにグループ化される。
結果は、厳格に分離された3段階評価プロトコルを通じて、解決者推奨にポストホックにマッピングされる。
論文 参考訳(メタデータ) (2026-07-21T12:18:49Z) - DISCO: Diversifying Sample Condensation for Efficient Model Evaluation [59.01400190971061]
コスト評価は傾向を低下させ、イノベーションのサイクルを遅くし、環境への影響を悪化させる。
モデル応答の多様性を最大化するサンプルを選択することが重要となる。
我々のメソッドである$textbfDiversifying Sample Condensation (DISCO)$は、最も大きなモデル不一致を持つトップkサンプルを選択します。
論文 参考訳(メタデータ) (2025-10-09T08:53:59Z) - Towards Compute-Optimal Many-Shot In-Context Learning [69.38428467281862]
マルチショットICLにおけるデモ選択のための2つの戦略を提案する。
最初の方法は、テストサンプルの類似性に基づいて選択された少数のデモと、キャッシュされるランダムなデモの集合を組み合わせる。
第2の戦略は、ランダムなデモをk平均クラスタリングによるテストサンプル表現から選択したセントロイドに置き換えることによって、第1の戦略を改善する。
論文 参考訳(メタデータ) (2025-07-22T04:21:03Z) - Add-One-In: Incremental Sample Selection for Large Language Models via a Choice-Based Greedy Paradigm [50.492124556982674]
本稿では,新しい選択型サンプル選択フレームワークを提案する。
個々のサンプル品質の評価から、異なるサンプルのコントリビューション値の比較へと焦点をシフトする。
われわれのアプローチをより大きな医療データセットで検証し、現実の応用における実用性を強調した。
論文 参考訳(メタデータ) (2025-03-04T07:32:41Z) - Coreset Selection via LLM-based Concept Bottlenecks [6.857632954159568]
Coreset Selection(CS)は、データセット全体の使用に匹敵するモデルパフォーマンスを達成するトレーニングデータセットのサブセットを特定することを目的としている。
本研究は,ダウンストリームモデルに依存しない人間の理解可能なテキスト属性(概念)を用いて,サンプルの難易度を計算するスコアを提案する。
我々のコアセットは高いプルーニングレートでもランダムなサブセットよりも優れており、動的手法を訓練することによって得られるコアセットに匹敵するモデル性能を実現している。
論文 参考訳(メタデータ) (2025-02-23T22:14:42Z) - Adapt-$\infty$: Scalable Continual Multimodal Instruction Tuning via Dynamic Data Selection [89.42023974249122]
Adapt-$infty$は、生涯のインストラクションチューニングのための、新しいマルチウェイおよびアダプティブなデータ選択アプローチである。
勾配に基づくサンプルベクトルをグループ化して擬似スキルクラスタを構築する。
セレクタエキスパートのプールから各スキルクラスタの最高のパフォーマンスデータセレクタを選択する。
このデータセレクタは、トレーニングのために各スキルクラスタから最も重要なサンプルのサブセットをサンプリングする。
論文 参考訳(メタデータ) (2024-10-14T15:48:09Z) - BWS: Best Window Selection Based on Sample Scores for Data Pruning across Broad Ranges [12.248397169100784]
データサブセットの選択は、フルデータセットのトレーニングを近似できる大規模なデータセットの、小さくても情報に富むサブセットを見つけることを目的としている。
難易度スコアに基づいて順序付けされたサンプルから最適なウィンドウサブセットを選択する方法を提案することにより、普遍的で効率的なデータサブセット選択法であるBest Window Selection(BWS)を導入する。
論文 参考訳(メタデータ) (2024-06-05T08:33:09Z) - Revisiting the Evaluation of Image Synthesis with GANs [55.72247435112475]
本研究では, 合成性能の評価に関する実証的研究を行い, 生成モデルの代表としてGAN(Generative Adversarial Network)を用いた。
特に、表現空間におけるデータポイントの表現方法、選択したサンプルを用いた公平距離の計算方法、各集合から使用可能なインスタンス数など、さまざまな要素の詳細な分析を行う。
論文 参考訳(メタデータ) (2023-04-04T17:54:32Z) - Gated recurrent units and temporal convolutional network for multilabel
classification [122.84638446560663]
本研究は,マルチラベル分類を管理するための新しいアンサンブル手法を提案する。
提案手法のコアは,Adamグラデーション最適化アプローチの変種で訓練された,ゲート再帰単位と時間畳み込みニューラルネットワークの組み合わせである。
論文 参考訳(メタデータ) (2021-10-09T00:00:16Z) - Extending Contrastive Learning to Unsupervised Coreset Selection [26.966136750754732]
我々は、コアセットを完全にラベルなしで選択する教師なしの方法を提案する。
対照学習には2つの指導的手法を用いる。
ラベルを用いた既存のコアセット選択手法と比較して,人間のアノテーションに関連するコストを削減した。
論文 参考訳(メタデータ) (2021-03-05T10:21:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。