Fugu-MT 論文翻訳(概要): Accelerating Dataset Distillation via Model Augmentation

論文の概要: Accelerating Dataset Distillation via Model Augmentation

arxiv url: http://arxiv.org/abs/2212.06152v2
Date: Sat, 15 Apr 2023 15:58:53 GMT
ステータス: 翻訳完了
システム内更新日: 2023-04-18 23:16:37.200630
Title: Accelerating Dataset Distillation via Model Augmentation
Title（参考訳）: モデル拡張によるデータセット蒸留の促進
Authors: Lei Zhang, Jie Zhang, Bowen Lei, Subhabrata Mukherjee, Xiang Pan, Bo Zhao, Caiwen Ding, Yao Li, Dongkuan Xu
Abstract要約: 本研究では,初期モデルとパラメータを用いた2つのモデル拡張手法を提案し,学習コストを大幅に削減した情報合成集合を学習する。提案手法は,最先端の手法と同等の性能で,最大20倍の高速化を実現している。
参考スコア（独自算出の注目度）: 41.3027484667024
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Abstract: Dataset Distillation (DD), a newly emerging field, aims at generating much smaller but efficient synthetic training datasets from large ones. Existing DD methods based on gradient matching achieve leading performance; however, they are extremely computationally intensive as they require continuously optimizing a dataset among thousands of randomly initialized models. In this paper, we assume that training the synthetic data with diverse models leads to better generalization performance. Thus we propose two model augmentation techniques, i.e. using early-stage models and parameter perturbation to learn an informative synthetic set with significantly reduced training cost. Extensive experiments demonstrate that our method achieves up to 20x speedup and comparable performance on par with state-of-the-art methods.
Abstract（参考訳）: 新たな分野であるDataset Distillation (DD)は、大規模なデータからはるかに小さくて効率的な合成トレーニングデータセットを生成することを目的としている。勾配マッチングに基づく既存のDD手法は、先行性能を達成するが、数千のランダム初期化モデルの間でデータセットを継続的に最適化する必要があるため、非常に計算集約的である。本稿では,多種多様なモデルを用いた合成データの学習が一般化性能の向上につながると仮定する。そこで本研究では,初期モデルとパラメータ摂動を用いて,学習コストを大幅に削減した情報合成集合を学習する2つのモデル拡張手法を提案する。実験により,本手法は20倍の高速化を実現し,最先端手法と同等の性能を示した。

関連論文リスト

Dataset Distillation for Pre-Trained Self-Supervised Vision Models [43.50190223507616]
データセットの蒸留は、モデルのトレーニングが実際のサンプルのより大きなデータセットでトレーニングされた同じモデルのパフォーマンスを再現するような、小さな合成画像のセットを見つけることを目的としている。線形勾配マッチング(Linear Gradient Matching)と呼ばれる課題に対して,データセットの蒸留法を導入する。提案手法は,すべての実像ベースラインを上回り,事前学習された視覚モデルに対して顕著に一般化する合成データを生成する。
論文参考訳（メタデータ） (2025-11-20T18:59:57Z)
PSO-Merging: Merging Models Based on Particle Swarm Optimization [36.641774346671504]
我々は、Particle Swarm Optimization(PSO)に基づく新しいデータ駆動マージ手法であるPSO-Mergingを紹介する。提案手法では,素粒子群を事前学習モデル,エキスパートモデル,スパシファイドエキスパートモデルで初期化する。次に、複数の繰り返しを行い、最終的な大域的最適粒子がマージモデルとして機能する。
論文参考訳（メタデータ） (2025-08-27T12:52:36Z)
Boosting Statistic Learning with Synthetic Data from Pretrained Large Models [6.596689283714373]
本稿では,ドメイン固有の統計的手法を用いて合成データを生成し,体系的にフィルタリングする新しいエンドツーエンドフレームワークを提案する。実験では,様々な設定で予測性能が一貫した改善を示した。
論文参考訳（メタデータ） (2025-05-08T06:55:22Z)
Dataset Distillation as Pushforward Optimal Quantization [1.039189397779466]
そこで本稿では,ImageNet-1Kデータセットの性能向上を目的とした,最先端データ蒸留法D4Mの簡易拡張を提案する。エンコーダ・デコーダ構造を組み込んだ場合、実験的に成功した不整合法を最適な量子化問題として再定義できることを実証する。特に, 既存の不整合データセット蒸留法を古典的最適量子化法とワッサーシュタインバリセンタ問題にリンクし, 拡散型生成前処理のための蒸留データセットの整合性を示す。
論文参考訳（メタデータ） (2025-01-13T20:41:52Z)
Multi-Armed Bandit Approach for Optimizing Training on Synthetic Data [7.603659241572307]
動的ユーザビリティ指標と組み合わせた UCB ベースのトレーニング手法を提案する。提案手法は,合成画像と対応する実・合成データセットからの低レベル・高レベル情報を統合する。提案手法は, ユーザビリティに基づいて, 合成画像のランク付けに有効な方法であることを示す。
論文参考訳（メタデータ） (2024-12-06T23:36:36Z)
Distribution-Aware Data Expansion with Diffusion Models [55.979857976023695]
本研究では,分散型拡散モデルに基づくトレーニングフリーなデータ拡張フレームワークであるDistDiffを提案する。 DistDiffは、オリジナルデータのみにトレーニングされたモデルと比較して、さまざまなデータセットの精度を一貫して向上させる。
論文参考訳（メタデータ） (2024-03-11T14:07:53Z)
Data Distillation Can Be Like Vodka: Distilling More Times For Better Quality [78.6359306550245]
蒸留に1つの合成部分集合を用いるだけでは最適な一般化性能は得られない。 PDDは複数の小さな合成画像集合を合成し、それぞれ前の集合に条件付けし、これらの部分集合の累積和でモデルを訓練する。実験の結果, PDDは既存のデータセット蒸留法の性能を最大4.3%向上させることができることがわかった。
論文参考訳（メタデータ） (2023-10-10T20:04:44Z)
Improved Distribution Matching for Dataset Condensation [91.55972945798531]
本稿では,分布マッチングに基づく新しいデータセット凝縮法を提案する。提案手法は,計算資源の少ない従来の最適化指向手法よりも優れている。
論文参考訳（メタデータ） (2023-07-19T04:07:33Z)
BOOT: Data-free Distillation of Denoising Diffusion Models with Bootstrapping [64.54271680071373]
拡散モデルは多様な画像を生成する優れた可能性を示している。知識蒸留は、推論ステップの数を1つか数に減らすための治療法として最近提案されている。本稿では,効率的なデータフリー蒸留アルゴリズムにより限界を克服するBOOTと呼ばれる新しい手法を提案する。
論文参考訳（メタデータ） (2023-06-08T20:30:55Z)
Towards Efficient Deep Hashing Retrieval: Condensing Your Data via Feature-Embedding Matching [7.908244841289913]
最先端の深層ハッシュ検索モデルのトレーニングに要する費用は増加している。最先端のデータセット蒸留法は、すべての深層ハッシュ検索法に拡張できない。合成集合と実集合との特徴埋め込みをマッチングすることにより,これらの制約に対処する効率的な凝縮フレームワークを提案する。
論文参考訳（メタデータ） (2023-05-29T13:23:55Z)
Generalizing Dataset Distillation via Deep Generative Prior [75.9031209877651]
本稿では,データセット全体の知識をいくつかの合成画像に抽出することを提案する。このアイデアは、学習アルゴリズムにトレーニングデータとして与えられる少数の合成データポイントを合成し、結果として元のデータに基づいてトレーニングされたデータを近似するモデルを構築する。生成モデルの潜在空間における複数の中間特徴ベクトルに多数の画像を蒸留する新しい最適化アルゴリズムを提案する。
論文参考訳（メタデータ） (2023-05-02T17:59:31Z)
Dataset Distillation using Neural Feature Regression [32.53291298089172]
ニューラル・フィーチャー・レグレッション・アンド・プール(FRePo)を用いたデータセット蒸留アルゴリズムを開発した。 FRePoは、メモリ要件を桁違いに少なくし、以前の方法よりも2桁高速なトレーニングで最先端のパフォーマンスを実現している。我々は,高品質な蒸留データにより,連続学習や会員推測防衛など,下流の様々な応用を大幅に改善できることを示す。
論文参考訳（メタデータ） (2022-06-01T19:02:06Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。