論文の概要: PSM: Dataset Distillation Based on Precise Statistical Matching by Difficulty
- arxiv url: http://arxiv.org/abs/2609.34299v1
- Date: Mon, 28 Sep 2026 04:43:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 22:02:13.21434
- Title: PSM: Dataset Distillation Based on Precise Statistical Matching by Difficulty
- Title(参考訳): PSM:難易度による精密統計的マッチングに基づくデータセット蒸留
- Abstract要約: 本稿では,精度の高い統計的マッチング(PSM)を提案する。
PSMはGlobal Precision Score(GPS)を使用して画像の難易度を推定し、各クラス内のサンプルをランク付けし、各クラスをIPC難易度グループに分割する。
PSMは蒸留試料の難易度の範囲を広げ、ほとんどの評価条件において下流性能を向上させる。
- 参考スコア(独自算出の注目度): 47.03994296898647
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Dataset distillation (DD) condenses a large original dataset into a small distilled dataset with high training utility. Decoupled statistical matching methods substantially reduce distillation time and memory overhead while achieving strong performance. However, they typically supervise all distilled samples using running statistics estimated from the entire original dataset. These statistics mainly capture the average feature distribution while overlooking differences in sample difficulty, limiting their ability to characterize the difficulty structure of the original data. To address this issue, we propose Precise Statistical Matching (PSM) by difficulty. After pretraining, PSM uses the Global Precision Score (GPS) to estimate image difficulty, ranks the samples within each class, and partitions each class into IPC (images per class) difficulty groups. During distillation, Statistics Updated Again (SUA) updates the teacher's batch normalization (BN) running statistics through forward passes on original samples from each group, providing difficulty-specific supervision for the corresponding distilled batch. Meanwhile, Initial Sample Screening (ISS) initializes distilled samples using original images from the corresponding difficulty group, providing an effective starting point for precise matching. Experiments across multiple datasets and model architectures demonstrate that PSM broadens the difficulty range of distilled samples and improves downstream performance in most evaluated settings. Code will be released.
- Abstract(参考訳): データセット蒸留(DD)は、大規模なオリジナルデータセットを、高いトレーニングユーティリティを備えた小さな蒸留データセットに凝縮する。
分離された統計的マッチング法は、強い性能を達成しつつ、蒸留時間とメモリオーバーヘッドを大幅に削減する。
しかし、それらは典型的には、元のデータセット全体から推定される実行統計を用いて、すべての蒸留サンプルを監督する。
これらの統計は主に、サンプルの難易度の違いを見越しながら、平均的な特徴分布を捉え、元のデータの難易度構造を特徴づける能力を制限する。
この問題に対処するため,我々はPSM (Precise Statistical Matching) を提案する。
事前トレーニング後、PSMはGlobal Precision Score(GPS)を使用して画像の難易度を推定し、各クラス内のサンプルをランク付けし、各クラスをIPC難易度グループに分割する。
蒸留中、SUA (Statistics Updated Again) は各グループの原サンプルを前方通過することで教師のバッチ正規化 (BN) を更新し、対応する蒸留バッチの監視が困難になる。
一方、イニシャルサンプルスクリーニング(ISS)は、対応する困難群からの原画像を用いて蒸留試料を初期化し、正確なマッチングのための効果的な出発点を提供する。
複数のデータセットとモデルアーキテクチャをまたいだ実験により、PSMは蒸留サンプルの難易度の範囲を広げ、ほとんどの評価済み設定で下流性能を改善することが示されている。
コードはリリースされる。
関連論文リスト
- Task-Specific Generative Dataset Distillation with Difficulty-Guided Sampling [31.51048512214796]
データセット蒸留は、オリジナルのデータセットに匹敵するパフォーマンスを達成できるコンパクトで高品質な合成データセットを生成することを目的としている。
本稿では, 目標課題の要件をよりよく検討する難易度の概念を取り入れた, 生成データセット蒸留のためのタスク固有サンプリング戦略を提案する。
実験の結果,提案手法の有効性を実証し,他の下流タスクの性能向上の可能性を示した。
論文 参考訳(メタデータ) (2025-07-04T06:38:02Z) - Nearly Optimal Sample Complexity for Learning with Label Proportions [54.67830198790247]
トレーニングセットの例をバッグにグループ化する部分情報設定であるLLP(Learning from Label Proportions)について検討する。
部分的な可観測性にもかかわらず、ゴールは個々の例のレベルで小さな後悔を達成することである。
我々は, LLPの2乗損失下でのサンプル複雑性について, 標本複雑性が本質的に最適であることを示す。
論文 参考訳(メタデータ) (2025-05-08T15:45:23Z) - Not All Samples Should Be Utilized Equally: Towards Understanding and Improving Dataset Distillation [57.6797306341115]
我々は,サンプル難易度の観点から,マッチングに基づくDD手法の理解に向けて最初の一歩を踏み出した。
次に、データプルーニングのニューラルネットワークスケーリング法則をDDに拡張し、これらのマッチングベースの手法を理論的に説明する。
SDC(Sampple Difficulty Correction)アプローチを導入し、より簡単なサンプルを生成して、より高いデータセット品質を実現する。
論文 参考訳(メタデータ) (2024-08-22T15:20:32Z) - Generating Data to Mitigate Spurious Correlations in Natural Language
Inference Datasets [27.562256973255728]
自然言語処理モデルはしばしば、タスクに依存しない特徴とデータセットのラベルの間の急激な相関を利用して、トレーニング対象のディストリビューション内でのみうまく機能する。
そこで本研究では, 脱バイアス化したデータセットを生成して, 脱バイアス化したオフザシェルフモデルをトレーニングする手法を提案する。
提案手法は,1)高品質なラベル一貫性のあるデータサンプルを生成するためのデータジェネレータの訓練方法,2)素粒子相関に寄与するデータ点を除去するフィルタリング機構から構成される。
論文 参考訳(メタデータ) (2022-03-24T09:08:05Z) - An analysis of over-sampling labeled data in semi-supervised learning
with FixMatch [66.34968300128631]
ほとんどの半教師付き学習手法は、ミニバッチを訓練する際にラベルをオーバーサンプルする。
本稿では,この実践が学習と方法を改善するかどうかを考察する。
ラベル付けの有無に関わらず、トレーニングデータから各ミニバッチを均一にサンプリングする別の設定と比較する。
論文 参考訳(メタデータ) (2022-01-03T12:22:26Z) - From Consensus to Disagreement: Multi-Teacher Distillation for
Semi-Supervised Relation Extraction [10.513626483108126]
半教師付き関係抽出(SSRE)は、未ラベルのサンプルを追加のトレーニングデータとしてアノテートすることで、この問題に対して有望な方法であることが証明されている。
しかし、ラベルのないデータに関する豊富な情報を含む差分集合は、以前から無視されてきた。
我々は,既存のSSRE手法に容易に組み込むことができる,シンプルで汎用的な多教師蒸留フレームワークを開発した。
論文 参考訳(メタデータ) (2021-12-02T08:20:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。