論文の概要: Condensing Large-Scale Datasets Directly with Minimal Information Loss
- arxiv url: http://arxiv.org/abs/2607.00916v1
- Date: Wed, 01 Jul 2026 13:21:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.899469
- Title: Condensing Large-Scale Datasets Directly with Minimal Information Loss
- Title(参考訳): 情報損失を最小に抑えた大規模データセットの凝縮
- Authors: Xinyi Shang, Peng Sun, Bei Shi, Zixuan Wang, Tao Lin,
- Abstract要約: CIMは、欠陥のあるデュアル圧縮パラダイムを捨てた、新しい、メトリック駆動のフレームワークである。
CIMは、元のデータセットと合成データセットの間の情報ギャップを明示的に定量化し、最小化する。
- 参考スコア(独自算出の注目度): 34.43216741538152
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advancements in scaling dataset distillation rely heavily on decoupled information extraction pipelines, comprising SQUEEZE, RECOVER, and RELABEL stages. Despite their scalability to large-scale datasets, these methods suffer from prohibitive computational overhead and poor cross-architecture generalization. In this paper, we reveal the root cause of these bottlenecks: the implicit dual-compression process, from data to model and back to images, inherently induces severe information loss. Crucially, we empirically and theoretically demonstrate that this loss creates a distribution shift that fundamentally compromises the widely adopted RELABEL strategy, transforming the pre-trained model into an unreliable labeler that yields sub-optimal labels. To overcome these critical flaws, we propose CIM, a novel, metric-driven framework that abandons the flawed dual-compression paradigm. Instead, CIM explicitly quantifies and minimizes the information gap between the original and synthetic datasets. By directly aligning the data distributions, our approach ensures high-fidelity information condensation and inherently satisfies the prerequisites for effective relabeling. Extensive experiments demonstrate that CIM establishes a new state-of-the-art. Notably, it distills ImageNet-1K at an IPC=10 in merely 80 minutes on a single RTX-4090 GPU, achieving an unprecedented 48.7% Top-1 accuracy on ResNet-18 and significantly outperforming previous SOTA approaches, such as NRR-DD and DELT, by 2.6% and 2.9%, respectively. Our code is available at https://github.com/LINs-lab/CIM.
- Abstract(参考訳): 近年,SQUEEZE,RECOVER,RELABELなど,分離された情報抽出パイプラインに大きく依存している。
大規模データセットへのスケーラビリティにもかかわらず、これらの手法は計算オーバーヘッドの禁止とクロスアーキテクチャの一般化の貧弱さに悩まされている。
本稿では,これらのボトルネックの根本原因を明らかにする。データからモデル,画像まで,暗黙の二重圧縮プロセスは,本質的に深刻な情報損失を引き起こす。
重要かつ理論的に、この損失は広く採用されているRELABEL戦略を根本的に損なう分布シフトを生じさせ、事前学習されたモデルを、準最適ラベルを得る信頼できないラベルに変換するということを実証的に、理論的に実証する。
これらの重大な欠陥を克服するために、我々は、欠陥のある二重圧縮パラダイムを捨てた新しい計量駆動型フレームワークであるCIMを提案する。
代わりに、CIMは、元のデータセットと合成データセットの間の情報ギャップを明示的に定量化し、最小化する。
提案手法は,データ分布を直接整列させることにより,高忠実度情報凝縮を保証し,有効レバーベリングの前提条件を本質的に満足する。
大規模な実験は、CIMが新たな最先端を確立していることを示している。
特に、単一のRTX-4090 GPU上でわずか80分でIPC=10でImageNet-1Kを蒸留し、ResNet-18で48.7%の精度を達成し、NRR-DDやDELTといった従来のSOTAアプローチをそれぞれ2.6%と2.9%上回った。
私たちのコードはhttps://github.com/LINs-lab/CIMで公開されています。
関連論文リスト
- Selecting Samples on Graphs: A Unified Dataset Pruning Framework for Lossless Training Acceleration [71.77541419885925]
グラフベースの統合DPフレームワークを提案する。
データセットを重み付きグラフとしてモデル化することにより、DPは最大重み付き傾き問題(MWCP)としてキャストできる。
ResNet-50でImageNet-1kの精度を犠牲にすることなく、トレーニング時間を40%以上短縮する。
論文 参考訳(メタデータ) (2026-06-11T05:13:32Z) - CoDA: From Text-to-Image Diffusion Models to Training-Free Dataset Distillation [71.52209438343928]
コア分散アライメント(Core Distribution Alignment, CoDA)は、市販のテキスト・ツー・イメージモデルのみを使用して効果的な蒸留(DD)を可能にするフレームワークである。
私たちのキーとなるアイデアは、まず、ロバストな密度ベースの発見メカニズムを使用して、ターゲットデータセットの"固有のコア分布"を識別することです。
そうすることで、CoDAは汎用的な生成先行とターゲットセマンティクスのギャップを効果的に埋める。
論文 参考訳(メタデータ) (2025-12-03T14:45:57Z) - Maximizing Efficiency of Dataset Compression for Machine Learning Potentials With Information Theory [0.45880283710344066]
機械学習原子間ポテンシャル(MLIP)は密度汎関数理論計算と比較して高い精度と低コストのバランスをとる。
大規模なデータセットはモデルの精度と一般化を改善するが、生産と訓練には計算コストがかかる。
我々は,データセット圧縮手法の効率を定量化する情報理論フレームワークを開発した。
論文 参考訳(メタデータ) (2025-11-13T18:00:21Z) - FADRM: Fast and Accurate Data Residual Matching for Dataset Distillation [21.910537847630067]
残余接続は、モデルアーキテクチャレベルで広く研究され、広く応用されている。
データレシダルマッチングの概念を初めて導入し、データレベルのスキップ接続を活用してデータ生成を容易にし、データ情報の消滅を緩和する。
論文 参考訳(メタデータ) (2025-06-30T17:59:34Z) - Dataset Distillation as Pushforward Optimal Quantization [2.5892916589735457]
そこで本研究では,実データ上での学習に類似した性能を,桁違いに少ない計算量で実現した合成トレーニングセットを提案する。
特に、既存の非絡み合ったデータセット蒸留法を古典的最適量子化とワッサーシュタインのバリセンタ問題にリンクする。
我々は,ImageNet-1Kデータセットの性能向上とモデル間一般化を,より簡単な追加計算で実現し,より高階のイメージ・パー・クラス・セッティングにおけるSOTA性能を向上する。
論文 参考訳(メタデータ) (2025-01-13T20:41:52Z) - Self-supervised Dataset Distillation: A Good Compression Is All You Need [23.02066055996762]
SC-DDは, データセット蒸留のための簡易かつ効果的な自己教師圧縮フレームワークである。
提案したSC-DDは、より大規模なモデルを用いる場合、従来の最先端のデータセット蒸留法よりも優れている。
CIFAR-100, Tiny-ImageNet, ImageNet-1Kデータセットを用いて提案手法の優位性を示す実験を行った。
論文 参考訳(メタデータ) (2024-04-11T17:56:40Z) - Dataset Distillation via Adversarial Prediction Matching [24.487950991247764]
本稿では,データセットの蒸留問題を効率的に解くための逆フレームワークを提案する。
提案手法は,オリジナルデータセットの10%程度の大きさの合成データセットを生成できるが,全オリジナルデータセットでトレーニングしたモデルのテスト精度の94%を平均で達成できる。
論文 参考訳(メタデータ) (2023-12-14T13:19:33Z) - Minimizing the Accumulated Trajectory Error to Improve Dataset
Distillation [151.70234052015948]
本稿では,フラットな軌道を求める最適化アルゴリズムを提案する。
合成データに基づいてトレーニングされた重みは、平坦な軌道への正規化を伴う累積誤差摂動に対して頑健であることを示す。
本手法はFTD (Flat Trajectory Distillation) と呼ばれ, 勾配整合法の性能を最大4.7%向上させる。
論文 参考訳(メタデータ) (2022-11-20T15:49:11Z) - Contrastive Model Inversion for Data-Free Knowledge Distillation [60.08025054715192]
そこで、データ多様性を最適化可能な目的として明示的にモデル化するContrastive Model Inversionを提案します。
我々の主な観察では、同じ量のデータの制約の下では、高いデータの多様性は、通常より強いインスタンス識別を示す。
CIFAR-10, CIFAR-100, Tiny-ImageNetを用いた実験により, 生成したデータを知識蒸留に使用する場合, CMIは極めて優れた性能を示すことが示された。
論文 参考訳(メタデータ) (2021-05-18T15:13:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。