論文の概要: Dataset Distillation by Influence Matching
- arxiv url: http://arxiv.org/abs/2607.16859v1
- Date: Sat, 18 Jul 2026 15:47:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.274385
- Title: Dataset Distillation by Influence Matching
- Title(参考訳): 影響マッチングによるデータセット蒸留
- Authors: Haoru Tan, Wang Wang, Sitong Wu, Xiuzhe Wu, Yangtian Sun, Chirui Chang, Shaofeng Zhang, Xiaojuan Qi,
- Abstract要約: Inf-Matchは、収束したパラメータに影響を及ぼすコンパクトな合成集合を学習する。
標準分類ベンチマークで最高の精度を提供する。
Inf-MatchはFlickr30Kの視覚言語蒸留にスケールし、強力なプロセスマッチングベースラインを上回っている。
- 参考スコア(独自算出の注目度): 42.09931906541133
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We revisit dataset distillation from an outcome-centric perspective. Rather than aligning process surrogates (per-step gradients or training trajectories), Influence Matching (Inf-Match) aligns the final outcome of training: it learns a compact synthetic set whose effect on the converged parameters matches that of the full dataset. Concretely, we introduce a fully differentiable, sample-level influence estimator that quantifies parameter shifts from adding or removing data, without time-consuming inverse-Hessian products or convexity assumptions. The estimator runs in linear time by unrolling the optimization dynamics and applying a first-order Taylor approximation. We then learn the synthetic set by minimizing the mismatch between its influence and that of the real dataset, yielding outcome alignment rather than heuristic process imitation. Inf-Match delivers the best accuracy across standard classification benchmarks. For instance, on Tiny-ImageNet (IPC=10), Inf-Match attains 31.5\%, a +4.7\% improvement over NCFM. Beyond classification, Inf-Match scales to vision-language distillation on Flickr30K, outperforming strong process-matching baselines. For instance, with 200 to 1000 synthetic samples, our method achieved a leading impressive average on image/text retrieval tasks, higher than NCFM by 2.5\%. The code will be released via https://github.com/hrtan/infmatch.
- Abstract(参考訳): 結果中心の観点からデータセット蒸留を再考する。
プロセスサロゲート(ステップ毎の勾配やトレーニング軌道)を整列するのではなく、影響マッチング(Inf-Match)はトレーニングの最終結果を整列する。
具体的には,データの追加や削除からパラメータシフトを,時間を要する逆ヘッセン積や凸性仮定を使わずに定量化する,完全に微分可能なサンプルレベルの影響推定器を提案する。
推定子は最適化力学をアンロールし、一階Taylor近似を適用することで線形時間で実行される。
そして、その影響と実際のデータセットのミスマッチを最小限にして合成集合を学習し、ヒューリスティックなプロセス模倣よりも結果整合性を得る。
Inf-Matchは標準分類ベンチマークで最高の精度を提供する。
例えば、Tiny-ImageNet (IPC=10)では、Inf-MatchはNCFMよりも31.5\%、+4.7\%改善している。
分類以外にも、Inf-MatchはFlickr30Kの視覚言語蒸留にスケールし、強力なプロセスマッチングベースラインを上回っている。
例えば,200から1000の合成サンプルを用いて,画像・テキスト検索タスクにおいて,NCFMよりも2.5倍高い印象的な平均値を達成した。
コードはhttps://github.com/hrtan/infmatch.comから公開される。
関連論文リスト
- Faithful and Fast Influence Function via Advanced Sampling [10.773767694482858]
特徴量とロジットに基づく2つの高度なサンプリング手法を提案する。
これらのサンプルは、機能やログの分布を考慮して、データセット全体の小さいが代表的なサブセットを選択する。
モデルがいかに効率的にクラスを忘れるかを測定するためにF1スコアを用いて、クラス除去実験を通じてアプローチを検証する。
論文 参考訳(メタデータ) (2025-10-30T17:55:19Z) - Understanding Data Influence with Differential Approximation [63.817689230826595]
我々は,Diff-Inと呼ばれる連続学習ステップ間の影響の差を蓄積することにより,サンプルの影響を近似する新しい定式化を導入する。
2次近似を用いることで、これらの差分項を高精度に近似し、既存の手法で必要となるモデル凸性を排除した。
Diff-In は既存の影響推定器に比べて近似誤差が著しく低いことを示す。
論文 参考訳(メタデータ) (2025-08-20T11:59:32Z) - Efficient Data Selection at Scale via Influence Distillation [53.03573620682107]
本稿では,データ選択のための数学的に修飾されたフレームワークであるインフルエンス蒸留を紹介する。
対象分布に対する各試料の影響を蒸留することにより,トレーニングデータの選択に使用されるモデル固有の重みを割り当てる。
実験の結果、蒸留の影響は最先端のパフォーマンスに匹敵し、最大3.5タイムの高速選択を実現していることがわかった。
論文 参考訳(メタデータ) (2025-05-25T09:08:00Z) - Filter Like You Test: Data-Driven Data Filtering for CLIP Pretraining [17.402771370806384]
Filter Like You Test (FLYT)は、事前トレーニングの例として、各データポイントの有用性を学ぶデータセットをキュレートするアルゴリズムである。
FLYTは、ダウンストリームタスクトレーニングセットからの勾配信号を使用して、各サンプルの機能を測ることを学ぶスコアモデルをトレーニングする。
M-FLYT(Mixing-FLYT)を実装し、異なるスコア法によって生成されるサンプル毎のスコアを特徴として扱い、それらを単一のスコアに統一することを学ぶ。
論文 参考訳(メタデータ) (2025-03-11T18:34:12Z) - Better May Not Be Fairer: A Study on Subgroup Discrepancy in Image
Classification [73.87160347728314]
CIFAR10とCIFAR100のテストセットを各画像の背景色に基づいてサブグループにアノテートすることで、自然背景色が刺激的な特徴としてどのように機能するかを検討する。
全体としての人間レベルの精度は、一貫したサブグループ性能を保証せず、この現象はImageNetで事前訓練されたモデルやデータ拡張後のモデルでも継続している。
実験の結果,FlowAugはCIFAR10/100およびCIFAR10/100-C上で,他のDA法よりも一貫したサブグループ結果が得られることがわかった。
論文 参考訳(メタデータ) (2022-12-16T18:51:10Z) - Minimizing the Accumulated Trajectory Error to Improve Dataset
Distillation [151.70234052015948]
本稿では,フラットな軌道を求める最適化アルゴリズムを提案する。
合成データに基づいてトレーニングされた重みは、平坦な軌道への正規化を伴う累積誤差摂動に対して頑健であることを示す。
本手法はFTD (Flat Trajectory Distillation) と呼ばれ, 勾配整合法の性能を最大4.7%向上させる。
論文 参考訳(メタデータ) (2022-11-20T15:49:11Z) - Augmentation Strategies for Learning with Noisy Labels [3.698228929379249]
ノイズラベル付き学習」問題に取り組むアルゴリズムについて,様々な拡張戦略を評価した。
ロスモデリングタスクと学習のための別のセットに拡張の1つのセットを使用することが最も効果的であることがわかります。
我々は,この拡張戦略を最先端技術に導入し,評価されたすべての騒音レベルにおける性能向上を実証する。
論文 参考訳(メタデータ) (2021-03-03T02:19:35Z) - Evaluating Prediction-Time Batch Normalization for Robustness under
Covariate Shift [81.74795324629712]
我々は予測時間バッチ正規化と呼び、共変量シフト時のモデル精度とキャリブレーションを大幅に改善する。
予測時間バッチ正規化は、既存の最先端アプローチに相補的な利点をもたらし、ロバスト性を向上させることを示します。
この手法は、事前トレーニングと併用して使用すると、さまざまな結果が得られるが、より自然なタイプのデータセットシフトでは、パフォーマンスが良くないようだ。
論文 参考訳(メタデータ) (2020-06-19T05:08:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。