論文の概要: Multimodal Dataset Distillation via Phased Teacher Models
- arxiv url: http://arxiv.org/abs/2603.25388v1
- Date: Thu, 26 Mar 2026 12:38:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-27 20:52:48.290554
- Title: Multimodal Dataset Distillation via Phased Teacher Models
- Title(参考訳): 段階教師モデルによるマルチモーダルデータセット蒸留
- Authors: Shengbin Guo, Hang Zhao, Senqiao Yang, Chenyang Jiang, Yuhang Cheng, Xiangru Peng, Rui Shao, Zhuotao Tian,
- Abstract要約: PTM-ST(Phased Teacher Model with Shortcut Trajectory)は、新しいフェーズド蒸留フレームワークである。
PTM-STは最適化振動と相間知識ギャップを著しく軽減することを示す。
我々の手法はFlickr30kとCOCOの最先端のベースラインを一貫して超越している。
- 参考スコア(独自算出の注目度): 46.18186490102602
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal dataset distillation aims to construct compact synthetic datasets that enable efficient compression and knowledge transfer from large-scale image-text data. However, existing approaches often fail to capture the complex, dynamically evolving knowledge embedded in the later training stages of teacher models. This limitation leads to degraded student performance and compromises the quality of the distilled data. To address critical challenges such as pronounced cross-stage performance gaps and unstable teacher trajectories, we propose Phased Teacher Model with Shortcut Trajectory (PTM-ST) -- a novel phased distillation framework. PTM-ST leverages stage-aware teacher modeling and a shortcut-based trajectory construction strategy to accurately fit the teacher's learning dynamics across distinct training phases. This enhances both the stability and expressiveness of the distillation process. Through theoretical analysis and comprehensive experiments, we show that PTM-ST significantly mitigates optimization oscillations and inter-phase knowledge gaps, while also reducing storage overhead. Our method consistently surpasses state-of-the-art baselines on Flickr30k and COCO, achieving up to 13.5% absolute improvement and an average gain of 9.53% on Flickr30k. Code: https://github.com/Previsior/PTM-ST.
- Abstract(参考訳): マルチモーダルデータセット蒸留は、大規模画像テキストデータからの効率的な圧縮と知識伝達を可能にするコンパクトな合成データセットを構築することを目的としている。
しかし、既存のアプローチは、教師モデルの後期訓練段階に埋め込まれた複雑で動的に進化する知識を捉えるのに失敗することが多い。
この制限により、学生のパフォーマンスが低下し、蒸留データの品質が損なわれる。
複数段階のパフォーマンスギャップや不安定な教師軌道の明確化といった重要な課題に対処するため,我々はPTM-ST(Platformd Teacher Model with Shortcut Trajectory)を提案する。
PTM-STは、段階認識型教師モデリングとショートカットベースの軌道構築戦略を活用して、異なる学習段階にわたって教師の学習力学を正確に適合させる。
これにより蒸留プロセスの安定性と表現性の両方が向上する。
理論的解析と包括的実験により,PTM-STは最適化振動と位相間知識ギャップを著しく軽減し,ストレージオーバーヘッドを低減させることを示した。
我々の手法は、Flickr30kとCOCOの最先端ベースラインを一貫して上回り、絶対的な改善が13.5%、Flickr30kの平均的な上昇率は9.53%に達する。
コード:https://github.com/Previsior/PTM-ST。
関連論文リスト
- Image-Free Timestep Distillation via Continuous-Time Consistency with Trajectory-Sampled Pairs [44.222818959759024]
本研究では, 連続時間連続蒸留におけるトラジェクティブ-バックワード整合性モデル(TBCM)を提案する。
VAEエンコーディングや大規模データセットを必要とする従来の方法とは異なり、我々の自己完結蒸留パラダイムは効率と簡易性の両方を著しく改善する。
TBCMは1ステップでMJHQ-30kで6.52 FIDと28.08 CLIPのスコアを達成し、Sana-Sprintと比較してトレーニング時間を約40%短縮した。
論文 参考訳(メタデータ) (2025-11-25T15:36:20Z) - Learning from Stochastic Teacher Representations Using Student-Guided Knowledge Distillation [64.15918654558816]
教師表現のフィルタリングと重み付けのための自己蒸留(SSD)訓練戦略を導入し,タスク関連表現のみから抽出する。
UCR Archiveのウェアラブル/バイオサインデータセット、HARデータセット、画像分類データセットなどの実世界の感情コンピューティングに関する実験結果は、提案したSSD手法が最先端の手法より優れていることを示している。
論文 参考訳(メタデータ) (2025-04-19T14:08:56Z) - FEDS: Feature and Entropy-Based Distillation Strategy for Efficient Learned Image Compression [12.280695635625737]
学習画像圧縮(lic)法は、最近、速度歪み性能においてVVCなどの従来のコーデックよりも優れている。
本稿では,まず,Swin-Transformer V2ベースのアテンションモジュールを統合することで,高容量教師モデルを構築する。
次に、教師から軽量の学生モデルに重要な知識を伝達するアンダーラインFeatureとアンダーラインEntropyベースのアンダーラインDistillation underlineStrategy(textbfFEDS)を提案する。
論文 参考訳(メタデータ) (2025-03-09T02:39:39Z) - Efficient Diffusion as Low Light Enhancer [63.789138528062225]
RATR(Reflectance-Aware Trajectory Refinement)は、イメージの反射成分を用いて教師の軌跡を洗練するための、シンプルで効果的なモジュールである。
textbfReDDiT (textbfDistilled textbfTrajectory) は低照度画像強調(LLIE)に適した効率的で柔軟な蒸留フレームワークである。
論文 参考訳(メタデータ) (2024-10-16T08:07:18Z) - Towards Stable and Storage-efficient Dataset Distillation: Matching Convexified Trajectory [53.37473225728298]
ディープラーニングと大規模言語モデルの急速な進化により、トレーニングデータの需要が指数関数的に増加した。
MTT(Matching Training Trajectories)は、専門家ネットワークのトレーニングトラジェクトリを、合成データセットで実データ上に複製する、顕著なアプローチである。
そこで本研究では,学生の軌道に対するより良いガイダンスを提供することを目的として,MCT (Matching Convexified Trajectory) と呼ばれる新しい手法を提案する。
論文 参考訳(メタデータ) (2024-06-28T11:06:46Z) - Dynamic Sub-graph Distillation for Robust Semi-supervised Continual Learning [47.64252639582435]
半教師付き連続学習(SSCL)に焦点をあて、そのモデルが未知のカテゴリを持つ部分ラベル付きデータから徐々に学習する。
半教師付き連続学習のための動的サブグラフ蒸留法(DSGD)を提案する。
論文 参考訳(メタデータ) (2023-12-27T04:40:12Z) - BOOT: Data-free Distillation of Denoising Diffusion Models with
Bootstrapping [64.54271680071373]
拡散モデルは多様な画像を生成する優れた可能性を示している。
知識蒸留は、推論ステップの数を1つか数に減らすための治療法として最近提案されている。
本稿では,効率的なデータフリー蒸留アルゴリズムにより限界を克服するBOOTと呼ばれる新しい手法を提案する。
論文 参考訳(メタデータ) (2023-06-08T20:30:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。