論文の概要: Channel-wise Dynamic Knowledge Distillation via Adaptive Sample Generation for Action Recognition
- arxiv url: http://arxiv.org/abs/2608.03100v1
- Date: Tue, 04 Aug 2026 04:18:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.028851
- Title: Channel-wise Dynamic Knowledge Distillation via Adaptive Sample Generation for Action Recognition
- Title(参考訳): 行動認識のための適応サンプル生成によるチャネルワイズ動的知識蒸留
- Authors: Ping Li, Chenhao Ping, Jie Song, Mingli Song,
- Abstract要約: 適応型サンプル対応チャネルワイドダイナミック (ASCD) KD アプローチを開発した。
まず、適応的なサンプル生成モジュールを使用して、サンプル勾配のセマンティクスを組み込んで、更新されたサンプルを作成する。
第2に, チャネルワイド・ダイナミック蒸留モジュールを用いて, サンプル勾配と特徴周波数で導かれるこれらのサンプルを学生に訓練する。
- 参考スコア(独自算出の注目度): 53.278983063932706
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Knowledge Distillation (KD) offers a promising yet underexplored path for compressing large action recognition models. However, existing KD methods suffer from two key limitations: 1) reliance on fixed input samples leads to suboptimal feature alignment between the frozen teacher (larger model) and the learnable student (smaller model), and 2) applying a uniform distillation strength for all channels fails to account for their varying importance in capturing distinct knowledge (e.g., motion tempo or magnitude) across training epochs. This motivates us to develop an Adaptive Sample-aware Channel-wise Dynamic (ASCD) KD approach, which operates in two stages. First, we use an adaptive sample generation module to create updated samples by incorporating semantics from sample gradients, which are derived by minimizing a feature loss weighted by channel centroid frequency differences at each layer. Meanwhile, crucial motion-related details are preserved by applying a Gaussian mask to frequency features. Second, we employ a channel-wise dynamic distillation module to train student on these generated samples, guided by sample gradients and feature frequencies. For efficiency, samples are updated periodically rather than per epoch. Extensive experiments on three video benchmarks (UCF101, Kinetics-400, Something-Something-v2) and two image datasets (CIFAR-100, ImageNet) demonstrate the state-of-the-art performance of our method. Code is available at https://github.com/mlvccn/ASCD_KD_Action.
- Abstract(参考訳): 知識蒸留(KD)は、大きな行動認識モデルを圧縮する上で、期待できない経路を提供する。
しかし、既存のKDメソッドには2つの重要な制限がある。
1) 定型入力サンプルへの依存は、凍結した教師(大型モデル)と学習可能な生徒(小型モデル)との間の最適機能アライメントにつながる。
2) 全チャネルに一様蒸留強度を適用することは, 訓練エポック間で異なる知識(例えば, 運動テンポ, マグニチュード)を捉えることの重要性を考慮できない。
これにより、適応サンプル対応チャネルワイドダイナミック(ASCD)KDアプローチを2段階で開発する動機付けとなる。
まず,適応型サンプル生成モジュールを用いて,各層におけるチャネルセントロイド周波数差の重み付けによる特徴損失を最小限に抑え,サンプル勾配のセマンティクスを組み込むことにより,更新されたサンプルを生成する。
一方、ガウスマスクを周波数特性に応用することで、重要な動き関連の詳細を保存できる。
第2に, チャネルワイド・ダイナミック蒸留モジュールを用いて, サンプル勾配と特徴周波数で導かれるこれらのサンプルを学生に訓練する。
効率性のために、サンプルはエポックごとにではなく定期的に更新される。
3つのビデオベンチマーク(UCF101, Kinetics-400, Something-Something-v2)と2つの画像データセット(CIFAR-100, ImageNet)の大規模な実験により,本手法の最先端性能が実証された。
コードはhttps://github.com/mlvccn/ASCD_KD_Actionで入手できる。
関連論文リスト
- Smooth-Distill: A Self-distillation Framework for Multitask Learning with Wearable Sensor Data [0.0]
本稿では,人間の活動認識(HAR)とセンサ配置検出を同時に行うように設計された,新しい自己蒸留フレームワークであるSmooth-Distillを紹介する。
従来の蒸留法とは異なり, 提案手法では, モデル自体のスムーズな歴史バージョンを教師として利用している。
実験結果から,Smooth-Distill は異なる評価シナリオにおける代替手法よりも一貫して優れていた。
論文 参考訳(メタデータ) (2025-06-27T06:51:51Z) - Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think [72.48325960659822]
生成のための大規模拡散モデルの訓練における主要なボトルネックは、これらの表現を効果的に学習することにある。
本稿では,RePresentation Alignment (REPA) と呼ばれる単純な正規化を導入し,ノイズの多い入力隠れ状態の投影を,外部の事前学習された視覚エンコーダから得られるクリーンな画像表現と整合させる手法を提案する。
我々の単純な戦略は、一般的な拡散やDiTsやSiTsといったフローベースのトランスフォーマーに適用した場合、トレーニング効率と生成品質の両方に大きな改善をもたらす。
論文 参考訳(メタデータ) (2024-10-09T14:34:53Z) - Adversarial Augmentation Training Makes Action Recognition Models More Robust to Realistic Video Distribution Shifts [12.818400676159953]
アクション認識モデルは、トレーニングデータとテストデータの間の自然な分散シフトに直面したとき、堅牢性を欠くことが多い。
そこで本研究では,そのような分布格差に対するモデルレジリエンスを評価するための2つの新しい評価手法を提案する。
提案手法は,3つの動作認識モデルにまたがるベースラインよりも優れた性能を示す。
論文 参考訳(メタデータ) (2024-01-21T05:50:39Z) - GCD-DDPM: A Generative Change Detection Model Based on
Difference-Feature Guided DDPM [7.922421805234563]
深層学習法は近年,バイテンポラルチェンジ検出(CD)において大きな可能性を秘めている
本研究は,CDマップを直接生成するGCD-DDPMと呼ばれる生成的変化検出モデルを提案する。
4つの高解像度CDデータセットの実験により、提案したGCD-DDPMの優れた性能が確認された。
論文 参考訳(メタデータ) (2023-06-06T05:51:50Z) - Activation to Saliency: Forming High-Quality Labels for Unsupervised
Salient Object Detection [54.92703325989853]
本稿では,高品質なサリエンシキューを効果的に生成する2段階アクティベーション・ツー・サリエンシ(A2S)フレームワークを提案する。
トレーニングプロセス全体において、私たちのフレームワークにヒューマンアノテーションは関与していません。
本フレームワークは,既存のUSOD法と比較して高い性能を示した。
論文 参考訳(メタデータ) (2021-12-07T11:54:06Z) - Dynamic Sampling Networks for Efficient Action Recognition in Videos [43.51012099839094]
Em Dynamic Smpling Networks (DSN) と呼ばれるビデオにおける行動認識のための新しいフレームワークを提案する。
DSNは、サンプリングモジュールと分類モジュールから構成されており、その目的は、どのクリップをオンザフライで選択し、どのクリップを保持して、これらの選択されたクリップに基づいてアクション認識を行うかを訓練するサンプリングポリシーを学習することである。
UCF101, HMDB51, THUMOS14, ActivityNet v1.3の4つのアクション認識データセット上で, DSNフレームワークのさまざまな側面について検討した。
論文 参考訳(メタデータ) (2020-06-28T09:48:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。