論文の概要: Task-Aware Joint Pruning and Distillation for Efficient Audio Deepfake Detection
- arxiv url: http://arxiv.org/abs/2610.05264v1
- Date: Sun, 04 Oct 2026 14:34:27 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:26:23.180744
- Title: Task-Aware Joint Pruning and Distillation for Efficient Audio Deepfake Detection
- Title(参考訳): 高能率オーディオディープフェイク検出のためのタスク対応ジョイントプルーニングと蒸留
- Abstract要約: 自己教師付き学習(SSL)ベースの検出器は最先端のパフォーマンスを実現するが、その計算要求はリソース制約されたデバイスへの展開を妨げている。
本稿では,クロスドメインな知識蒸留と移動誘導型構造化プルーニングを組み合わせたタスク・アウェア・ジョイントプルーニング・蒸留フレームワークを提案する。
我々のフレームワークは、モデルを6.3$times$ FLOPsで31.9Mパラメータに減らし、平均的なパフォーマンス低下は複数のデータセットでわずか1.30%である。
- 参考スコア(独自算出の注目度): 32.72993883351615
- License:
- Abstract: Advances in speech synthesis have made deepfake speeches increasingly convincing, posing growing threats to security. While self-supervised learning (SSL) based detectors achieve state-of-the-art performance, their computational demands (typically 300M+ parameters) prevent deployment on resource-constrained devices. Existing compression methods, designed mainly for content-centric tasks, struggle to maintain competitive performance when directly adapted to deepfake detection. We propose a Task-Aware Joint Pruning and Distillation framework that combines cross-domain knowledge distillation with movement-guided structured pruning to transfer forgery-discriminative knowledge and preserve critical structures under aggressive compression. Our framework reduces the model to 31.9M parameters with 6.3$\times$ FLOPs reduction, with an average performance drop of only 1.30\% across multiple datasets compared to the uncompressed baseline, demonstrating strong potential for on-device deployment.
- Abstract(参考訳): 音声合成の進歩により、ディープフェイクスピーチはますます説得力を高め、セキュリティに対する脅威が増大している。
自己教師付き学習(SSL)ベースの検出器は最先端のパフォーマンスを達成するが、その計算要求(典型的には300M以上のパラメータ)はリソース制約されたデバイスへの展開を妨げている。
既存の圧縮手法は、主にコンテンツ中心のタスクのために設計されており、ディープフェイク検出に直接適応する際の競合性能の維持に苦慮している。
本稿では,クロスドメインな知識蒸留と移動誘導型構造化プルーニングを組み合わせたタスク・アウェア・ジョイントプルーニング・蒸留フレームワークを提案する。
我々のフレームワークは、モデルを6.3$\times$ FLOPsの6.3$\timesで31.9Mパラメータに減らす。
関連論文リスト
- AttnCompress: Dynamic Attention-Guided Trajectory Compression for Software Engineering Agents [33.01897134024342]
本稿では,動的注意誘導軌道圧縮フレームワークであるAttnCompressを紹介する。
AttnCompressは意味的整合性と動的適応性のギャップを埋める。
合格率は53.17%で、最先端のベースラインを上回っている。
論文 参考訳(メタデータ) (2026-09-08T06:42:24Z) - Hybrid Robustness Verification for Spatio-Temporal Neural Networks [19.026662893450425]
既存の検証方法は、過度に保守的な近似や不正な計算コストに依存している。
実際には、対向摂動は、低次元、意味論的に意味のある部分空間に制約された、構造化された空間的および時間的相関を示す。
動作認識(UCF-101)、自律運転(Udacity)、医用画像(MedMNIST)の用途を対象として、3次元CNNによる映像入力のロバスト性検証を行う。
論文 参考訳(メタデータ) (2026-06-08T17:06:51Z) - A combination of noise and bilateral filters achieve supralinear and scalable adversarial robustness in CNNs [3.469593736865068]
ガウス雑音と二元フィルタリングを組み合わせた単純なプリプロセッサは、最小計算コストで対向ロバスト性を改善することを実験的に示す。
提案手法は, 計算オーバーヘッドの無視と, 理論上は基礎的な設計により, 対向的ロバスト性を高めるための, 原理的かつ容易に統合可能なフレームワークを提供する。
論文 参考訳(メタデータ) (2026-06-01T13:53:39Z) - Fast KVzip: Efficient and Accurate LLM Inference with Gated KV Eviction [50.99402504483692]
凍結重み付き言語モデルのための新しいゲーティングベースのKVキャッシュ消去手法を提案する。
私たちのアプローチは、プリフィルとデコードの両方の段階にシームレスに統合されます。
実験の結果,KVキャッシュの最大70%を除去しながら,ほぼ無作為な性能を維持していることがわかった。
論文 参考訳(メタデータ) (2026-01-25T03:07:54Z) - CSGaussian: Progressive Rate-Distortion Compression and Segmentation for 3D Gaussian Splatting [57.73006852239138]
本稿では,3次元ガウススプラッティングの速度歪み最適化圧縮とセグメンテーションのための最初の統一フレームワークを提案する(3DGS)。
速度歪みに最適化された3DGS圧縮の最近の進歩に触発されたこの研究は、セマンティックラーニングを圧縮パイプラインに統合し、デコーダ側アプリケーションをサポートする。
提案方式は暗黙的ニューラル表現に基づくハイパープライアを特徴とし,色属性と意味属性の両方の効率的なエントロピー符号化を実現する。
論文 参考訳(メタデータ) (2026-01-19T08:21:45Z) - Compressing Multi-Task Model for Autonomous Driving via Pruning and Knowledge Distillation [23.08627330312648]
本稿では,タスク認識型安全なプルーニングと特徴レベルの知識蒸留を組み合わせたマルチタスクモデル圧縮フレームワークを提案する。
BDD100Kデータセットの実験では、圧縮されたモデルがパラメータの32.7%の削減を実現している。
圧縮されたモデルは、リアルタイムに32.7 FPSで動作する。
論文 参考訳(メタデータ) (2025-11-03T18:43:15Z) - Knowledge-Informed Neural Network for Complex-Valued SAR Image Recognition [51.03674130115878]
本稿では,新しい「圧縮集約圧縮」アーキテクチャ上に構築された軽量なフレームワークであるKnowledge-Informed Neural Network(KINN)を紹介する。
KINNはパラメータ効率の認識における最先端を確立し、データスカースとアウト・オブ・ディストリビューションのシナリオにおいて例外的な一般化を提供する。
論文 参考訳(メタデータ) (2025-10-23T07:12:26Z) - NAP-Tuning: Neural Augmented Prompt Tuning for Adversarially Robust Vision-Language Models [72.58372335140241]
AdvPT(Adversarial Prompt Tuning)は、視覚言語モデル(VLM)における対向的ロバスト性を高めるための学習可能なテキストプロンプトを導入した。
マルチモーダル適応型プロンプトチューニング(NAP-Tuning)のためのニューラルネットワークフレームワークを提案する。
我々のアプローチは、挑戦的なAutoAttackベンチマークの下で最強のベースラインよりも大幅に改善され、ViT-B16では33.5%、ViT-B32アーキテクチャでは33.0%を上回りました。
論文 参考訳(メタデータ) (2025-06-15T03:34:23Z) - Robust and Transferable Backdoor Attacks Against Deep Image Compression With Selective Frequency Prior [118.92747171905727]
本稿では,学習画像の圧縮モデルに複数のトリガを付加したバックドアアタックを起動するための新しい周波数ベースのトリガインジェクションモデルを提案する。
1) 圧縮品質をビットレートと再現精度で劣化させる,2) 顔認識やセマンティックセグメンテーションといったタスク駆動型対策を目標とする,様々なシナリオに適した攻撃目標を設計する。
実験の結果, トリガーインジェクションモデルと, エンコーダパラメータの微調整を組み合わせることで, 複数のバックドアとトリガーを1つの圧縮モデルに注入することができた。
論文 参考訳(メタデータ) (2024-12-02T15:58:40Z) - Bandwidth-Aware and Overlap-Weighted Compression for Communication-Efficient Federated Learning [29.727339562140653]
フェデレーション平均化(FedAvg)におけるスパシフィケーションなどの現在のデータ圧縮手法は、フェデレーション学習(FL)のコミュニケーション効率を効果的に向上させる。
これらの手法は、異種帯域幅と非IIDデータによるストラグラー問題やモデル性能の低下といった課題に直面する。
非IIDデータに関連する問題を軽減しつつ,通信効率の向上を目的としたFLのための帯域幅対応圧縮フレームワークを提案する。
論文 参考訳(メタデータ) (2024-08-27T02:28:27Z) - Aligned Unsupervised Pretraining of Object Detectors with Self-training [41.03780087924593]
物体検出器の教師なし事前訓練は、近年、物体検出器訓練の重要な要素となっている。
本稿では、この問題を緩和し、3つの単純かつ重要な要素からなるフレームワークを提案する。
当社の戦略は,スクラッチ(背骨を含む)からの事前トレーニングも可能であり,COCOのような複雑な画像にも適用可能であることを示す。
論文 参考訳(メタデータ) (2023-07-28T17:46:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。