論文の概要: Towards Compact Unified Multimodal Tracking: Synergizing Knowledge Distillation with Structural Pruning
- arxiv url: http://arxiv.org/abs/2608.01488v1
- Date: Sun, 02 Aug 2026 20:41:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.256951
- Title: Towards Compact Unified Multimodal Tracking: Synergizing Knowledge Distillation with Structural Pruning
- Title(参考訳): コンパクトな統一型マルチモーダルトラッキングを目指して--知識蒸留と構造解析の相乗化
- Abstract要約: 多モード物体追跡は 相補的なセンサーデータを活用することで 目覚ましい堅牢性を達成した
我々は予測ヘッドを重要ではあるが、しばしば見過ごされる効率ボトルネックとみなしている。
デコーダアーキテクチャを戦略的に合理化することで、リアルタイム推論の可能性を解き放ちます。
- 参考スコア(独自算出の注目度): 80.73561460934809
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Unified multimodal object tracking has achieved remarkable robustness by leveraging complementary sensor data (e.g., RGB, Thermal, Depth), yet the heavy computational burden of state-of-the-art models hinders their deployment on resource-constrained edge devices. In this work, we identify the prediction head as a critical but often overlooked efficiency bottleneck. By strategically streamlining the decoder architecture, we unlock the potential for real-time inference but simultaneously introduce a capacity gap between the lightweight student and the heavy teacher. To resolve this, we conduct a systematic analysis of 17 distillation strategies and introduce a Dual-Alignment Distillation framework. Our key insight is that effective compression requires decoupling knowledge transfer into two complementary streams: (1) Spatial Representation Alignment, which employs feature distillation to sharpen the student's spatial focus on foreground targets ("Where to track"); and (2) Semantic Distribution Alignment, which utilizes logit-based distillation to align decision boundaries and transfer discriminative dark knowledge ("What to track"). Extensive experiments across five benchmarks demonstrate that our approach significantly outperforms complex state-of-the-art methods. Notably, our distilled model achieves 91.5% MPR on RGBT234 and operates at 54 FPS on a single RTX 4090, representing a 5x speedup over the teacher model while maintaining superior accuracy.
- Abstract(参考訳): 統一マルチモーダル物体追跡は、補完センサデータ(例えば、RGB、熱、深さ)を活用することで、顕著な堅牢性を実現しているが、最先端モデルの計算負担は、リソース制約されたエッジデバイスへの展開を妨げる。
本研究では,予測ヘッドを重要かつ見落とされがちな効率ボトルネックとして認識する。
デコーダアーキテクチャを戦略的に合理化することにより、リアルタイム推論の可能性は解放されるが、同時に軽量な生徒と重大教師の間にキャパシティギャップがもたらされる。
そこで本研究では,17の蒸留法を体系的に分析し,Dual-Alignment Distillationフレームワークを導入する。
本研究のキーポイントは,(1) 空間的適応(Spatial Representation Alignment),(2) 前景的目標(Where to Track)に着目した特徴蒸留(Spatial Representation Alignment),(2) 対数に基づく蒸留(Semantic Distribution Alignment)による意思決定境界の整合と識別的ダークナレッジ(What to Track)の伝達,という2つの相補的ストリームへの知識伝達の分離である。
5つのベンチマークによる大規模な実験により、我々の手法は複雑な最先端手法よりも大幅に優れていることが示された。
特に,RGBT234では91.5%のMPRが達成され,RTX 4090では54FPSで動作し,教師モデルの5倍の高速化を実現した。
関連論文リスト
- P2Fusion: Prompt-based Progressive Infrared-Visible Image Fusion via Dual-Prior Distillation [73.147281449267]
我々は、赤外線可視画像融合を再構成する事前誘導蒸留に基づくフレームワークであるP2Fusionを提案する。
ハードコードされたペナルティを課す代わりに、画像固有の先例、熱塩分率、空間的品質を学習可能な動的レギュレータに蒸留する。
P2Fusionは5つのベンチマークで20の主要評価指標のうち14で最先端の結果を達成する。
論文 参考訳(メタデータ) (2026-08-13T10:09:49Z) - Dual-branch Distilled Transformer for Efficient Asymmetric UAV Tracking [34.13651852483772]
EATrackは教師が指導するUAV追跡のための二重分岐蒸留戦略である。
生徒に強い対象表現を学習させることで、表現の弱さを補う。
5つのUAVベンチマークの実験では、EATrackは精度と速度のバランスが良好であることが示されている。
論文 参考訳(メタデータ) (2026-05-27T06:20:13Z) - DualGazeNet: A Biologically Inspired Dual-Gaze Query Network for Salient Object Detection [52.32976488996896]
我々はDualGazeNetを紹介した。DualGazeNetは、純粋なトランスフォーマーフレームワークで、有能なオブジェクト検出を行う。
5つのRGBベンチマークの実験によると、DualGazeNetは25の最先端CNNとTransformerベースのメソッドを一貫して上回っている。
論文 参考訳(メタデータ) (2025-11-24T08:08:22Z) - Knowledge Distillation: Enhancing Neural Network Compression with Integrated Gradients [0.0]
本稿では,知識蒸留(KD)と統合勾配(IG)を併用した機械学習フレームワークを提案する。
本稿では,教師モデルから事前計算されたIGマップを訓練画像上にオーバーレイして,コンパクトな学生モデルを重要な特徴表現へ導く,新たなデータ拡張戦略を提案する。
CIFAR-10の実験は,本手法の有効性を実証している: MobileNet-V2 教師の4.1倍圧縮した学生モデルでは,標準の 91.4% と従来の KD アプローチを上回り,分類精度92.5% を達成し,推論遅延を 140 ms から 13 ms-a 10fold に低減した。
論文 参考訳(メタデータ) (2025-03-17T10:07:50Z) - TinyR1-32B-Preview: Boosting Accuracy with Branch-Merge Distillation [19.938309176933902]
本稿では, モデル圧縮を2相で促進するブランチ・マージ蒸留法を提案する。
我々は,DeepSeek-R1を教師とし,DeepSeek-R1-Distill-Qwen-32Bを学生として蒸留アプローチを検証する。
合併したTinyR1-32B-Previewは、複数のベンチマークでDeepSeek-R1-Distill-Qwen-32Bを上回った。
論文 参考訳(メタデータ) (2025-03-06T16:25:53Z) - CLEAR: Conv-Like Linearization Revs Pre-Trained Diffusion Transformers Up [64.38715211969516]
CLEARと呼ばれる畳み込み型ローカルアテンション戦略を導入し,各クエリトークンの周囲のローカルウィンドウに特徴的インタラクションを限定する。
実験により,10K反復で10Kの自己生成サンプルに注意層を微調整することにより,事前学習したDiTから線形複雑度のある学生モデルへの知識伝達を効果的に行うことができた。
論文 参考訳(メタデータ) (2024-12-20T17:57:09Z) - Learning Lightweight Object Detectors via Multi-Teacher Progressive
Distillation [56.053397775016755]
本稿では,教師検出器の知識を学生に段階的に伝達する,知識蒸留への逐次的アプローチを提案する。
私たちの知識を最大限に活用するために、私たちはTransformerベースの教師検出器から、畳み込みベースの学生まで、初めて知識を抽出しました。
論文 参考訳(メタデータ) (2023-08-17T17:17:08Z) - Efficient Visual Fault Detection for Freight Train Braking System via
Heterogeneous Self Distillation in the Wild [8.062167870951706]
本稿では,検出精度と速度を確保するため,不均一な自己蒸留フレームワークを提案する。
我々は,学習効率を向上させるために,ラベル付近の値にネットワークを集中させる新たな損失関数を用いる。
我々のフレームワークは毎秒37フレーム以上を達成でき、従来の蒸留法と比較して高い精度を維持することができる。
論文 参考訳(メタデータ) (2023-07-03T01:27:39Z) - G-DetKD: Towards General Distillation Framework for Object Detectors via
Contrastive and Semantic-guided Feature Imitation [49.421099172544196]
そこで本研究では,すべてのピラミッドレベルにまたがる特徴ペア間のソフトマッチングを自動的に行う,意味誘導型特徴模倣手法を提案する。
また,異なる特徴領域間の関係で符号化された情報を効果的に捉えるために,コントラスト蒸留を導入する。
本手法は,(1)フレームワークのコンポーネントを別々に使用した場合に,既存の検出KD技術よりも優れた性能を発揮する。
論文 参考訳(メタデータ) (2021-08-17T07:44:27Z) - Knowledge Distillation Meets Self-Supervision [109.6400639148393]
知識蒸留では、教師ネットワークから「暗黒の知識」を抽出し、学生ネットワークの学習を指導する。
一見異なる自己超越的なタスクが、単純だが強力なソリューションとして機能することを示します。
これらの自己超越信号の類似性を補助的タスクとして活用することにより、隠された情報を教師から生徒に効果的に転送することができる。
論文 参考訳(メタデータ) (2020-06-12T12:18:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。