論文の概要: TF-MoE: Time-Frequency Mixture-of-Experts for Efficient Speech Separation
- arxiv url: http://arxiv.org/abs/2606.29575v2
- Date: Tue, 30 Jun 2026 02:02:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 13:50:27.723687
- Title: TF-MoE: Time-Frequency Mixture-of-Experts for Efficient Speech Separation
- Title(参考訳): TF-MoE:効率的な音声分離のための周波数混合実験
- Authors: Qinzhe Hu, Chenda Li, Wangyou Zhang, Shujie Liu, Yan Lu, Yanmin Qian,
- Abstract要約: TF-MoEはSparse Mixture-of-Experts (MoE)フレームワークであり、ほぼ推論コストの増加なしにモデルのキャパシティを向上させる。
TF-MoEは、Melt-band-splitting Conformerのバックボーン上に構築され、低スループット設定下でのSSタスク上での強力なパフォーマンスを実現する。
- 参考スコア(独自算出の注目度): 67.0560531282185
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in speech separation (SS) have led to compact front-end models with small parameter sizes, yet their high computational cost remains a major barrier for deployment on edge devices. To address this, we propose TF-MoE, a sparse Mixture-of-Experts (MoE) framework that enhances model capacity with almost no increase in inference cost. Our method introduces dynamic expert specialization in time and frequency dimensions through alternating time-wise and frequency-wise MoE modules, each dynamically selecting experts per frame or mel band. Built upon a mel-band-splitting Conformer backbone, TF-MoE achieves strong performance on SS tasks under low-compute settings. Experimental results demonstrate that TF-MoE consistently improves separation performance under computation cost constraints, outperforming BSRNN by +3.8 dB SDR on Libri2Mix with comparable 4.1 GMACs/s inference cost. This positions TF-MoE as a promising candidate for edge-device deployment.
- Abstract(参考訳): 音声分離(SS)の最近の進歩は、小さなパラメータサイズを持つコンパクトなフロントエンドモデルに繋がっているが、その高い計算コストは、エッジデバイス上でのデプロイメントにおいて大きな障壁となっている。
提案するTF-MoEは,モデルキャパシティを向上し,推論コストがほとんど増加しないスパース・ミックス・オブ・エクササイズ(MoE)フレームワークである。
本手法では,時間的および周波数的MoEモジュールを交互に組み合わせて,時間的・周波数的な専門家の専門化を行う。
TF-MoEは、Melt-band-splitting Conformerのバックボーン上に構築され、低スループット設定下でのSSタスク上での強力なパフォーマンスを実現する。
実験の結果、TF-MoEは計算コスト制約下での分離性能を一貫して改善し、BSRNNを4.1 GMAC/sの推論コストでLibri2Mix上で+3.8 dB SDRで上回った。
これによりTF-MoEはエッジデバイスデプロイメントの候補として期待できる。
関連論文リスト
- DOT-MoE: Differentiable Optimal Transport for MoEfication [11.183649354845885]
DOT-MoEは、高密度層の分解を微分可能な最適輸送問題として定式化する新しいフレームワークである。
我々は,DOT-MoEが構造化プルーニング,クラスタリング,ランダムスプリットベースラインを著しく上回ることを示した。
論文 参考訳(メタデータ) (2026-06-01T04:19:16Z) - DAG-MoE: From Simple Mixture to Structural Aggregation in Mixture-of-Experts [56.175408382091796]
本研究では, 標準重み付け集約を構造集約に置き換えることにより, 専門家やルータを変更することなく, 専門家合成空間を拡大することを示す。
DAG-MoEは軽量モジュールを用いて,選択した専門家の最適な集約構造を自動的に学習するスパースMoEフレームワークである。
論文 参考訳(メタデータ) (2026-05-31T07:08:16Z) - ZipMoE: Efficient On-Device MoE Serving via Lossless Compression and Cache-Affinity Scheduling [56.88966608455977]
ZipMoEはエッジデバイスのハードウェア特性とMoEパラメータ固有の統計的冗長性との相乗効果を利用する。
ZipMoEは72.77%の推論遅延低減と6.76タイムのスループットを実現している。
論文 参考訳(メタデータ) (2026-01-29T02:51:59Z) - Mixture of States: Routing Token-Level Dynamics for Multimodal Generation [60.15447534872979]
マルチモーダル拡散モデルのための新しい融合パラダイムであるMoS(Mixture of States)を紹介する。
MoSは学習可能なトークン指向ルータで、遅延時間ステップと入力依存のインタラクションを生成する。
我々は,画像のテキスト生成と編集による設計の検証を行い,その結果を得た。
論文 参考訳(メタデータ) (2025-11-15T13:24:57Z) - Pangu Ultra MoE: How to Train Your Big MoE on Ascend NPUs [111.69640966866059]
ミキチャー・オブ・エキスパート(MoE)と1兆近いパラメータを持つ疎大言語モデル(LLM)が、最も有能な言語モデルの領域を支配している。
本稿では,Ascend NPU上でそのようなスケールを利用するレシピを明らかにすることを目的としている。
主な目的は、動的スパースモデル構造下でのコンピューティングリソースのより良い使用と、実際のハードウェアで期待されるパフォーマンス向上の実現である。
論文 参考訳(メタデータ) (2025-05-07T15:46:36Z) - D$^{2}$MoE: Dual Routing and Dynamic Scheduling for Efficient On-Device MoE-based LLM Serving [14.607254882119507]
専門家(MoE)モデルの組み合わせは、大きな言語モデル(LLM)のスパース変種である。
メリットはあるものの、リソース制約のあるエッジデバイスにデプロイするにはMoEは高価すぎる。
D$2$MoEは,各専門家に最適なビット幅を動的に割り当てることで,多様なタスク要求に適合するアルゴリズム・システム協調設計フレームワークである。
論文 参考訳(メタデータ) (2025-04-17T05:37:35Z) - ResMoE: Space-efficient Compression of Mixture of Experts LLMs via Residual Restoration [61.579842548990754]
複数現象言語モデルのバックボーンであるMixture-of-Experts (MoE) Transformerは、各入力トークンに対して少数のモデルパラメータのみをアクティベートすることで、空間性を利用する。
ResMoEは、Wasserstein Barycenterを利用した革新的なMoE近似フレームワークで、共通の専門家(バリセンターエキスパート)を抽出し、このバリセンターエキスパートと元の専門家の間の残差を近似する。
論文 参考訳(メタデータ) (2025-03-10T03:15:54Z) - Efficient Fine-tuning of Audio Spectrogram Transformers via Soft Mixture of Adapters [11.05223262950967]
最近、Mixture of Experts (MoE)アーキテクチャは、計算コストを安価に保ちながらモデルの容量を拡大する能力のために、急成長を始めた。
本稿では,音響スペクトル変換器のパラメータ効率の高い微調整におけるMoEの使用を,下流の音声や音声の処理に用いていることを示す。
アダプタをエキスパートとして利用し、最近のSoft MoEメソッドを利用して、入力トークンとエキスパートの間のソフトな割り当てに依存して計算時間を制限している。
論文 参考訳(メタデータ) (2024-02-01T18:16:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。