論文の概要: SEAL: Mixture-Closed Additive Reconstruction and Refinement-Aware Expert Routing for Efficient Speech Separation
- arxiv url: http://arxiv.org/abs/2610.07047v1
- Date: Mon, 05 Oct 2026 02:22:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.533754
- Title: SEAL: Mixture-Closed Additive Reconstruction and Refinement-Aware Expert Routing for Efficient Speech Separation
- Title(参考訳): SEAL: 効率的な音声分離のための混合クローズド付加合成法と補充型エキスパートルーティング
- Abstract要約: 本稿では,SEAL (Sparse Expert routing with Additive Latent reconstruction) を提案する。
再構成のために、局所混合振幅で束縛されたゼロサム加法的残差は、推定をゼロにする。
ルーティングのために、音響的およびステップ間エビデンスから構築されたクエリは、各トークンを6つの残留専門家のうちの1つに送信する。
EchoSetでは、SEAL(小)がTIGER(小)を28%、MACが2.9倍、SEAL(大)がTIGER(大)の0.07dB SI-SDRiを3.1倍で上回る。
- 参考スコア(独自算出の注目度): 4.536998653366956
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Compact time-frequency separators that mask the mixture and refine through a shared cell face two limits. First, a bounded multiplicative mask only scales a mixture bin, so where overlapping components cancel, the estimate stays small. Second, a shared cell applies the same weights to every time-frequency token at every step, so enlarging it adds compute everywhere. We present SEAL (Sparse Expert routing with Additive Latent reconstruction) to address both. For reconstruction, a zero-sum additive residual bounded by the local mixture amplitude lets estimates be nonzero where components cancel yet still sum to the mixture. For routing, a query built from acoustic and inter-step evidence sends each token to one of six residual experts, and a norm cap keeps the step cue from overriding clear acoustic evidence. On EchoSet, SEAL (small) surpasses TIGER (small) by 0.31 dB SI-SDRi with 28% fewer parameters and 2.9 times fewer MACs, and SEAL (large) is within 0.07 dB SI-SDRi of TIGER (large) at 3.1 times fewer MACs.
- Abstract(参考訳): 混合物を遮蔽し、共有セルを通して精製する小型の時間周波数セパレータは、2つの限界に直面している。
第一に、有界乗法マスクは混合ビンのみをスケーリングするので、重なり合うコンポーネントがキャンセルされた場合、見積もりは小さいままである。
第2に、共有セルは各ステップ毎の時間周波数トークンに同じ重みを付与するので、計算を至る所で増やすことができる。
本稿では,SEAL (Sparse Expert routing with Additive Latent reconstruction) を提案する。
復元のためには、局所混合振幅で束縛されたゼロサム加法的残差は、成分が取り消されながら混合に合計されるゼロでないものと見積もることができる。
ルーティングのために、音響的およびステップ間証拠から構築されたクエリは、各トークンを6人の残留専門家の1人に送信し、標準キャップは、ステップキューが明確な音響的証拠を覆うのを防ぐ。
EchoSetでは、SEAL(小)がTIGER(小)を28%、MACが2.9倍、SEAL(大)がTIGER(大)の0.07dB SI-SDRiを3.1倍で上回る。
関連論文リスト
- Measuring Learned Monotone Temporal Aggregation at Matched Admissibility [1.0152838128195467]
リスクレギュレーションはスコアに方向性の制約を課します。
配置されたパイプライン -- 手作りのモノトーンアグリゲーション -- は、すでに構成によってそれを満足している。
代わりに、私たちは、両方の側面に固定された許容性を保持し、アグリゲーションの価値を何を学ぶかを測定します。
論文 参考訳(メタデータ) (2026-10-04T13:09:01Z) - Fiona: Accelerating FHE Inference with Packing-Aware Ternary Weights [13.428037300225435]
第三次量子化はマルチプリカチオンを加算と減算で置き換えることができるが、蓄えが充填された実行下では実現されることは滅多にない。
FIONAは、所定のパッキングレイアウト内で重みを選択的にテナライズするオフラインモデルである。
VGG11、ViT、BERTでは、FIONAはPMult操作を53.4-79.5%削減し、エンドツーエンドの暗号化推論を2.38x、1.68x、1.84xで高速化する。
論文 参考訳(メタデータ) (2026-09-28T15:03:10Z) - Mask-Induced Displacement in Audio XAI via Logit Trajectory Decomposition [0.3181700357675698]
摂動に基づくXAI手法は、スペクトル領域をマスキングし、保持信号に対する出力変化を信用することで特徴的重要性を推定する。
この仮定を検討するために,ロジト空間軌道分解法を提案する。
論文 参考訳(メタデータ) (2026-09-27T11:53:57Z) - DRSR: Learning Set-Level Deletion Risk for Efficient Long-Horizon Agents [55.84813053778976]
ロングホライゾン言語モデルエージェントは、現在の決定と関係が変化する推論の痕跡、ツール交換、観察を蓄積する。
直接セットリスクスコアは、削除セットの選択としてエージェント履歴圧縮リスクを定式化する。
メカニカル・アナリシスとアブリケーションは、決定に制約のある関係、保持されたコンテキスト情報、ペア・インタラクション、および棄権がそれぞれ信頼できるプルーニングに寄与していることを示している。
論文 参考訳(メタデータ) (2026-09-23T03:06:01Z) - HEAT: Faster Fully Homomorphic Inference via Approximations-Weights Co-Adaptation [56.14416807766864]
同型暗号化により、サーバは暗号化されたユーザープロンプト上で言語モデルを直接実行することができる。
既存のアプローチでは、各サイトのエラー許容度を調整するのではなく、モデル全体のイテレーションカウントを均一に修正する。
非線形反復回数を学習可能にする微調整法であるHAT(Hymomorphic Encryption-Aware Training)を導入する。
論文 参考訳(メタデータ) (2026-09-01T18:02:02Z) - Support Operation Factorization: Compositional Readout of Frozen Vision Encoders under Controlled Interventions [87.95757610455173]
我々は、x演算グリッドとSO-OPFをサポートするために、インジェクティブに整合した残余セルアウトプロトコルを導入する。
グリッドが分かっているときにキャリアがホールドアウトバインディングを構成するかどうか、フラットなセルラベルからグリッドを回収できるかどうかという2つの質問を分離する。
論文 参考訳(メタデータ) (2026-08-06T15:38:55Z) - Intrinsic-Noise Consolidation: A Doob-Barrier-Conditioned Diffusion Turns Analog Device Noise into a Continual-Learning Resource [0.0]
アナログニューロモルフィックハードウェアでは、固有のデバイスノイズは通常精度税である。
シングルヘッドのスプリット-MNIST (8シード)ルールでは、最適な内部で保持率10.9ポイントを上昇させる。
実際のBrainScaleS-2(オンチップ平均化による追加的、トライアル・ツー・トライアル・インディペンデント、チューナブル)の固有ノイズを測定し、トレーニングループのノイズでチップ上でルールを実行する。
論文 参考訳(メタデータ) (2026-07-08T02:38:02Z) - Attention-Discounted Adaptive Sampler for Masked Diffusion Language Models [59.51249894128724]
マスク付き拡散言語モデルは、反復を識別するごとに複数のトークンを明らかにすることで推論ステップを削減することができる。
パラレルマスク拡散復号法のためのトレーニング不要な復号法であるADASを提案する。
論文 参考訳(メタデータ) (2026-06-09T13:17:27Z) - SparseSAM: Structured Sparsification of Activations in Segment Anything Models [26.589924688727795]
Segment Anything Model (SAM)は強力なオープン語彙セグメンテーションを実現するが、ViTベースの画像エンコーダは遅延推論とメモリを支配している。
SparseSAMは,トークンの識別を保ちながら注意と層を協調的に加速する訓練不要のスペーシフィケーションフレームワークである。
4つのセグメンテーションベンチマークで、SparseSAMは密度が0.004 mIoU、0.3が0.021 mIoU、精度が2.10倍、トークンマージの進歩が2.10倍、推論が2.8倍、メモリが2.8倍である。
論文 参考訳(メタデータ) (2026-05-17T19:54:22Z) - Diffusion-Guided Mask-Consistent Paired Mixing for Endoscopic Image Segmentation [57.37991748282666]
本稿では, 試料混合と拡散合成の強度を融合した拡散誘導型パラダイムを提案する。
各実画像について、合成対を同じマスクの下で生成し、その対をマスク一貫性ペアドミキシング(MCPMix)の制御可能な入力として使用する。
これは、共有幾何学の下で合成および実際の外観を円滑にブリッジする中間サンプルの連続的な族を生成する。
論文 参考訳(メタデータ) (2025-11-05T06:14:19Z) - BatchEnsemble: An Alternative Approach to Efficient Ensemble and
Lifelong Learning [46.768185367275564]
BatchEnsembleは、一般的なアンサンブルよりも計算コストとメモリコストが大幅に低いアンサンブル法である。
BatchEnsembleは、典型的なアンサンブルとして、競争の正確さと不確実性をもたらすことを示す。
また、生涯学習にBatchEnsembleを適用し、Split-CIFAR-100では、BatchEnsembleはプログレッシブニューラルネットワークと同等のパフォーマンスを得る。
論文 参考訳(メタデータ) (2020-02-17T00:00:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。