論文の概要: VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment
- arxiv url: http://arxiv.org/abs/2607.25870v1
- Date: Tue, 28 Jul 2026 15:37:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.901648
- Title: VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment
- Title(参考訳): VAD to the bone: Ultra-Tiny Speech Activity Detection for Edge Deployment
- Abstract要約: kiloVADは、標準のMel機能、CNNのみのレイヤ、調整可能なコンテキスト/スペクトルパラメータを使った組み込み推論用に設計されている。
本稿では,QATを1~4%向上させる,自己蒸留と角度に基づく量子化学習(QAT)による階層間構造化プルーニングを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Voice activity detection (VAD) triggers downstream speech processing in always-on systems under strict memory, latency, and compute constraints. Recent compact models report strong accuracy but rely on components that are not widely supported: learnable filterbanks, recurrent layers, or non-causal post-processing. We propose kiloVAD, designed for embedded inference using standard Mel features, CNN-only layers, and tunable context/spectral parameters. We introduce per-layer structured pruning with self-distillation and angle-based quantization-aware training (QAT) that outperforms standard QAT by 1-4%. Evaluated per-frame under causal conditions, kiloVAD achieves 0.850 AUC on AVA-Speech with 2.1 k parameters and 200 ms context, establishing a new state of the art for causal, deployment-ready VAD.
- Abstract(参考訳): 音声アクティビティ検出(VAD)は、厳格なメモリ、レイテンシ、計算制約の下で、常時オンのシステムで下流の音声処理をトリガーする。
最近のコンパクトモデルは高い精度を報告しているが、広くサポートされていないコンポーネントに依存している。
我々は,標準メル特徴,CNNのみの層,調整可能なコンテキスト/スペクトルパラメータを用いた組込み推論のためのkmVADを提案する。
本稿では,QATを1~4%向上させる,自己蒸留と角度に基づく量子化学習(QAT)による階層間構造化プルーニングを提案する。
因果条件下での評価では、klVADは2.1kパラメータと200msコンテキストを持つAVA-Speech上で0.850AUCを達成する。
関連論文リスト
- Overcoming State Inertia in Full-Duplex Spoken Language Models via Activation Steering [87.43777061308658]
フル音声言語モデル(FDSLM)における予測行動の解析
FDSLMは、モデル出力生成に整合した生成状態と、ユーザ入力に整合した知覚状態の2つの状態間の内部焦点を動的に変調する。
ユーザ中断中は、モデルが知覚状態に遷移する前に生成状態に対して過渡的に偏りを保ち、入力の開始を逃す。
論文 参考訳(メタデータ) (2026-06-09T19:08:07Z) - QVAD: A Question-Centric Agentic Framework for Efficient and Training-Free Video Anomaly Detection [11.652235163237117]
ビデオ異常検出(VAD)はコンピュータビジョンにおける基本的な課題である。
本稿では,VLM-LLMインタラクションを動的対話として扱う質問中心エージェントフレームワークQVADを提案する。
QVADはメモリフットプリントを最小限にして高い推論速度を実現し、リソース制約のエッジデバイスに高度なVAD機能を提供する。
論文 参考訳(メタデータ) (2026-04-03T13:48:34Z) - From Diet to Free Lunch: Estimating Auxiliary Signal Properties using Dynamic Pruning Masks in Speech Enhancement Networks [4.219150964619931]
音声デバイスにおける音声強調(SE)は、しばしばVoice Activity Detection (VAD)、SNR推定、音響シーン分類のための補助モジュールによって支援される。
その結果,VADでは93%,ノイズ分類では84%,F0では0.86であった。
コントリビューションは2つあり、一方、下流予測タスクのレンズを通してDynCPモデルの創発的挙動を調べ、それらが何を学習しているかを明らかにし、他方、効率的なSEと同時推定のための総合解としてDynCPを再利用し、再提案する。
論文 参考訳(メタデータ) (2026-02-11T09:09:20Z) - LiQSS: Post-Transformer Linear Quantum-Inspired State-Space Tensor Networks for Real-Time 6G [85.58816960936069]
Sixth-Generation (6G) Open Radio Access Networks (O-RAN) における能動的およびエージェント的制御は、厳密なニアタイム(Near-RT)レイテンシと計算制約の下で制御グレードの予測を必要とする。
本稿では,効率的な無線テレメトリ予測のための変圧器後パラダイムについて検討する。
本稿では、自己アテンションを安定な状態空間動的カーネルに置き換える量子インスピレーション付き状態空間テンソルネットワークを提案する。
論文 参考訳(メタデータ) (2026-01-18T12:08:38Z) - DiSC-AMC: Token- and Parameter-Efficient Discretized Statistics In-Context Automatic Modulation Classification [19.190236060870184]
大規模言語モデル(LLM)は、微調整なしで、オープンセットで自動変調分類(AMC)を実行することができる。
文脈自動変調分類(DiSC-AMC)における離散統計量について述べる。
DiSC-AMCは、高次の統計と累積をコンパクトなシンボルトークンに識別するトークンおよびパラメータ効率の変種である。
論文 参考訳(メタデータ) (2025-09-30T22:20:57Z) - Thinking While Listening: Simple Test Time Scaling For Audio Classification [61.3564313676731]
本稿では,ニューラルネットワークが日常の音を聴きながら"考える"ことを可能にするフレームワークを提案する。
大規模言語モデルの推論能力の最近の進歩により、我々は2つの中心的な疑問に対処する: (i) 既存の音声分類パイプラインに思考を組み込んで、カテゴリ空間での推論を可能にし、パフォーマンスを向上させる方法、(ii) 思考とテストタイムのスケーリングの両方をサポートするために、新しいアーキテクチャをゼロから設計することができるか。
論文 参考訳(メタデータ) (2025-09-24T01:17:24Z) - Self-Supervised Speech Quality Estimation and Enhancement Using Only
Clean Speech [50.95292368372455]
ベクトル量子化変分オートエンコーダ(VQ-VAE)の量子化誤差に基づく音声評価のための自己教師付きメトリックであるVQScoreを提案する。
VQ-VAEのトレーニングはクリーン音声に依存するため、音声が歪んだときに大きな量子化誤差が期待できる。
また,ベクトル量子化機構は,自己教師付き音声強調(SE)モデルトレーニングにも有効であることがわかった。
論文 参考訳(メタデータ) (2024-02-26T06:01:38Z) - RAND: Robustness Aware Norm Decay For Quantized Seq2seq Models [14.07649230604283]
モデル精度を向上させるために,量子化意識トレーニング(QAT)プロセスに対する低複雑性な変更を提案する。
精度が向上し、ノイズベースのQATの他の利点を活用できるようになる。
論文 参考訳(メタデータ) (2023-05-24T19:45:56Z) - Unified End-to-End Speech Recognition and Endpointing for Fast and
Efficient Speech Systems [17.160006765475988]
本稿では,単一エンドツーエンド (E2E) モデルを用いて, ASR と EP タスクを協調訓練する手法を提案する。
我々は、EPにオーディオフレームを直接消費するか、ASRモデルから低レベルの潜在表現を消費するよう訓練する「スウィッチ」接続を導入する。
これにより、推論中にフレームフィルタリングを低コストで行うことができる単一のE2Eモデルが得られる。
論文 参考訳(メタデータ) (2022-11-01T23:43:15Z) - Layer Pruning on Demand with Intermediate CTC [50.509073206630994]
我々はコネクショニスト時間分類(CTC)に基づくASRの訓練と刈り取り方法を提案する。
本稿では,Transformer-CTCモデルをオンデマンドで様々な深さでプルーニングできることを示し,GPU上でのリアルタイム係数を0.005から0.002に改善した。
論文 参考訳(メタデータ) (2021-06-17T02:40:18Z) - Target-Speaker Voice Activity Detection: a Novel Approach for
Multi-Speaker Diarization in a Dinner Party Scenario [51.50631198081903]
本稿では,TS-VAD(Target-Speaker Voice Activity Detection)手法を提案する。
TS-VADは各時間フレーム上の各話者の活動を直接予測する。
CHiME-6での実験では、TS-VADが最先端の結果を得ることが示された。
論文 参考訳(メタデータ) (2020-05-14T21:24:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。