論文の概要: Cumsum-Composable Phase Transport for Low-Cost Streaming Keyword Spotting
- arxiv url: http://arxiv.org/abs/2607.20086v1
- Date: Wed, 22 Jul 2026 12:36:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.076498
- Title: Cumsum-Composable Phase Transport for Low-Cost Streaming Keyword Spotting
- Title(参考訳): 低コストストリーミングキーワードスポッティングのための累積分解相輸送
- Abstract要約: キーワードスポッティングのためのストリーミングネイティブ時間層であるcumsum-composable phase transportについて検討した。
12のラベルを持つGoogle Speech Commands v2では、mel+cumsumモデルはコンパクトなベースラインと競合する精度を維持している。
一致したcumsum-versus-Pool-scanベンチマークでは、cumsum+windowは94.82%対94.33%と同等の精度を示し、1.07倍高速でトレーニングし、Tesla T4ではシングルサンプルのレイテンシを7.09msから5.01msに短縮した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: State-space sequence models are attractive for streaming speech because they maintain compact recurrent state, but scan-style training kernels can have unfavorable constants for short audio tasks. We study cumsum-composable phase transport, a streaming-native temporal layer for keyword spotting. Each layer projects acoustic frames to complex channels, transports them by learned unitary rotations, accumulates a finite window using prefix differences, and applies a gated residual update. The same prefix representation gives exact batched training with ordinary cumulative sums and exact online inference with one prefix update per frame. Unitary transport is the key constraint: inverse rotations have norm one, keeping prefix terms well conditioned while memory is supplied by windows or block readouts. On Google Speech Commands v2 with 12 labels, mel+cumsum models retain competitive accuracy with compact baselines. The strongest single-seed run reaches 97.3\% test accuracy; a 51.6K-parameter tied model also reaches 97.3\%, and a 24.8K tied model reaches 96.8\% versus 97.1\% for a 25.6K MelCNNMaxPool baseline. In a matched cumsum-versus-scan benchmark, cumsum+window gives comparable accuracy, 94.82\% versus 94.33\%, while training 1.07x faster and reducing single-example latency from 7.09 ms to 5.01 ms on a Tesla T4. These results support cumsum phase transport as a simple low-cost temporal primitive for streaming keyword spotting.
- Abstract(参考訳): 状態空間シーケンスモデルは、コンパクトなリカレント状態を維持するため、ストリーミング音声には魅力的であるが、スキャンスタイルのトレーニングカーネルは、短いオーディオタスクに対して好ましくない定数を持つことができる。
キーワードスポッティングのためのストリーミングネイティブ時間層であるcumsum-composable phase transportについて検討した。
各層は、複雑なチャネルに音響フレームを投影し、学習したユニタリ回転によってそれらを転送し、プレフィックス差を使って有限ウィンドウを蓄積し、ゲートされた残差更新を適用する。
同じプレフィックス表現は、通常の累積和による正確なバッチトレーニングと、フレーム毎に1つのプレフィックス更新による正確なオンライン推論を提供する。
逆回転は標準の1つを持ち、メモリがウィンドウやブロックの読み出しによって供給される間にプレフィックス項を適切に条件付けする。
12のラベルを持つGoogle Speech Commands v2では、mel+cumsumモデルはコンパクトなベースラインと競合する精度を維持している。
最強の単座ランは97.3\%のテスト精度に達し、51.6Kパラメトリック・タイドモデルも97.3\%に達し、24.8Kタイドモデルも96.8\%に達したが、25.6K MelCNNMaxPoolベースラインでは97.1\%に達した。
一致したcumsum-versus-scanベンチマークでは、cumsum+windowは94.82\%対94.33\%と同等の精度を示し、1.07倍高速にトレーニングし、シングルサンプルのレイテンシをTesla T4で7.09msから5.01msに短縮した。
これらの結果は、ストリーミングキーワードスポッティングのための単純な低コストの時間的プリミティブとして、累積位相輸送をサポートする。
関連論文リスト
- On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - ALPHABET: A Laplace-Pole History Aggregator with Banked Exponential Transport [5.451464789025205]
本稿では、時間履歴を安定な複素極モードに圧縮するコンパクト線形時間モデルALPHABETを紹介する。
固定82タスクレジストリ全体で、ALPHABETは10家族比較の平均ランク3.97に達した。
共通幅のD=64アンカーでは、6,437のパラメータは平均で5.02倍の推論と3.93倍の完全なトレーニングステップを提供する。
論文 参考訳(メタデータ) (2026-08-25T04:20:19Z) - BF1: A Causal Dyadic Sparse-Attention Retrofit for Efficient Long-Context Transformers [0.0]
本研究では,小面積の局所的近傍,大域的な第1ブロック,および対数的に空間化された歴史的ブロックを結合したブロックアライン・ダイアルド・スパース・アテンション経路について検討する。
最適化されたBF16の実装は、2Kトークンと4Kトークンの間で高い注意を払い、32Kで1層あたり10.91倍のプリフィルスピードアップに達する。
本稿では,数値的正当性,選択相互作用スケーリング,カーネル性能,部分モデル言語モデリング,および一致した次世代言語モデリングについて検討する。
論文 参考訳(メタデータ) (2026-08-19T18:35:12Z) - FreyaTTS Technical Report [0.0]
本稿では,Freya-TTSについて紹介する。
AudioVAE2(16kHzのエンコード、48kHzのデコード)の凍結した連続潜伏空間で動作し、モデルがテキストからラテントマッピングに集中できるようにしている。
バンドマッチングワードエラー率(WER)は8.0%、文字エラー率(CER)は3.0%で、かなり大きなオープンソースシステムより優れています。
論文 参考訳(メタデータ) (2026-07-10T15:36:30Z) - Pushing the Limits of On-Device Streaming ASR: A Compact, High-Accuracy English Model for Low-Latency Inference [5.685908474026849]
エッジデバイス上での高品質な自動音声認識(ASR)は、GPUアクセラレーションなしでCPUで完全に動作している間に、精度、レイテンシ、メモリフットプリントを共同で最適化するモデルを必要とする。
我々は,エンコーダデコーダ,トランスデューサ,LDMベースのパラダイムを包含し,バッチ,チャンク,ストリーミング推論モードで評価する,最先端のASRアーキテクチャの体系的研究を行った。
推奨構成であるint4 k-quant変種は、8つの標準ベンチマークで平均8.20%のストリーミングWERを実現し、0.56秒のアルゴリズムレイテンシでCPU上でのリアルタイムよりも快適に動作します。
論文 参考訳(メタデータ) (2026-04-16T00:04:32Z) - Small Vision-Language Models are Smart Compressors for Long Video Understanding [73.65465038390771]
長時間のビデオ理解は、欲求に満ちたコンテキストではなく、意図駆動の効率に頼っている。
本稿では,下流の理解のために長い動画を圧縮する効率的なクエリ認識フレームワークであるTempoを提案する。
テストでは、Tempoが1時間のビデオを理論的限界以下に圧縮し、真のロングフォームビデオ理解が意図駆動の効率に依存することを示した。
論文 参考訳(メタデータ) (2026-04-09T11:40:25Z) - Speed is Confidence [1.2720220587982818]
入賞回路とタイム・ツー・ファースト・スパイク・コーディングは、ニューロンが自信の表現として発火する時に暗黙的に扱う。
この原理をTiny Recursive Models (TRM) のアンサンブルに適用する。
Sudoku-Extremeでは、ストップファーストの選択は、確率平均化の91%に対して97%の精度を達成する。
論文 参考訳(メタデータ) (2026-01-27T01:43:59Z) - Activation Steering for Chain-of-Thought Compression [4.825037489691159]
Activation-Steered Compression (ASC) は、隠れた表現を直接修正することで、推論トレースを短縮する推論時間技術である。
我々は, 冗長な英語重のCoTと簡潔な数学中心のCoTが, モデルの残差ストリーム活性化空間の異なる領域を占めることを観察した。
トレーニング不要の方法として、ASCは無視可能なオーバーヘッドを導入し、MATH500では、エンドツーエンドのウォールクロック実行時に平均2.73倍のスピードアップを提供する。
論文 参考訳(メタデータ) (2025-07-07T08:16:54Z) - ParallelComp: Parallel Long-Context Compressor for Length Extrapolation [51.68913021512016]
超長い文脈(テキスト長 >128K)の補間は、大きな言語モデル(LLM)にとって大きな課題である。
本研究では,メモリボトルネックを効果的に克服する並列長コンテキスト圧縮手法であるParallelCompを提案する。
チャンクスループットが1.76倍向上し、プリフィル段階では23.50倍の高速化を実現し、性能損失を無視できる。
論文 参考訳(メタデータ) (2025-02-20T07:10:43Z) - Training-Free Exponential Context Extension via Cascading KV Cache [49.608367376911694]
カスケードサブキャッシュバッファを利用して,最も関連性の高いトークンを選択的に保持する機構を導入する。
本手法は,1Mトークンのフラッシュアテンションと比較して,プリフィルステージ遅延を6.8倍削減する。
論文 参考訳(メタデータ) (2024-06-24T03:59:17Z) - Prune Spatio-temporal Tokens by Semantic-aware Temporal Accumulation [89.88214896713846]
STAスコアは、時間的冗長性と意味的重要性の2つの重要な要因を考慮に入れている。
市販のビデオトランスフォーマーとビデオウィンにSTAモジュールを適用する。
結果: Kinetics-400 と something-Something V2 は 30% のオーバーシェルフ削減を実現し,0.2% の精度低下を実現した。
論文 参考訳(メタデータ) (2023-08-08T19:38:15Z) - FastEmit: Low-latency Streaming ASR with Sequence-level Emission
Regularization [78.46088089185156]
ストリーム自動音声認識(ASR)は、仮説化された単語を可能な限り迅速かつ正確に出力することを目的としている。
既存のアプローチでは、シーケンストランスデューサモデルにおいて、トーケン単位またはフレーム単位の確率予測を演算することで、発光遅延をペナルティ化する。
本稿では,訓練用トランスデューサモデルにおいて,シーケンス毎の確率に遅延正規化を直接適用する,FastEmitというシーケンスレベルのエミッション正規化手法を提案する。
論文 参考訳(メタデータ) (2020-10-21T17:05:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。