論文の概要: Design of the IBM Granite 5.0 TurboCTC ASR Model
- arxiv url: http://arxiv.org/abs/2609.20104v1
- Date: Thu, 17 Sep 2026 12:05:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:54.25339
- Title: Design of the IBM Granite 5.0 TurboCTC ASR Model
- Title(参考訳): IBM Granite 5.0 TurboCTC ASRモデルの設計
- Abstract要約: 本稿では,Granite 5.0 Turbo CTCのアーキテクチャ,トレーニング方法論,推論高速化について述べる。
このアーキテクチャは、ストライドドディープワイド畳み込みを用いて、コンフォーマーブロック内のピラミッド時間サブサンプリングを使用する。
推論のスピードアップには、1 x 1の畳み込みを線形層に置き換え、コンフォーマーブロックの注意を最適化することが含まれる。
- 参考スコア(独自算出の注目度): 33.82903264755239
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: We describe the architecture, training methodology and inference speedups of Granite 5.0 Turbo CTC, a 470 million parameter encoder-only model with an excellent speed-accuracy tradeoff. The architecture uses pyramidal temporal subsampling within Conformer blocks using strided depthwise convolutions, block-diagonal (chunk-wise) self-attention, and conditioning on intermediate predictions from the middle layer. Training highlights are the use of only publicly available data, the novel use of a Muon optimizer, and balanced data sampling. Inference speedups include replacing 1 x 1 convolutions with linear layers and optimizing the attention computation in the Conformer blocks. Collectively, these result in a model that is on the speed-accuracy Pareto frontier of the Open ASR leaderboard for English short-form ASR while being twice as fast as the fastest competitor. The model can be used under a permissive license and downloaded from https://huggingface.co/ibm-granite/granite-speech-5.0-470m-turboctc.
- Abstract(参考訳): 本稿では,Granite 5.0 Turbo CTCのアーキテクチャ,トレーニング手法,推論高速化について述べる。
このアーキテクチャでは、コンフォーマーブロック内のピラミッドの時間的サブサンプリングに、ストライドされた深さ方向の畳み込み、ブロック対角(チャンクワイド)自己アテンション、中間層からの中間予測の条件付けを用いる。
トレーニングハイライトは、公開データのみの使用、Muonオプティマイザの新規使用、バランスの取れたデータサンプリングである。
推論のスピードアップには、1 x 1の畳み込みを線形層に置き換え、コンフォーマーブロックの注意計算を最適化することが含まれる。
まとめると、これらはイングランドのショートフォームASRのオープンASRリーダーボードのスピード精度のParetoフロンティアにあるモデルであり、最速のライバルの2倍の速度である。
このモデルはパーミッシブライセンスで使用でき、https://huggingface.co/ibm-granite/granite-speech-5.0-470m-turboctcからダウンロードできる。
関連論文リスト
- HEAT: Faster Fully Homomorphic Inference via Approximations-Weights Co-Adaptation [56.14416807766864]
同型暗号化により、サーバは暗号化されたユーザープロンプト上で言語モデルを直接実行することができる。
既存のアプローチでは、各サイトのエラー許容度を調整するのではなく、モデル全体のイテレーションカウントを均一に修正する。
非線形反復回数を学習可能にする微調整法であるHAT(Hymomorphic Encryption-Aware Training)を導入する。
論文 参考訳(メタデータ) (2026-09-01T18:02:02Z) - DiffusionGemma Technical Report [72.10570774996219]
DiffusionGemma(ディフュージョン・ジェマ)は、離散拡散を用いてテキストを生成する言語モデルである。
DiffusionGemmaは、一度に1つのトークンをデコードする代わりに、256個のトークンのブロックを並列に繰り返し洗練する。
私たちの計算効率の良い2段階トレーニングパイプラインは、開始したARモデルの総トレーニングトークン予算の10%未満を使用します。
論文 参考訳(メタデータ) (2026-07-31T16:11:46Z) - Memory-Efficient Acceleration of Block Low-Rank Foundation Models on Resource Constrained GPUs [11.45717904490388]
トランスフォーマーベースの基盤モデルの最近の進歩は、多くのタスクのデフォルト選択となった。
その急速に成長するサイズは、単一のGPUに完全なモデルを適合させることがますます難しくなり、計算コストが禁じられる。
ブロック低ランク(BLR)圧縮技術は、重み行列のコンパクト表現を学習することでこの問題に対処する。
論文 参考訳(メタデータ) (2025-12-24T00:41:13Z) - Fast and Accurate Causal Parallel Decoding using Jacobi Forcing [41.89066334075016]
Jacobi Forcingはプログレッシブ蒸留パラダイムであり、モデルが独自の並列復号軌道で訓練される。
我々は,複数ブロックの復号化とリジェクション・リサイクリングを導入し,最大4.5倍高いトークン受入数と4.0倍のウォールクロック・スピードアップを実現した。
論文 参考訳(メタデータ) (2025-12-16T18:45:18Z) - Fast-dLLM v2: Efficient Block-Diffusion LLM [64.38006546510337]
Fast-dLLM v2はブロック拡散言語モデルで、訓練済みのARモデルをdLLMに適応して並列テキストを生成する。
これは、Dream(580Bトークン)のようなフルアテンション拡散LDMと比較して、トレーニングデータの500倍の減少を示す。
論文 参考訳(メタデータ) (2025-09-30T14:40:18Z) - Next Tokens Denoising for Speech Synthesis [51.320443764269726]
Dragon-FMは、ARとフローマッチングを統合する新しいテキスト音声(TTS)設計である。
毎秒12.5トークンのコンパクトレートで48kHzのオーディオトークンをチャンクで処理する。
ポッドキャストデータセットの実験では、高品質なゼロショットポッドキャストを効率的に生成できることが示されている。
論文 参考訳(メタデータ) (2025-07-30T15:03:36Z) - DiPaCo: Distributed Path Composition [31.686642863608558]
本稿では,機械学習モデルのためのモジュールアーキテクチャとトレーニングアプローチを提案する。
トレーニング中、DiPaCoは共有モジュールのセットを通じてパスで配布する。
推論時には、モデル圧縮を必要とせずに、各入力に対して1つのパスだけを実行する必要がある。
論文 参考訳(メタデータ) (2024-03-15T18:26:51Z) - Unified Streaming and Non-streaming Two-pass End-to-end Model for Speech
Recognition [19.971343876930767]
ストリーミングと非ストリーミングエンドツーエンド(E2E)音声認識を1つのモデルで統一する,新たな2パス方式を提案する。
本モデルでは,エンコーダのコンフォメータ層を改良したハイブリッドCTC/アテンションアーキテクチャを採用している。
オープンな170時間AISHELL-1データセットの実験により、提案手法はストリーミングモデルと非ストリーミングモデルを簡便かつ効率的に統一できることを示した。
論文 参考訳(メタデータ) (2020-12-10T06:54:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。