論文の概要: An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation
- arxiv url: http://arxiv.org/abs/2607.02119v1
- Date: Thu, 02 Jul 2026 12:55:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.83351
- Title: An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation
- Title(参考訳): 統合音声理解・生成のための効率的なvLLMベース推論パイプライン
- Authors: Haoran Wang, Jinchuan Tian, Siddhant Arora, Shinji Watanabe,
- Abstract要約: 音声の理解と生成を統一する vLLM ベースの推論パイプラインを提案する。
共有直観自由誘導(CFG)のスループットを克服する。
連続バッチ内でペア条件と非条件要求を共スケジューリングすることにより、CFGの実装は、非CFGスループットの80%を維持できます。
- 参考スコア(独自算出の注目度): 63.50393485685279
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While Large Multimodal Models excel in comprehension, high-throughput inference engines lack native support for multimodal generation. This is severe in Speech Language Models, where generating multi-layered audio tokens via decoupled AR+NAR or synchronous Multi-Token Prediction (MTP) with delay-pattern interleaving conflicts with standard single-stream loops. We present a vLLM-based inference pipeline for unified speech understanding and generation. We extend autoregressive decoding to natively execute delay-pattern de-interleaving and coordinated multi-stream sampling, integrating an on-GPU acoustic decoder for end-to-end waveform synthesis. Crucially, we overcome the shared intuition that Classifier-Free Guidance (CFG) halves throughput. By co-scheduling paired conditional and unconditional requests within a continuous batch, our CFG implementation sustains 80% of non-CFG throughput, absorbing dual-request and logit merging overheads. We open-source our framework.
- Abstract(参考訳): 大規模マルチモーダルモデルは理解に優れているが、高スループット推論エンジンはマルチモーダル生成のネイティブサポートを欠いている。
これは音声言語モデルにおいて重大であり、AR+NARまたは同期マルチトークン予測(MTP)によって、標準の単一ストリームループとの遅延パターンインターリーブ競合を伴う多層オーディオトークンを生成する。
音声の理解と生成を統一する vLLM ベースの推論パイプラインを提案する。
自動回帰デコードを拡張し、遅延パターンのデインターリーブと協調したマルチストリームサンプリングをネイティブに実行し、エンドツーエンドの波形合成のためのオンGPU音響デコーダを統合する。
重要なことに、分類自由誘導(CFG)のスループットが向上するという共有直感を克服しています。
連続バッチ内でペア条件と非条件要求を共スケジューリングすることにより、CFG実装は非CFGスループットの80%を維持でき、二重要求とロジットのマージオーバーヘッドを吸収します。
フレームワークをオープンソースにしています。
関連論文リスト
- Stream2LLM: Overlap Context Streaming and Prefill for Reduced Time-to-First-Token (TTFT) [2.8350851063316873]
ストリーミングコンテキスト – 推論による重なり合う検索 – は、このレイテンシを軽減することができる。
本稿では,ストリーミング対応LLMサービスシステムStream2LLMについて述べる。
論文 参考訳(メタデータ) (2026-03-29T06:49:12Z) - OmniForcing: Unleashing Real-time Joint Audio-Visual Generation [51.031726911410594]
最近のジョイントオーディオ・視覚拡散モデルは、優れた生成品質を実現するが、高いレイテンシーに悩まされる。
OmniForcingは、オフラインの双方向拡散モデルを高忠実度ストリーミングオートレジェネレータに蒸留する最初のフレームワークである。
論文 参考訳(メタデータ) (2026-03-12T08:17:36Z) - Diffusion-Driven Semantic Communication for Generative Models with Bandwidth Constraints [66.63250537475973]
本稿では,帯域制限付き生成モデルのための,高度なVAEベースの圧縮を用いた拡散駆動型セマンティック通信フレームワークを提案する。
実験の結果,ピーク信号対雑音比 (PSNR) などの画素レベルの指標と,LPIPS (Learning Perceptual Image patch similarity) のような意味的指標が大幅に改善された。
論文 参考訳(メタデータ) (2024-07-26T02:34:25Z) - Alto: Orchestrating Distributed Compound AI Systems with Nested Ancestry [18.671852079446605]
複合AIアプリケーションは、生成言語モデル、ドキュメントレトリバー、埋め込みモデルなどのサブコンポーネントをチェーンする。
複合AIシステムにおける並列性やパイプライン化といった従来のシステム最適化の適用は、各コンポーネントに異なる制約があるため、難しい。
本稿では,ストリーミングと並列処理による複合AIクエリの自動実行を最適化するフレームワークAltoを紹介する。
論文 参考訳(メタデータ) (2024-03-07T08:30:26Z) - StreamDiffusion: A Pipeline-level Solution for Real-time Interactive Generation [52.56469577812338]
本稿では,インタラクティブな画像生成のためのリアルタイム拡散パイプラインStreamDiffusionを紹介する。
既存の拡散モデルは、テキストや画像プロンプトから画像を作成するのに適しているが、リアルタイムのインタラクションでは不足することが多い。
本稿では,従来のシーケンシャル・デノナイジングをデノナイジング・プロセスに変換する新しいアプローチを提案する。
論文 参考訳(メタデータ) (2023-12-19T18:18:33Z) - Speech Synthesis By Unrolling Diffusion Process using Neural Network Layers [3.2634122554914002]
UDPNetは音声合成における逆拡散過程を高速化する新しいアーキテクチャである。
UDPNetは、品質と効率の両面で最先端の手法を一貫して上回っていることを示す。
これらの結果は、UDPNetをリアルタイム音声合成アプリケーションのための堅牢なソリューションとして位置づけている。
論文 参考訳(メタデータ) (2023-09-18T10:35:27Z) - FastDiff: A Fast Conditional Diffusion Model for High-Quality Speech
Synthesis [90.3069686272524]
本稿では,高品質音声合成のための高速条件拡散モデルであるFastDiffを提案する。
FastDiffは、長期の依存関係を効率的にモデル化するために、さまざまな受容的フィールドパターンの時間認識可能な位置可変の畳み込みを使用する。
我々は、FastDiffに基づいて、高忠実度音声波形を生成するエンドツーエンドのテキスト音声合成器FastDiff-TTSを設計する。
論文 参考訳(メタデータ) (2022-04-21T07:49:09Z) - Raw Waveform Encoder with Multi-Scale Globally Attentive Locally
Recurrent Networks for End-to-End Speech Recognition [45.858039215825656]
本稿では,グローバルな注意的局所再帰(GALR)ネットワークを採用し,生波形を直接入力とする新しいエンコーダを提案する。
ベンチマークデータセットAISHELL-2と,5,000時間21,000時間の大規模マンダリン音声コーパスを用いて実験を行った。
論文 参考訳(メタデータ) (2021-06-08T12:12:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。