論文の概要: Do LLMs Need Architectural Changes for Simultaneous Speech Translation? A Prefix-to-Prefix Data Driven Approach
- arxiv url: http://arxiv.org/abs/2607.13158v1
- Date: Tue, 14 Jul 2026 18:07:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.559615
- Title: Do LLMs Need Architectural Changes for Simultaneous Speech Translation? A Prefix-to-Prefix Data Driven Approach
- Title(参考訳): LLMは同時音声翻訳に構造的変化を必要とするか? 事前修正型データ駆動アプローチ
- Authors: Junkun Chen, Jian Xue, Ming Tang, Abdel Heba, Hoda Gholami, Ruchao Fan, Jinyu Li,
- Abstract要約: 同時音声翻訳(SimulST)は、厳密なレイテンシ制約の下で漸進的な翻訳を必要とする。
最近のアプローチでは、しばしばアーキテクチャの変更や、出力タイミングを制御するための明示的な読み取り/書き込みポリシーを導入します。
データ駆動の代替として,リウインドベースのコミットプレフィックスを用いた累積ストリーミングデコーディングのための固定長チャンクを提案する。
- 参考スコア(独自算出の注目度): 35.74129795192098
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Simultaneous speech translation (SimulST) requires incremental translation under strict latency constraints, yet remains challenging for decoder-only LLM systems due to limited context and cross-lingual reordering. Recent approaches often introduce architectural changes or explicit read/write policies to control output timing, which can be brittle in conversational speech where segmentation boundaries are ambiguous. We present a simple data-driven alternative: fixed-length chunks for cumulative streaming decoding with a rewind-based committed prefix, and teacher-labeled prefix-to-prefix (P2P) targets with bounded waiting for fine-tuning, yielding CSSEL-P2P, where CSSEL is our proposed chunked streaming speech encoder LLM. In our in-house conversational speech evaluation, CSSEL-P2P improves streaming quality by +1.54 COMETKiwi over the CSSEL streaming baseline at comparable latency (+0.15s Average Lagging), suggesting effective SimulST without architectural changes via P2P supervision.
- Abstract(参考訳): 同時音声翻訳(SimulST)は、厳密なレイテンシ制約下での漸進的な翻訳を必要とするが、文脈の制限と言語間の並べ替えのため、デコーダのみのLLMシステムでは依然として困難である。
最近のアプローチでは、しばしばアーキテクチャの変更や、出力タイミングを制御するための明示的な読み書きポリシーを導入しており、セグメンテーション境界が曖昧な会話音声では不安定である。
また,教師ラベル付きプレフィックス・トゥ・プレフィックス(P2P)ターゲットを微調整待ちにしてCSSEL-P2Pを生成し,CSSELをチャンク付きストリーミング音声エンコーダLLMとする。
社内での会話音声評価では、CSSEL-P2Pは、同等のレイテンシ (+0.15s Average Lagging) でCSSELストリーミングベースラインに対して、+1.54 COMETKiwiでストリーミング品質を向上します。
関連論文リスト
- Diffusion Large Language Models for Visual Speech Recognition [56.81307584718608]
本稿では,最初の拡散大言語モデル(DLLM)に基づく視覚音声認識(VSR)フレームワークを提案する。
DLLM-VSRは早期に高信頼位置をコミットし、コミットトークンを双方向コンテキストとして、曖昧なトークンを洗練させる。
我々は、ビデオ長を用いて、可塑性転写長仮説を構築する長さ誘導型候補復号法を開発した。
提案手法はラベル付きトレーニングデータのみを用いて, LRS3 上で19.5%の最先端 WER を実現する。
論文 参考訳(メタデータ) (2026-05-27T13:22:08Z) - Hierarchical Policy Optimization for Simultaneous Translation of Unbounded Speech [50.45710815530982]
同時音声翻訳(SST)は、部分的な音声入力を受けながら翻訳を生成する。
近年の進歩により、大規模言語モデル(LLM)はSSTの品質を大幅に向上するが、高い計算オーバーヘッドのコストがかかる。
本稿では,不完全なSFTデータに基づいて列車後モデルを訓練する階層的ポリシー最適化(HPO)手法を提案する。
英語と中国語/ドイツ語/日本語の実験では、+7 COMETスコアと+1.25 MetricXスコアが1.5秒で改善された。
論文 参考訳(メタデータ) (2026-04-22T19:43:51Z) - Temporal Contrastive Decoding: A Training-Free Method for Large Audio-Language Models [56.91801348360746]
大規模な音声言語モデル(LALM)は、音声、音声、音楽にまたがって一般化される。
統一デコーダは 時空間のスムーズなバイアスを示します
LALMの学習自由復号法であるemphTemporal Contrastive Decoding (TCD)を提案する。
論文 参考訳(メタデータ) (2026-04-16T02:30:41Z) - Adapting Text LLMs to Speech via Multimodal Depth Up-Scaling [52.02344262645619]
本稿では,新しいトランス層を凍結テキストLLMに挿入し,付加層のみを音声データに基づいて訓練するマルチモーダル深さアップスケーリングを提案する。
SmolLM2-360MとSmolLM2-1.7Bによる48k時間の英語自動音声認識(ASR)データによる実験により、深度アップスケーリングは完全な微調整に匹敵するASRを実現することが示された。
さらに,テキストの劣化を75%以上低減し,トレーニング可能なパラメータを60%少なく抑えながら,大規模モデルの完全微調整に適合あるいは超越したASRを実現するために,音声認識用に設計されたアーキテクチャであるE-Branchformerを組み込むことが示される。
論文 参考訳(メタデータ) (2026-04-01T05:16:06Z) - Voxtral Realtime [134.66962524291424]
Voxtral Realtimeはストリーミング自動音声認識モデルである。
オフラインの書き込み品質は、秒以下のレイテンシで一致します。
私たちはApache 2.0ライセンスの下でモデルウェイトをリリースしています。
論文 参考訳(メタデータ) (2026-02-11T19:17:10Z) - StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model [20.978001644716063]
ストリーム音声翻訳(StreamST)は、ポリシーとして知られる適切なタイミングで翻訳を生成する必要がある。
既存のStreamSTメソッドは通常、同時音声翻訳(SimulST)と呼ばれる文レベルの音声セグメントで動作する。
本稿では,Large Speech-Language Model (LSLM) を用いてStreamSTを実現するStreamUniを提案する。
論文 参考訳(メタデータ) (2025-07-10T14:28:39Z) - SimulS2S-LLM: Unlocking Simultaneous Inference of Speech LLMs for Speech-to-Speech Translation [14.57248739077317]
本稿では,LLMをオフラインで学習するSimulS2S-LLMを提案する。
SimulS2S-LLMは、個別の音声トークンを予測し、事前訓練されたボコーダを用いて出力音声を合成することにより、同時音声音声変換(Simul-S2ST)を実現する。
論文 参考訳(メタデータ) (2025-04-22T01:05:32Z) - Learning to Keep a Promise: Scaling Language Model Decoding Parallelism with Learned Asynchronous Decoding [26.571743941748238]
PASTAは、大規模言語モデルにセマンティックな独立性を識別し、独自の応答で並列デコーディングの機会を表現するための学習ベースのシステムである。
PASTA-Langは、LLMが自身の応答でセマンティックな独立性を表現することができるアノテーション言語である。
本研究は,2.2%から7.1%の品質変化を伴う1.21xから1.93xまでの幾何平均スピードアップを,逐次デコードベースラインに対する長さ制御ウィンドレートで測定した。
論文 参考訳(メタデータ) (2025-02-17T07:39:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。