論文の概要: Batched Speech Decisions Without Decoding: Single-Token Supervision Lets a Frozen LLM Hear Beyond the Transcript
- arxiv url: http://arxiv.org/abs/2610.02638v1
- Date: Fri, 02 Oct 2026 00:54:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.139216
- Title: Batched Speech Decisions Without Decoding: Single-Token Supervision Lets a Frozen LLM Hear Beyond the Transcript
- Title(参考訳): 解読なしのバッチ音声決定:シングルトーケン・スーパービジョンは、筆跡の向こうに凍ったLLMの音を聴く
- Abstract要約: 本研究では、8ノードが約0.1秒の8つの発話に関する80の判断を回答する。
代わりに、回答トークンからのクロスエントロピーによる意思決定と、教師が音声を聞かず、内容を読み続ける通常の転写蒸留をトレーニングします。
- 参考スコア(独自算出の注目度): 13.13792713106632
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Full-duplex voice agents make many small, closed decisions, which current systems answer by slow autoregressive decoding. We propose DuplexJev, which feeds ASR-encoder hidden states through a small connector into a frozen LLM and reads each question as a single-token distribution over its options. Nothing is decoded, and an 8-GPU node answers 80 decisions about eight utterances in about 0.1 s. With a last-layer connector, spoken QA stays close to reading the transcript (90% vs. 91%). DuplexJev also hears the speaker: gender and emotion accuracy both reach 90% (from 55% and 28%) with a cross-attention connector, whose spoken QA drops by only 1 point (83% to 82%). We train decisions with cross-entropy on the read-out answer token, instead of the usual transcript distillation, whose teacher never hears the voice, and keep distillation for content. Encoders and LLMs are interchangeable; we release weights, training recipe, a batched-inference pipeline for full-duplex serving and a bilingual spoken-QA set.
- Abstract(参考訳): 完全二重音声エージェントは、多くの小さくてクローズドな決定を行い、現在のシステムは、遅い自己回帰的復号化によって応答する。
提案するDuplexJevは,ASRエンコーダが隠れた状態を小さなコネクタを通して冷凍LDMに供給し,各質問をそのオプションのシングルトーケン分布として読み取る。
8GPUノードは、約0.1秒で8つの発話に関する80の判断に答える。
最後の層コネクタでは、音声QAは転写文(90%対91%)に近づいたままである。
性別と感情の精度が90%(55%から28%)に到達し、音声QAがわずか1ポイント(83%から82%)減少している。
我々は,教師が音声を聴くことのできない通常の書き起こし蒸留の代わりに,読み出し解答トークンのクロスエントロピーで意思決定を訓練し,内容の蒸留を継続する。
エンコーダとLLMは交換可能であり、ウェイト、トレーニングレシピ、フル二重サービスのためのバッチ推論パイプライン、バイリンガル音声QAセットをリリースする。
関連論文リスト
- WnW: Waxing-and-Waning KV Cache for Long-Form Speech LLMs [60.6692467625441]
Waxing-and-Waning KVキャッシュはKVヘッドをオフラインキャリブレーションによってアンカー、タイダル、固定ロールに分類する。
3Bバックボーンが2つあるLibri-Speechでは、WnWはほぼフルキャッシュの精度を維持しながら、プリフィルオンリーのベースラインが終了しないGPU上のオーディオトークンの20%しか保持しない。
論文 参考訳(メタデータ) (2026-08-24T01:48:30Z) - Interpretable, Fairly Evaluated Automated L2 Speaking Assessment that Beats the Single-Human Ceiling and Why Pause Encoding Does Not Change LLM Fluency Scores [0.0]
自然発生L2対話のための解釈可能な機能+LLMハイブリッドを構築した。
ICNALE Global Rating Archive: 140 Speechs rated by 80 trained Raters on 10 analysis criteria。
論文 参考訳(メタデータ) (2026-06-25T17:18:30Z) - TRADE: Transducer-Augmented Decoder for Speech LLM [52.69726809996728]
音声大言語モデル(Speech LLM)は、ストリーミング推論の原理的なメカニズムを欠いている。
音声エンコーダを共有するトランスデューサブランチでマルチモーダルLLMを増強するTRADE TRansducer-Augmented DEcoderを提案する。
3つの設計上の選択により、システムは正確で、ストリーミング可能で、長い形にすることができる。
論文 参考訳(メタデータ) (2026-06-07T07:15:34Z) - Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox [4.088161686930475]
VoxParadoxは2000の検証済みのサンプルを持ち、10のパラ言語的タスクにまたがる逆のベンチマークである。
音場真理の精度は一貫して低く, 言語による回答に追従する傾向が強い。
入力プロンプトに基づいて複数のオーディオ層からの情報を適応的に結合するPrompt-Conditioned Layer Mixer (PCLM)を提案する。
論文 参考訳(メタデータ) (2026-05-26T23:44:23Z) - LASE: Language-Adversarial Speaker Encoding for Indic Cross-Script Identity Preservation [0.0]
話者エンコーダは、音声が発声されたスクリプトに関係なく、同じ話者を同一に扱うべきである。
オフザシェルフエンコーダは使用せず、失敗はアクセント条件である。
凍結したWavLMベースプラスを2つの損失で訓練した小型プロジェクションヘッドであるLASEを提示する。
論文 参考訳(メタデータ) (2026-05-01T16:46:25Z) - Self-hosted Lecture-to-Quiz: Local LLM MCQ Generation with Deterministic Quality Control [0.0]
APIのないパイプラインは、ローカルLCMと決定論的品質制御(QC)を用いて講義PDFをマルチチョイス質問(MCQ)に変換する
3つの短い「ダミー講義」(情報理論、熱力学、統計力学)で種を網羅する。
Google Formsのインポート->L/CSV(Apps ScriptやAPIツールなど)として、最後の24質問セット(3つの講義 x 8 の質問)をリリースしています。
明示的なQCを備えた自己ホスト型世代は、教育的等価性において、プライバシ、説明可能性、およびグリーンAIをサポートします。
論文 参考訳(メタデータ) (2026-02-20T09:52:39Z) - Fun-Audio-Chat Technical Report [71.07966678560291]
音声トークン(25Hz)とテキストトークン(3Hz)の間の時間分解能は意味情報のミスマッチを緩和し、高い計算コストを発生させる。
本稿では,大規模な音声合成タスクであるFun-Audio-Chatを紹介する。
Fun-Audio-Chat 8BとMoE 30BA3Bは、SpeechTextとSpeech-to-scaleタスクの競合性能を達成する。
論文 参考訳(メタデータ) (2025-12-23T08:35:27Z) - Distilling an End-to-End Voice Assistant Without Instruction Training Data [53.524071162124464]
Distilled Voice Assistant (DiVA)は、質問応答、分類、翻訳を一般化する。
Qwen 2 Audioのような最先端のモデルと比較すると,DiVAはユーザの好みによく適合し,72%の勝利率を達成した。
論文 参考訳(メタデータ) (2024-10-03T17:04:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。