論文の概要: Causal Analysis and Mitigation of Spurious Onsets in Full-Duplex Speech LLMs
- arxiv url: http://arxiv.org/abs/2609.13445v2
- Date: Wed, 16 Sep 2026 21:50:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.392396
- Title: Causal Analysis and Mitigation of Spurious Onsets in Full-Duplex Speech LLMs
- Title(参考訳): 全二重音声LLMにおけるスプリアス発生の因果解析と軽減
- Abstract要約: モシモシとその派生したペルソナプレックスは5分間の沈黙継続の30%と27.5%で発声を開始する。
現実的なマイクロホンノイズ下では、本手法は真の応答を保ちながら、突発的なオンセットを抑制する。
提案手法は,80msのフレーム予算内で,61ms未満の95パーセントの判定時間で,リトレーニングなしでリアルタイムに動作させる。
- 参考スコア(独自算出の注目度): 3.502729154227436
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Speech-to-speech LLMs like Moshi, and its derivative PersonaPlex, can listen and speak concurrently through full-duplex generation. However, they can begin speaking inappropriately during prolonged user silence: under digital-zero input, Moshi and PersonaPlex initiate speech in 30% and 27.5% of five-minute continuations, respectively. What causes this spurious speech? We investigate two hypotheses: either repeated sampling selects speech despite persistently low onset probabilities, or self-conditioning on nonspeech outputs causes an abrupt spike in onset probability. We find that, at every observed onset, speech probability spikes by over nine orders of magnitude in one 80-ms frame, supporting the latter hypothesis. Then, to suppress these onsets without blocking genuine responses, we ask a causal counterfactual question: is the model responding to user speech, or would its next-token distribution remain similar if the preceding user input were muted? Accordingly, we suppress onsets whose distributions change little under this intervention. Under realistic microphone noise, our method suppresses spurious onsets, while preserving genuine responses: one-sided 95% lower confidence bounds are 98.68% and 98.82% for Moshi, and 96.90% and 99.25% for PersonaPlex. Our inference-time method runs in real-time without retraining, with 95th-percentile decision time below 61 ms, within the 80-ms frame budget. Our code is available at https://github.com/KentoNishi/icassp27-spurious-onsets.
- Abstract(参考訳): Moshiやその派生であるPersonaPlexのような音声合成LLMは、全二重生成を通じて、聴き、同時に話すことができる。
しかし、デジタルゼロ入力では、モシとペルソナプレックスはそれぞれ5分間連続の30%と27.5%で音声を開始する。
この急激な演説の原因は何でしょうか。
繰り返しサンプリングは、持続的に低い確率で音声を選択するか、非音声出力での自己条件付けは、オンセット確率の急激なスパイクを引き起こすという2つの仮説を考察する。
その結果,80msのフレームの1つで音声の確率が9桁以上上昇し,後者の仮説が支持されることがわかった。
そして、実際の応答をブロックすることなく、これらのオンセットを抑えるために、因果的反事実的質問を行う: モデルがユーザ音声に応答しているか、それとも、前のユーザ入力がミュートされた場合、その次のトケン分布が類似しているのか?
したがって、この介入により分布がほとんど変化しない発症を抑える。
現実的なマイクロホンノイズ下では,本手法は真正応答を抑えつつ,真正応答を抑える。一方の95%低信頼境界は,モシでは98.68%,98.82%,ペルソナプレックスでは96.90%,99.25%である。
提案手法は,80msのフレーム予算内において,リトレーニングなしでリアルタイムに動作し,61ms未満の95%の判定時間を有する。
私たちのコードはhttps://github.com/KentoNishi/icassp27-spurious-onsets.comで利用可能です。
関連論文リスト
- DuplexJail: Safety Alignment Breaks Under Spoken Interruption in Full-Duplex Models [16.95513039797219]
固定遅延割り込みはAdvBenchの攻撃成功率をペルソナPlexの40.3%、ペルソナPlexRLの48.7%に引き上げる。
拒絶政策は、それぞれ35.6%と48.6%に達し、全ての試験は、中断が生じたかどうかにかかわらず行われた。
これらの結果から, 音声の中断は, 連続した相互作用を通して安全性を評価するジェイルブレイク攻撃であることがわかった。
論文 参考訳(メタデータ) (2026-09-08T20:19:24Z) - Audio-Native Speech Recognition with a Frozen Discrete-Diffusion Language Model [0.23332469289621785]
我々はDiffusionGemmaのための音声ネイティブインタフェースをトレーニングし、一様でランダムな離散拡散によってテキストを生成する。
自然な訓練対象は、既に無視されている注意によってのみ、その勾配がプロジェクターに到達するため、音声を接地できないことが判明した。
結果として得られたモデルは、LibriSpeechテストクリーン上で6.6%のワードエラー率に達し、発話の長さに関わらずおよそ8つの並列ステップで書き起こされ、6つの言語で訓練された単一のアダプタを使用する。
論文 参考訳(メタデータ) (2026-07-14T17:53:22Z) - Language models recognize dropout and Gaussian noise applied to their activations [74.06294367754748]
我々は, (a) アンフマスクのアクティベーションをシミュレートし, あるいは (b) アンフガウス雑音を付加する。
Llama、Olmo、Qwenファミリーのモデルをテストする。
論文 参考訳(メタデータ) (2026-04-19T14:30:13Z) - DiffuSpeech: Silent Thought, Spoken Answer via Unified Speech-Text Diffusion [23.01044837428522]
我々は、音声LLMが音声応答とともに内部テキスト推論を生成するパラダイムであるtextbfSilent Thought, Spoken Answer'を紹介する。
本稿では,理解と生成の両方をサポートする最初の拡散型音声テキスト言語モデルを提案する。
実験の結果,最先端の音声合成QAの精度を最大9ポイント向上させることができた。
論文 参考訳(メタデータ) (2026-01-30T12:08:33Z) - SHANKS: Simultaneous Hearing and Thinking for Spoken Language Models [158.18422855768756]
現在の大規模言語モデル (LLM) と音声言語モデル (SLM) は、ユーザがターンを終えた後にのみ、思考と行動を取る。
これにより、モデルがユーザのターン中に対話するのを防ぎ、考えるのを待つ間、レスポンスのレイテンシが高くなります。
SHANKSは,ユーザ入力を聴きながら,無意味な連鎖推論をSLMが生成できるフレームワークである。
論文 参考訳(メタデータ) (2025-10-08T11:48:59Z) - STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models [131.90117151306993]
音声言語モデル(SLM)は、音声入力を受信し、音声応答を生成するように設計されている。
現在のSLMは、応答する前に、内部的に無意味な思考プロセスを実行する能力が欠けている。
未知の推論チャンクと音声応答チャンクを交互に生成する新しい手法であるStitchを提案する。
論文 参考訳(メタデータ) (2025-07-21T08:30:03Z) - SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval [23.055339472773596]
音声大言語モデルのための新しい長文タスクである音声情報検索(SIR)を導入する。
我々は90秒音声入力から重要な詳細を抽出するベンチマークテストモデルであるSPIRALを提案する。
SpeechPruneは、無関係なトークンを効率的に破棄するために、音声テキストの類似性と注意スコアを近似したトレーニング不要なトークン刈り取り戦略である。
論文 参考訳(メタデータ) (2024-12-16T17:36:02Z) - Moshi: a speech-text foundation model for real-time dialogue [78.88479749811376]
現在の音声対話システムは、パイプラインの独立した音声活動検出と音声合成に依存している。
そこで本研究では,Moshi Moshiが音声認識と音声合成を実現する方法を紹介する。
得られたモデルは、初めてリアルタイムな全音声大言語モデルモダリティである。
論文 参考訳(メタデータ) (2024-09-17T17:55:39Z) - TranSpeech: Speech-to-Speech Translation With Bilateral Perturbation [61.564874831498145]
TranSpeechは、両側摂動を伴う音声から音声への翻訳モデルである。
我々は,非自己回帰S2ST手法を構築し,繰り返しマスキングを行い,単位選択を予測する。
TranSpeechは推論遅延を大幅に改善し、自動回帰技術よりも最大21.4倍のスピードアップを実現している。
論文 参考訳(メタデータ) (2022-05-25T06:34:14Z) - Improving Unsupervised Sparsespeech Acoustic Models with Categorical
Reparameterization [31.977418525076626]
本研究では,Sparsespeechモデルを拡張して,確率変数をサンプリングし,擬似後生図を生成する。
新しい改良されたモデルは、限定的または無監督のASRのベンチマークであるLibri-Light corpusでトレーニングされ、評価されている。
改良されたモデルを用いて, 話者間でのABX誤差率を31.4%まで改善した。
論文 参考訳(メタデータ) (2020-05-29T13:58:36Z) - Listen Attentively, and Spell Once: Whole Sentence Generation via a
Non-Autoregressive Architecture for Low-Latency Speech Recognition [66.47000813920619]
我々はLASOと呼ばれる非自己回帰型エンドツーエンド音声認識システムを提案する。
非自己回帰性のため、LASOは他のトークンに依存することなくシーケンス内のテキストトークンを予測する。
我々は,中国における公開データセットAISHELL-1の実験を行った。
論文 参考訳(メタデータ) (2020-05-11T04:45:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。