論文の概要: Spoken Language Models that Think Aloud
- arxiv url: http://arxiv.org/abs/2609.26488v1
- Date: Tue, 22 Sep 2026 14:25:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-24 01:05:39.695954
- Title: Spoken Language Models that Think Aloud
- Title(参考訳): 音声言語モデル
- Abstract要約: Chain-of-Thought (CoT)推論は言語モデルの能力を改善し、Spoken Language Models (SLM)に直接適用した。
本稿では,Thinker-Talkerアーキテクチャ内での推論に基づくSLMのための非同期シンクアラウドフレームワークを提案する。
提案手法は,質問文の回答精度を,連続的な「考えを語る」ベースラインと同等に保ちながら,推論中のユーザの音質を著しく低下させる。
- 参考スコア(独自算出の注目度): 49.8808094623973
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While Chain-of-Thought (CoT) reasoning has improved the capability of language models, directly applying it to Spoken Language Models (SLMs) may introduce long silent intervals under the serial "think-then-speak" paradigm, disrupting real-time spoken interaction. To address this issue, we propose an asynchronous think-aloud framework for reasoning-based SLMs within the Thinker-Talker architecture. The framework maintains a primary reasoning stream for logical deduction and a lightweight think-aloud stream that generates short, task-grounded progress utterances conditioned on the user input and the evolving reasoning state. A dynamic balance strategy coordinates the two streams at runtime, triggering additional think-aloud speech to avoid silent gaps and canceling pending utterances when the final response becomes ready. Experiments on spoken reasoning and question-answering benchmarks show that our approach substantially reduces user-audible silence during reasoning while maintaining answer accuracy comparable to that of a serial "think-then-speak" baseline, demonstrating the potential of asynchronous think-aloud for responsive interaction in SLMs.
- Abstract(参考訳): CoT(Chain-of-Thought)推論は言語モデルの能力を向上させる一方で、SLM(Spoken Language Models)に直接適用することで、連続的な「思考のスピーカー」パラダイムの下で長いサイレント区間を導入し、リアルタイム音声対話を妨害する可能性がある。
この問題に対処するために,Thinker-Talkerアーキテクチャ内での推論に基づくSLMのための非同期シンクアラウドフレームワークを提案する。
このフレームワークは、論理的推論のための第一の推論ストリームと、ユーザの入力と進化する推論状態に条件付けられた、短いタスク基底の進捗発話を生成する軽量なシンクアラウドストリームとを維持している。
動的バランス戦略は、実行時に2つのストリームを調整し、最後の応答が準備できたときにサイレントギャップを回避し、保留中の発話をキャンセルするために、追加のシンクアラウド音声をトリガーする。
音声推論および質問応答ベンチマーク実験により,本手法は,SLMにおける応答応答応答に対する非同期シンクアロイドの可能性を示す上で,逐次的"思考話者"ベースラインに匹敵する応答精度を維持しつつ,推論中のユーザの音質を著しく低下させることが示された。
関連論文リスト
- The Silent Thought: Modeling Internal Cognition in Full-Duplex Spoken Dialogue Models via Latent Reasoning [76.96796481909581]
内部認知処理は高品質な応答の定式化に役立っている。
本稿では,音声認識と同時に潜在的思考を行うFLAIRという新しい手法を提案する。
我々のアプローチは音声対話システムとシームレスに一致している。
論文 参考訳(メタデータ) (2026-03-18T15:30:29Z) - Chronological Thinking in Full-Duplex Spoken Dialogue Language Models [66.84843878538207]
時系列思考は、完全なSDLMの応答品質を改善することを目的としている。
追加のレイテンシがない: ユーザが話すのをやめると、エージェントは考えるのをやめ、それ以上の遅延なしに話し始める。
結果: 客観的指標と人的評価の両面から, 時系列思考の有効性を示す実験を行った。
論文 参考訳(メタデータ) (2025-10-02T10:28:11Z) - Mini-Omni-Reasoner: Token-Level Thinking-in-Speaking in Large Speech Models [80.75260664100644]
Mini-Omni-Reasonerは、"Thinking-in-Speaking"という新しい定式化を通じて、音声内での推論を可能にするフレームワークである。
トークンレベルで音声応答トークンとサイレント推論トークンをインターリーブする。
算術的推論では+19.1%、文脈的理解では+6.4%、出力は短く、復号遅延はゼロである。
論文 参考訳(メタデータ) (2025-08-18T15:14:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。