論文の概要: AURAL: Adaptive Latent Reasoning with Joint Chunk for Speech Language Models
- arxiv url: http://arxiv.org/abs/2610.01560v1
- Date: Thu, 01 Oct 2026 12:28:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.111078
- Title: AURAL: Adaptive Latent Reasoning with Joint Chunk for Speech Language Models
- Title(参考訳): AURAL:言語モデルのための共用チャンクを用いた適応潜時推論
- Abstract要約: AuralReason-683K:673Kバイリンガル発声(約1000時間)
AuralReason-683K:673Kバイリンガル発声(約1000時間)
AuralReason-683K:673Kバイリンガル発声(約1000時間)
- 参考スコア(独自算出の注目度): 21.055944255709413
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Model intelligence and fast response jointly shape the quality of interaction with speech language models, yet remain difficult to achieve together. Explicit chain-of-thought (CoT) improves reasoning and audio understanding, but generating intermediate reasoning tokens delays responses. Describing fine-grained acoustic cues further lengthens CoT and increases latency. Latent reasoning can reduce this overhead, yet existing methods often trail CoT and remain limited by single-path supervision and reasoning budgets that do not adapt to problem difficulty. We introduce AURAL, which models a distribution over multiple plausible reasoning continuations in latent space and jointly predicts chunks of future states to reduce sequential forward passes and reasoning latency. To provide initial supervision for latent reasoning, we construct AuralReason-683K: 683K bilingual speech utterances (about 1,000 hours) with concise CoT for emotion recognition, empathetic dialogue, and general reasoning. AURAL-RL then explores beyond these traces, rewarding concise reasoning that yields high-quality answers and adapting reasoning effort to each problem. Across two backbones, AURAL-RL achieves performance comparable to CoT-RL, with larger gains over the respective supervised checkpoints on most metrics. Analysis further shows that harder questions elicit more latent reasoning steps. On Qwen2.5-Omni, it reduces time to the first answer token by 11.8x, from 1.22 to 0.10 s, versus 0.05 s for direct answering.
- Abstract(参考訳): モデルインテリジェンスと高速応答は、言語モデルとの相互作用の質を共同で形成するが、同時に達成することは困難である。
CoT(Explicit chain-of- Thought)は推論と音声理解を改善するが、中間推論トークンの生成は応答を遅らせる。
きめ細かい音響キューを記述することで、CoTをさらに延長し、遅延を増加させる。
遅延推論はこのオーバーヘッドを削減できるが、既存の手法はしばしばCoTに追随し、問題に適応しない単一パスの監督や推論予算によって制限される。
AURALを導入し、遅延空間における複数の確率的推論継続の分布をモデル化し、将来の状態のチャンクを共同予測し、シーケンシャルなフォワードパスと推論レイテンシを減少させる。
AuralReason-683K: 683Kバイリンガル音声発話(約1000時間)を,感情認識,共感対話,一般推論のための簡潔なCoTで構築する。
AURAL-RLは、これらのトレースを越えて、高品質な回答をもたらす簡潔な推論に報いるとともに、各問題に推論の取り組みを適用する。
2つのバックボーンにまたがって、AURAL-RLはCoT-RLに匹敵するパフォーマンスを達成し、ほとんどのメトリクスで各教師付きチェックポイントよりも大きく向上する。
分析により、難しい質問はより潜伏的な推論ステップを引き起こすことが示された。
Qwen2.5-Omniでは、最初の解答トークンが11.8xまで短縮され、1.22秒から0.10秒に短縮される。
関連論文リスト
- Spoken Language Models that Think Aloud [49.8808094623973]
Chain-of-Thought (CoT)推論は言語モデルの能力を改善し、Spoken Language Models (SLM)に直接適用した。
本稿では,Thinker-Talkerアーキテクチャ内での推論に基づくSLMのための非同期シンクアラウドフレームワークを提案する。
提案手法は,質問文の回答精度を,連続的な「考えを語る」ベースラインと同等に保ちながら,推論中のユーザの音質を著しく低下させる。
論文 参考訳(メタデータ) (2026-09-22T14:25:04Z) - DTS: Enhancing Large Reasoning Models via Decoding Tree Sketching [54.98126916293868]
大規模推論モデル(LRMs)は、精度を低下させる、非常に長い連鎖のトレースを生成する。
本稿では,高エントロピートークンを分岐することで推論空間をスケッチするモデル非依存デコーディングフレームワークを提案する。
このアプローチは、追加のトレーニングや監督を必要とせず、効率と正確性を両立させる最適解を近似する。
論文 参考訳(メタデータ) (2025-11-01T17:41:28Z) - Mini-Omni-Reasoner: Token-Level Thinking-in-Speaking in Large Speech Models [80.75260664100644]
Mini-Omni-Reasonerは、"Thinking-in-Speaking"という新しい定式化を通じて、音声内での推論を可能にするフレームワークである。
トークンレベルで音声応答トークンとサイレント推論トークンをインターリーブする。
算術的推論では+19.1%、文脈的理解では+6.4%、出力は短く、復号遅延はゼロである。
論文 参考訳(メタデータ) (2025-08-18T15:14:04Z) - ConciseHint: Boosting Efficient Reasoning via Continuous Concise Hints during Generation [74.37307916314407]
提案するフレームワークはConciseHintと呼ばれ,推論モデルが簡潔に話すことを継続的に奨励する。
DeepSeek-R1 および Qwen-3 シリーズを含む最先端の LRM 実験により,本手法が簡潔な推論を効果的に生成できることが実証された。
論文 参考訳(メタデータ) (2025-06-23T16:20:44Z) - SCoRE: Benchmarking Long-Chain Reasoning in Commonsense Scenarios [33.72114830484246]
SCoRE(Scenario-based Commonsense Reasoning Evaluation)は、エンティティ、リレーション、論理ルールのシナリオスキーマからマルチホップ質問を合成するベンチマークである。
SCoREには100kのバイリンガル(中国語と英語の)複数選択質問が含まれており、推論チェーンは2-11ホップにまたがり、様々な難易度にグループ化されている。
論文 参考訳(メタデータ) (2025-03-08T13:40:10Z) - Unveiling Reasoning Thresholds in Language Models: Scaling, Fine-Tuning, and Interpretability through Attention Maps [3.8936716676293917]
本研究では,異なるモデルサイズと訓練データを持つデコーダのみの変換言語モデルのコンテキスト内学習能力について検討する。
我々は,複数の質問応答におけるコモンセンス推論や帰納的推論といったタスクにおいて,推論性能が著しく向上する重要なパラメータしきい値(160億)を同定する。
論文 参考訳(メタデータ) (2025-02-21T00:48:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。