論文の概要: Efficient Chain-of-Modality Reasoning via Progressive Compression for Spoken Language Models
- arxiv url: http://arxiv.org/abs/2607.19932v1
- Date: Wed, 22 Jul 2026 09:04:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.034935
- Title: Efficient Chain-of-Modality Reasoning via Progressive Compression for Spoken Language Models
- Title(参考訳): 音声言語モデルにおけるプログレッシブ圧縮による効率的なモダリティ推論
- Abstract要約: 音声言語モデル(SLM)は、人間とコンピュータの自然な相互作用を可能にするが、その推論能力はテキストベースの大規模言語モデルにはまだ及ばない。
本稿では, 圧縮推論をSLMに導入する最初のフレームワークである, 効率の良い整合性推論 (ECoM Reasoning) を提案する。
- 参考スコア(独自算出の注目度): 15.931907995924595
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Spoken language models (SLMs) enable natural human-computer interaction, but their reasoning ability still lags behind that of text-based large language models, especially on spoken mathematical question answering tasks. One important reason is that SLMs reason over purely verbalized mathematical expressions, which are harder to interpret than symbolic text. However, directly transferring text-based reasoning to SLMs is nontrivial due to architectural constraints and the additional computational requirements. To address this challenge, we propose Efficient Chain-of-Modality Reasoning (ECoM Reasoning), the first framework to introduce compressed reasoning into SLMs. By compressing the textual component so that it jointly serves as speech guidance and reasoning representation, ECoM Reasoning improves reasoning accuracy while using a smaller token budget than the standard Chain-of-Modality (CoM) architecture, which generates intermediate text before speech. To train this capability, we further propose Progressive Compression, a curriculum-based strategy that gradually trains the model from full-form reasoning to compressed reasoning. Experiments on spoken mathematical question answering benchmarks show that ECoM Reasoning improves accuracy by 21% over standard CoM without explicit reasoning, and by 3% over CoM with full reasoning traces while using only 40% of the text tokens, demonstrating that it enhances SLM reasoning while remaining inference-efficient.
- Abstract(参考訳): 音声言語モデル(SLM)は、自然な人間とコンピュータの相互作用を可能にするが、その推論能力はテキストベースの大規模言語モデル、特に音声による数学的質問応答タスクよりも遅れている。
重要な理由の1つは、SLMが記号テキストよりも解釈が難しい純粋に言語化された数学的表現よりも理性を持っていることである。
しかし、アーキテクチャ上の制約と追加の計算要求のため、テキストベースの推論をSLMに直接転送することは簡単ではない。
この課題に対処するため,SLMに圧縮推論を導入した最初のフレームワークであるECoM推論(Efficient Chain-of-Modality Reasoning)を提案する。
テキストコンポーネントを圧縮して音声指導と推論表現を併用することにより、ECoM推論は、中間テキストを生成する標準のChain-of-Modality(CoM)アーキテクチャよりも小さなトークン予算を使用しながら、推論精度を向上させる。
この能力をトレーニングするために,カリキュラムベースの戦略であるProgressive Compressionを提案する。
音声による数学的質問応答ベンチマークの実験では、ECoM推論は、明示的な推論なしで標準のCoMよりも21%精度が向上し、CoMよりも3%精度が向上し、テキストトークンの40%しか使用せず、推論効率を保ちながらSLM推論を向上させることが示されている。
関連論文リスト
- LatentChem: From Textual CoT to Latent Thinking in Chemical Reasoning [107.60117957760794]
テキスト生成から化学的導出を分離する潜在推論インタフェースであるLatntChemを紹介する。
我々は,LatentChemがChemCoTBench上のCoTベースラインの強いベースラインに対して59.88%の非ティー勝利率を達成したことを示す。
その結果, 化学推論は連続潜伏力学としてより自然かつ効果的に実現されているという実証的証拠が得られた。
論文 参考訳(メタデータ) (2026-02-06T01:28:27Z) - Mini-Omni-Reasoner: Token-Level Thinking-in-Speaking in Large Speech Models [80.75260664100644]
Mini-Omni-Reasonerは、"Thinking-in-Speaking"という新しい定式化を通じて、音声内での推論を可能にするフレームワークである。
トークンレベルで音声応答トークンとサイレント推論トークンをインターリーブする。
算術的推論では+19.1%、文脈的理解では+6.4%、出力は短く、復号遅延はゼロである。
論文 参考訳(メタデータ) (2025-08-18T15:14:04Z) - Decoupling Understanding from Reasoning via Problem Space Mapping for Small-scale Model Reasoning [22.582715282848795]
本稿では、自然言語問題を標準問題空間にマッピングすることで、推論から理解を分離する新しいフレームワークを提案する。
本フレームワークでは, 自己蒸留による推論軌道を反復的に整列する3段階のアルゴリズムであるDURITを導入する。
実験により、DURITはドメイン内およびドメイン外の数学的および論理的推論タスクにおけるSLMの性能を大幅に改善することが示された。
論文 参考訳(メタデータ) (2025-08-07T01:13:30Z) - PixelThink: Towards Efficient Chain-of-Pixel Reasoning [70.32510083790069]
PixelThinkは、外部から推定されるタスクの難しさと内部で測定されたモデルの不確実性を統合する、シンプルで効果的なスキームである。
シーンの複雑さと予測信頼度に応じて推論の長さを圧縮することを学ぶ。
実験により,提案手法は推論効率と全体セグメンテーション性能の両方を改善した。
論文 参考訳(メタデータ) (2025-05-29T17:55:49Z) - Learning to Reason via Mixture-of-Thought for Logical Reasoning [56.24256916896427]
Mixture-of-Thought (MoT) は、LLMが自然言語、コード、真理表の3つの相補的なモダリティにまたがる推論を可能にするフレームワークである。
MoT は,(1) 自己進化型 MoT トレーニング,(2) 3 つのモーダルの相乗効果を完全に活用してより良い予測を生成する MoT 推論,という2段階の設計を採用する。
論文 参考訳(メタデータ) (2025-05-21T17:59:54Z) - Sketch-of-Thought: Efficient LLM Reasoning with Adaptive Cognitive-Inspired Sketching [64.74765550805024]
Chain-of-Thoughtはステップバイステップの問題解決を促すが、中間出力の過剰な冗長性を犠牲にすることが多い。
我々は,認知にインスパイアされた推論パラダイムを言語制約と統合する促進フレームワークであるSketch-of-Thought(SoT)を提案する。
SoTはトークンを最大84%削減し、18の推論データセットで最小限の精度ロスを達成している。
論文 参考訳(メタデータ) (2025-03-07T06:57:17Z) - Improving Chain-of-Thought Reasoning via Quasi-Symbolic Abstractions [25.337811496479265]
CoT(Chain-of-Though)は、大規模言語モデルにおける推論のための一般的な戦略である。
準シンボリックな説明を通じて,LLMを高レベルの抽象化で動作させる,CoTのバリエーションであるQuaSARを提案する。
実験の結果,準記号的抽象化はCoT法を最大8%精度で改善できることがわかった。
論文 参考訳(メタデータ) (2025-02-18T07:58:48Z) - Token Assorted: Mixing Latent and Text Tokens for Improved Language Model Reasoning [53.57895922042783]
大規模言語モデル(LLM)は、チェーン・オブ・シークレット(CoT)データに基づいて訓練された場合、推論と計画が優れている。
そこで我々は,遅延離散トークンを用いて推論過程を部分的に抽象化するハイブリッド表現を提案する。
論文 参考訳(メタデータ) (2025-02-05T15:33:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。