論文の概要: X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment
- arxiv url: http://arxiv.org/abs/2607.21550v1
- Date: Thu, 23 Jul 2026 17:35:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.503012
- Title: X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment
- Title(参考訳): X$^3$-OPD:オンラインアライメントによる大規模オーディオ言語モデルへの蒸留
- Abstract要約: X$3$-OPDは、大規模なオーディオ言語モデルのためのクロスモーダルなオンライン蒸留フレームワークである。
強力なテキスト教師から音声学習の学生に推論能力を伝達する。
X$3$-OPDは、音声による推論と思考の連鎖的品質を大幅に改善する。
- 参考スコア(独自算出の注目度): 38.53954341285787
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: While large audio-language models have achieved remarkable progress in auditory perception, they still lag behind text-based large language models in deep logical reasoning, primarily due to the scarcity of high-quality audio reasoning data. To bridge this gap, we propose X$^3$-OPD, a cross-modal on-policy distillation framework that transfers reasoning capabilities from a powerful text teacher to an audio-language student. During training, the student generates reasoning trajectories conditioned on its own acoustic perception, while the teacher provides token-level guidance using matched textual inputs and verified answers. We further construct a three-tier symmetric corpus covering textual reasoning rendered into speech, audio-event reasoning grounded in complex acoustic scenes, and spoken-dialogue reasoning involving paralinguistic cues. This design extends cross-modal distillation beyond textually recoverable content to reasoning grounded in non-linguistic events, prosody, and conversational context. Experiments on MMSU, MMAU, BIG Bench Audio, and MMAR demonstrate that X$^3$-OPD substantially improves audio-grounded reasoning and chain-of-thought quality while largely preserving the model's existing capabilities under domain shift.
- Abstract(参考訳): 大規模な音声言語モデルは、聴覚の知覚において顕著な進歩を遂げてきたが、高品質な音声推論データが不足していることから、テキストベースの大規模言語モデルは深い論理的推論においてまだ遅れている。
このギャップを埋めるため,強力なテキスト教師から音声学習者へ推論能力を伝達するクロスモーダルなオンライン蒸留フレームワークであるX$^3$-OPDを提案する。
学習中、教師は、一致したテキスト入力と検証された回答を用いてトークンレベルの指導を行う。
さらに,3階層の対称コーパスを構築し,テキストによる推論を音声に表現し,複雑な音響シーンに基礎を置く音声イベント推論,パラ言語的手がかりを含む音声対話推論を行う。
この設計は、テキストで回復可能なコンテンツを超えて、非言語的な出来事、韻律、会話の文脈に根ざした推論まで、クロスモーダル蒸留を拡張している。
MMSU、MMAU、BIG Bench Audio、MMARの実験では、X$^3$-OPDは、ドメインシフトの下でモデルの既存の機能をほとんど保ちながら、音場推論とチェーン・オブ・クオリティを大幅に改善することを示した。
関連論文リスト
- Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents [3.6734440150955368]
音声言語モデル(ALM)は、音声に基づく理解にますます使われる。
アクセント変化, ドメインシフト, セマンティックオーバー推論が音声推論に与える影響はよく分かっていない。
5つの意味的・パラ言語的推論タスクにおける音声言語モデルの評価を行った。
論文 参考訳(メタデータ) (2026-05-11T20:27:40Z) - Koopman Regularized Deep Speech Disentanglement for Speaker Verification [6.659299099827954]
DKSD-AE(Deep Koopman Speech Disentanglement Autoencoder)
本稿では,複数ステップのKoopman演算子学習モジュールとインスタンス正規化を組み合わせた構造化オートエンコーダを提案する。
この結果から,コープマンに基づく時間モデルと実例正規化を組み合わせることで,話者中心の表現学習における効率的かつ原理的な解が得られることが示唆された。
論文 参考訳(メタデータ) (2026-03-05T17:30:18Z) - Step-Audio-R1 Technical Report [70.37077572409319]
本稿では,音声領域における推論能力の解放に成功した最初の音声推論モデルであるStep-Audio-R1を紹介する。
私たちのモデルは、Gemini 2.5 Proを抜いて、最先端のGemini 3 Proに匹敵するパフォーマンスを実現した、強力なオーディオ推論能力を示しています。
論文 参考訳(メタデータ) (2025-11-19T20:12:50Z) - Teaching Audio Models to Reason: A Unified Framework for Source- and Layer-wise Distillation [52.537908557508324]
本研究では,高容量テキストモデルから学生音声モデルへの推論能力を伝達するための統合知識蒸留フレームワークを提案する。
本手法では, ソースワイド蒸留と層ワイド蒸留という2つの重要な次元を導入する。
実験結果から,音声推論性能は著しく向上した。
論文 参考訳(メタデータ) (2025-09-23T02:58:16Z) - Mini-Omni-Reasoner: Token-Level Thinking-in-Speaking in Large Speech Models [80.75260664100644]
Mini-Omni-Reasonerは、"Thinking-in-Speaking"という新しい定式化を通じて、音声内での推論を可能にするフレームワークである。
トークンレベルで音声応答トークンとサイレント推論トークンをインターリーブする。
算術的推論では+19.1%、文脈的理解では+6.4%、出力は短く、復号遅延はゼロである。
論文 参考訳(メタデータ) (2025-08-18T15:14:04Z) - SpeechR: A Benchmark for Speech Reasoning in Large Audio-Language Models [60.72029578488467]
SpeechRは、大規模な音声言語モデルにおける音声に対する推論を評価するための統一的なベンチマークである。
事実検索、手続き推論、規範的判断の3つの重要な側面に沿ったモデルを評価する。
11個の最先端のLALMの評価は、高い転写精度が強い推論能力に変換されないことを示している。
論文 参考訳(メタデータ) (2025-08-04T03:28:04Z) - TransVIP: Speech to Speech Translation System with Voice and Isochrony Preservation [97.54885207518946]
カスケード方式で多様なデータセットを活用する新しいモデルフレームワークTransVIPを提案する。
本稿では、話者の音声特性と、翻訳過程における音源音声からの等時性を維持するために、2つの分離エンコーダを提案する。
フランス語と英語のペアに関する実験により、我々のモデルは、現在最先端の音声音声翻訳モデルよりも優れていることを示した。
論文 参考訳(メタデータ) (2024-05-28T04:11:37Z) - A$^3$T: Alignment-Aware Acoustic and Text Pretraining for Speech
Synthesis and Editing [31.666920933058144]
本稿では,テキスト入力と音響テキストアライメントによるマスク付き音響信号の再構成を行うアライメント・アウェア・アウェア・アコースティック・テキスト・プレトレーニング(A$3$T)を提案する。
実験では、A$3$Tは、音声編集におけるSOTAモデルよりも優れており、外部話者検証モデルなしでは、マルチスピーカ音声合成を改善する。
論文 参考訳(メタデータ) (2022-03-18T01:36:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。