論文の概要: Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs
- arxiv url: http://arxiv.org/abs/2607.06540v2
- Date: Thu, 09 Jul 2026 02:16:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.266099
- Title: Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs
- Title(参考訳): 階層型音響シーマンティックモデリング:フルダブルプレックスSLMにおけるモーダリティ分離とセマンティックコヒーレンス
- Authors: Zhenyu Liu, Xuanyu Zhang, Yunxin Li, Qixun Teng, Shenyuan Jiang, Haolan Chen, Minjun Zhao, Fanbo Meng, Yu Xu, Yancheng He, Baotian Hu, Haizhou Li, Min Zhang,
- Abstract要約: Lychee-FDは、ネイティブのエンドツーエンドフル・ツー・エンドのSLMフレームワークである。
Lychee-FDは、相互モダリティコヒーレンスを維持しながら、モダリティと矛盾する。
我々の手法は、その技術の現状を著しく保っている。
- 参考スコア(独自算出の注目度): 58.719964942364356
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Developing seamless, high-performance, native intelligent full-duplex Spoken Language Models (SLMs) remains a critical challenge and long-standing goal for the speech and NLP community. Despite notable progress, recent endeavors are fundamentally constrained by severe modality interference, which causes substantial knowledge degradation and compromises semantic integrity -- ultimately making full-duplex SLMs feel unnatural and unintelligent. In this paper, through an exhaustive fine-grained analysis of model optimization dynamics, we uncover the root cause of such performance degradation, revealing that modality interference arises from inherent gradient conflicts between acoustic and semantic modeling when the two modalities are forced to share a deep parameter space. Guided by this key insight, we introduce Lychee-FD, a native end-to-end full-duplex framework designed to mitigate modality interference. Importantly, we propose a hierarchical parameter separation strategy that decouples conflicting modalities in deep layers while preserving cross-modality coherence via a dedicated semantic alignment channel. Extensive experiments on multiple full-duplex benchmarks demonstrate that our method significantly advances the state of the art, yielding substantial improvements in both speech intelligence (+7.4% on Spoken QA) and full-duplex interaction fluidity (+28.5% on FullDuplexBench 1.5) without compromising inference efficiency. To the best of our knowledge, this work is the first to achieve two key advances: 1) uncovering and elucidating the root cause of modality interference in full-duplex SLMs, and 2) designing an elegant hierarchical model together with a practical solution for seamless, high-performance, native intelligent full-duplex SLMs.
- Abstract(参考訳): シームレスで高性能でネイティブな知的全二重言語モデル(SLM)を開発することは、スピーチとNLPコミュニティにとって重要な課題であり、長年の目標である。
顕著な進歩にもかかわらず、最近の試みは、重大なモダリティの干渉によって根本的な制約を受けており、それが重大な知識の劣化と意味的整合性を損なう。
本稿では,モデル最適化力学の徹底的な微粒化解析により,これらの性能劣化の根本原因を明らかにするとともに,2つのモードが深いパラメータ空間を共有せざるを得ない場合に,音響モデルとセマンティックモデルの間に固有の勾配の衝突が生じていることを明らかにする。
この重要な洞察に導かれたLychee-FDは、モダリティの干渉を軽減するために設計された、ネイティブなエンドツーエンドのフルダブルプレックスフレームワークである。
重要なことは,特定の意味的アライメントチャネルを経由した相互モダリティコヒーレンスを保ちながら,深い層内の相反するモダリティを分離する階層的パラメータ分離戦略を提案することである。
複数のフルダブルプレックスベンチマークによる大規模な実験により,提案手法の最先端性が著しく向上し,音声インテリジェンス (+7.4%, Spoken QA) とフルダブルプレックス相互作用流動性 (+28.5%, FullDuplexBench 1.5) の両面において,推論効率を損なうことなく大幅な改善が得られた。
私たちの知る限りでは、この研究は2つの重要な進歩を達成した最初のものである。
1) 全二重SLMにおけるモダリティ干渉の根本原因の解明と解明
2) エレガントな階層モデルと, シームレスで高性能, ネイティブなインテリジェントフルデュプレックスSLMのための実用的なソリューションを併用して設計する。
関連論文リスト
- OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation [60.95158352332569]
近年のジョイント・オーディオ・ビデオ・ジェネレーションの進歩は、モダリティ毎の忠実度、クロスモーダルアライメント、きめ細かい同期を強く要求している。
これらの欠点は、単一のグローバルな優位性を持つバニラRL微調整戦略が、しばしば準最適結果をもたらすことを示唆している。
提案するOmniNFTは,新しいモダリティ対応オンライン拡散RLフレームワークである。
論文 参考訳(メタデータ) (2026-05-12T17:56:59Z) - IdGlow: Dynamic Identity Modulation for Multi-Subject Generation [23.20674988897558]
We present IdGlow, a mask-free, progressive two-stage framework built on Flow Matching diffusion model。
教師付き微調整(SFT)の段階では、拡散生成力学に対応するタスク適応型時間ステップスケジューリングを導入する。
第2段階では,マルチオブジェクトアーティファクトを同時に除去するために,重み付きマージンの定式化を施したファイングラインド・グループレベル直接選好最適化(DPO)を設計する。
論文 参考訳(メタデータ) (2026-02-28T11:56:34Z) - OmniVL-Guard: Towards Unified Vision-Language Forgery Detection and Grounding via Balanced RL [63.388513841293616]
既存の偽造検出手法は、現実世界の誤報に多いインターリーブされたテキスト、画像、ビデオを扱うのに失敗する。
このギャップを埋めるため,本論文では,オムニバス・ビジョン言語による偽造検出と接地のための統一フレームワークの開発を目標としている。
我々は、OmniVL-Guardという、オムニバス視覚言語による偽造検出と接地のためのバランスの取れた強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-11T09:41:36Z) - Enhancing Foundation VLM Robustness to Missing Modality: Scalable Diffusion for Bi-directional Feature Restoration [40.720288165545476]
本研究では,機能不足を効果的に回復するために,拡張拡散モデルをプラグ可能な中段階トレーニングモジュールとして導入する。
I)動的モダリティゲーティング(動的モダリティゲーティング)は、条件付き特徴を適応的に活用し、セマンティック一貫性のある特徴の生成を制御し、(II)双方向アライメントを実現するためにデュアルエンコーダのセマンティック空間をブリッジするクロスモーダル相互学習機構である。
論文 参考訳(メタデータ) (2026-02-03T06:06:35Z) - Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback [82.70507055599093]
本稿では,マルチターン・チェーン・オブ・ソートモデルとブロックワイド・デュプレックスモデルの両方において,SDSの品質向上のための選好学習に関する最初の体系的研究を行う。
実験により, 単一回帰RLAIFは目標距離を選択的に改善し, 連立多重回帰学習は意味的品質と音声の自然性において一貫した利得が得られることが示された。
論文 参考訳(メタデータ) (2026-01-27T00:55:14Z) - Revealing the Truth with ConLLM for Detecting Multi-Modal Deepfakes [16.165111143799617]
ConLLMは、堅牢なマルチモーダルディープフェイク検出のためのハイブリッドフレームワークである。
オーディオディープフェイクEERを最大50%削減し、ビデオの精度を最大8%改善し、オーディオ視覚タスクで約9%の精度向上を実現している。
論文 参考訳(メタデータ) (2026-01-24T17:07:51Z) - Sycophancy Mitigation Through Reinforcement Learning with Uncertainty-Aware Adaptive Reasoning Trajectories [58.988535279557546]
適応推論トラジェクトリを用いたtextbf sycophancy Mitigation を提案する。
SMARTは,分布外の入力に対して強い性能を維持しながら,サイコファンティクスの挙動を著しく低下させることを示した。
論文 参考訳(メタデータ) (2025-09-20T17:09:14Z) - Learning Modality-agnostic Representation for Semantic Segmentation from Any Modalities [8.517830626176641]
Any2Segは、任意の視覚的条件におけるモダリティの組み合わせから堅牢なセグメンテーションを実現する新しいフレームワークである。
4つのモダリティを持つ2つのベンチマークの実験は、Any2Segがマルチモーダル設定の下で最先端を達成することを示した。
論文 参考訳(メタデータ) (2024-07-16T03:34:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。