論文の概要: X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction
- arxiv url: http://arxiv.org/abs/2608.10878v2
- Date: Wed, 19 Aug 2026 03:16:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 15:48:19.515516
- Title: X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction
- Title(参考訳): X2-Turn:ジョイントストリーミングASRとターン状態予測のためのフレーム同期デュアルヘッドモデリング
- Abstract要約: X2-Turnは遅延ストリームモデリングによるフレーム同期ターン状態予測手法である。
本稿では,共有ストリーミング表現において,ASRヘッドと並列に動作するフレーム同期型ターンステートヘッドを提案する。
- 参考スコア(独自算出の注目度): 6.446583777614073
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Accurate and responsive turn-taking is essential for spoken dialogue systems, which must distinguish in real time between user interruptions, backchannels that should be ignored, and the completion of an utterance. Prior modular approaches typically optimize turn state prediction at the utterance or fixed-chunk level, creating a mismatch with the continuous turn state estimate, and often depend on an auxiliary ASR model, which limits responsiveness and increases overall system complexity. Therefore, we present X2-Turn, a frame-synchronous turn state prediction method via delayed-stream modeling. Specifically, building on the pretrained Voxtral Realtime model, we introduce a frame-synchronous turn state head that operates in parallel with the ASR head on shared streaming representations, jointly predicting ASR tokens and fine-grained turn states at the frame level. We evaluate our method on the bilingual Chinese-English Easy-Turn test sets, and the results demonstrate its effectiveness in achieving accurate turn-taking detection while maintaining low latency.
- Abstract(参考訳): 音声対話システムでは, ユーザの割り込み, 無視すべきバックチャネル, 発話の完了をリアルタイムに区別する必要がある。
以前のモジュラーアプローチでは、通常、発話や固定チャンクレベルでのターン状態予測を最適化し、連続的なターン状態推定とミスマッチを生成し、応答性を制限しシステム全体の複雑さを増大させる補助的なASRモデルに依存する。
そこで本研究では,遅延ストリームモデリングによるフレーム同期ターン状態予測手法であるX2-Turnを提案する。
具体的には、事前訓練されたVoxtral Realtimeモデルに基づいて、共有ストリーミング表現上でASRヘッドと並列に動作するフレーム同期ターンステートヘッドを導入し、フレームレベルでのASRトークンときめ細かいターンステートを共同予測する。
本手法を中国語/英語/中国語/英語/Turnテストセットで評価し,低レイテンシを保ちながら高精度なターンテイク検出を実現する上での有効性を実証した。
関連論文リスト
- Overcoming State Inertia in Full-Duplex Spoken Language Models via Activation Steering [87.43777061308658]
フル音声言語モデル(FDSLM)における予測行動の解析
FDSLMは、モデル出力生成に整合した生成状態と、ユーザ入力に整合した知覚状態の2つの状態間の内部焦点を動的に変調する。
ユーザ中断中は、モデルが知覚状態に遷移する前に生成状態に対して過渡的に偏りを保ち、入力の開始を逃す。
論文 参考訳(メタデータ) (2026-06-09T19:08:07Z) - Synchronization and Turn-Taking in Full-Duplex Speech Dialogue Models [3.5946669116828134]
完全な音声対話モデルは、ターンベースシステムよりも人間の会話に近い声を同時に話すことができる。
本研究では,人間のコミュニケーションにおいて,ニューラルカップリングを用いた内部相互作用を協調するモデルを提案する。
雑音のない条件下では強い表現同期が得られ、ラグはゼロに近づき、ノイズは劣化する。
論文 参考訳(メタデータ) (2026-05-19T18:11:03Z) - LeapTS: Rethinking Time Series Forecasting as Adaptive Multi-Horizon Scheduling [74.94985663101906]
本稿では,予測地平線上での動的スケジューリングプロセスとして時系列予測を再構成する新しいフレームワーク LeapTSを提案する。
LeapTSは、Transformerベースのモデルよりも2.6$times$から5.3$times$推論スピードアップを実現しつつ、全体的な予測性能を少なくとも7.4%向上させる。
論文 参考訳(メタデータ) (2026-05-11T09:54:02Z) - An ALE-Consistent Graph Neural Operator-Transformer Framework for Fluid-Structure Interaction [0.0]
本稿では,非構造化メッシュの変形予測のための任意のラグランジアン・エレリアン(ALE)一貫性機械学習フレームワークを提案する。
このフレームワークは、シリンダーの起動時のフレキシブルビーム振動のベンチマーク問題である。
論文 参考訳(メタデータ) (2026-05-01T03:36:18Z) - JAL-Turn: Joint Acoustic-Linguistic Modeling for Real-Time and Robust Turn-Taking Detection in Full-Duplex Spoken Dialogue Systems [3.0789720666469407]
JAL-Turnは、音声認識と完全に並行して動作する、音声のみのターンテイクフレームワークである。
JAL-Turnは、優れたリアルタイム性能を維持しながら、検出精度において、強い最先端のベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-03-27T15:25:38Z) - Parallel BiLSTM-Transformer networks for forecasting chaotic dynamics [24.960864709838436]
本研究では,Transformer と Bidirectional Long Short-Term Memory Network を統合した並列予測フレームワークを提案する。
提案したハイブリッドモデルはデュアルブランチアーキテクチャを採用しており、Transformerブランチは主に長距離依存関係をキャプチャする。
結果は、提案されたハイブリッドフレームワークがタスク間でシングルブランチアーキテクチャの両方より優れていることを一貫して示している。
論文 参考訳(メタデータ) (2025-10-27T16:17:10Z) - ReCoM: Realistic Co-Speech Motion Generation with Recurrent Embedded Transformer [58.49950218437718]
音声に同期した高忠実で一般化可能な人体動作を生成するための効率的なフレームワークであるReCoMを提案する。
Recurrent Embedded Transformer (RET)は、動的埋め込み正規化(DER)をViT(Vit)コアアーキテクチャに統合する。
モデルロバスト性を高めるため,ノイズ抵抗とクロスドメイン一般化の二重性を持つモデルに,提案したDER戦略を取り入れた。
論文 参考訳(メタデータ) (2025-03-27T16:39:40Z) - Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities [93.09944267871163]
FullDuplexBenchは、重要なインタラクティブな振る舞いを体系的に評価するベンチマークである。
ベンチマークコードを公開することによって、音声対話モデリングの進歩と、より自然で魅力的なSDMの開発を目指しています。
論文 参考訳(メタデータ) (2025-03-06T18:59:16Z) - Bench2Drive-R: Turning Real World Data into Reactive Closed-Loop Autonomous Driving Benchmark by Generative Model [63.336123527432136]
我々は,リアクティブ閉ループ評価を可能にする生成フレームワークであるBench2Drive-Rを紹介する。
既存の自動運転用ビデオ生成モデルとは異なり、提案された設計はインタラクティブなシミュレーションに適したものである。
我々は、Bench2Drive-Rの生成品質を既存の生成モデルと比較し、最先端の性能を達成する。
論文 参考訳(メタデータ) (2024-12-11T06:35:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。