論文の概要: XTurnix: Large-Scale Self-Supervised Turn Control through Two-State Binary Decisions
- arxiv url: http://arxiv.org/abs/2610.04400v1
- Date: Sat, 03 Oct 2026 09:49:00 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:39:21.063144
- Title: XTurnix: Large-Scale Self-Supervised Turn Control through Two-State Binary Decisions
- Title(参考訳): XTurnix: 2状態二元決定による大規模自己監督型ターン制御
- Abstract要約: XTurnixはテキストベースのコンパクトなモデルで、AIの現在のリスニング状態や発話状態に条件付けられた2つのバイナリ決定として、ターンコントロールを定式化する。
我々は、XTurnixを4つの公開ベンチマークとバランスの取れた自己計算ベンチマークで評価した。
- 参考スコア(独自算出の注目度): 61.21258621703645
- License:
- Abstract: General turn-taking behavior in real-time dialogue systems requires deciding whether to keep listening or start responding while listening, and whether to continue or stop while speaking. Existing turn detectors use heterogeneous, task-specific label spaces and are often trained on limited annotations or evaluated on isolated utterances, making them difficult to use as a unified causal controller with comprehensive context. We propose XTurnix, a compact text-based model that formulates turn control as two binary decisions conditioned on the AI's current listening or speaking state and predicts a single control token from the complete dialogue history. XTurnix is pretrained on 5.5 million causal action examples automatically derived from timestamped two-speaker transcripts, then fine-tuned on synthetic multi-turn examples with a flatter distribution across the four state-action labels. We evaluate XTurnix on four public benchmarks and a balanced self-curated benchmark. Across the public benchmarks, XTurnix achieves the best results on all SemanticVAD and LiveKit splits, ties the native Smart-Turn model on Smart-Turn Bench, and achieves the highest incomplete-turn accuracy on Easy-Turn. On the self-curated benchmark, it reaches 89.06% accuracy, more than 20 percentage points above the strongest third-party baseline at 68.75%, while maintaining F1 scores between 84.21% and 90.63% across all four categories. These results demonstrate unified listening- and speaking-state turn control in a single compact model. Code is available at https://github.com/xcc-zach/xturnix, with an interactive demo at https://huggingface.co/spaces/xcczach/xturnix-demo.
- Abstract(参考訳): リアルタイム対話システムにおける一般的なターンテイク行動は、聴取を継続するか、聴取を継続するか、会話を継続するか、または停止するかを決定する必要がある。
既存のターン検出器は異質なタスク固有のラベル空間を使用し、しばしば限定的なアノテーションで訓練されるか、孤立した発話で評価されるため、包括的なコンテキストを持つ統一因果制御としての使用が困難である。
提案するXTurnixは,AIの現在のリスニング状態や発話状態に条件付けられた2つのバイナリ決定としてターンコントロールを定式化し,完全な対話履歴から単一制御トークンを予測する,コンパクトテキストベースモデルである。
XTurnixは、タイムスタンプされた2文字の転写から自動的に550万件の因果アクションの例に基づいて事前訓練され、その後4つのステートアクションラベルにまたがるより平坦な分布を持つ合成マルチターンの例に微調整される。
我々は、XTurnixを4つの公開ベンチマークとバランスの取れた自己計算ベンチマークで評価した。
公開ベンチマーク全体で、XTurnixはSemanticVADとLiveKitのスプリットで最高の結果を獲得し、Smart-Turn BenchでネイティブのSmart-Turnモデルを結び、Easy-Turnで最高の不完全なターン精度を達成する。
自己計算のベンチマークでは、89.06%の精度に達し、最強のサードパーティベースラインの68.75%を20ポイント以上上回り、F1スコアは4つのカテゴリで84.21%から90.63%に維持されている。
これらの結果は、単一のコンパクトモデルにおいて、聴取状態と発話状態の旋回制御を統一的に行うことを示す。
コードはhttps://github.com/xcc-zach/xturnixで、https://huggingface.co/spaces/xcczach/xturnix-demoでインタラクティブなデモが公開されている。
関連論文リスト
- CypherTurn: A Multi-Turn Benchmark for Conversational Text-to-Cypher Evaluation and the Autonomy Divergence [3.8631093598731585]
我々はCypherTurnを紹介した。CypherTurnは対話型テキスト・to・Cypher評価のための最初のベンチマークである。
導出オラクルプロトコルと完全自律エージェントプロトコルの下で15のモデルを評価する。
最高のモデルの実行精度は64.7%に過ぎず、セッションレベルの正確さは5%以下である。
論文 参考訳(メタデータ) (2026-09-29T08:21:18Z) - A Harness for Synthesizing Diverse Naturalistic Full-Duplex Conversations [17.048567633179037]
本稿では,リレーショナルイベントリストから意図抽出2チャンネル会話音声を合成するためのパイプラインを提案する。
イベントは独立して合成され、ソーステキストと一致し、共有クロック上に置かれ、ターンテイキングランドマークが測定される。
パイプラインは英語とマンダリンの8つの家族の42をカバーしている。
論文 参考訳(メタデータ) (2026-09-23T21:38:54Z) - Voice-Light: A Full-Duplex Cascaded Voice Agent with Causal Turn-Taking and Speculative Generation [0.0]
本稿では、音声の信頼性を耐久性のある歴史のためにレンダリングする音声オーバ・ASRシステムを提案する。
早期に学習した完了チェックポイントは2.70%の偽カット率を維持したが、12.53%のターンリコールしか得られなかった。
したがってシステムは、学習された政治の代替を主張するのではなく、ハイブリッドコントローラを保有する。
論文 参考訳(メタデータ) (2026-09-17T18:49:48Z) - TurnBench: A Multi-Domain Benchmark for Turn-Taking Dynamics in Spoken Dialogue [79.83228182492354]
自然な会話の話し手は、話と聞き取りを交互に行い、いつ床をつかむか、保持するか、または譲るかをリアルタイムで決める。
そこで本研究では,30時間の人的会話を手作業でラベル付けしたコーパスを,エンド・オブ・ターンと割り込み検出のための標準評価プロトコルと組み合わせたベンチマークTurnBenchを提案する。
一方、割り込み偽陽性は強く型依存的であり、バックチャネル・デンス相互作用スタイルに集中している。
論文 参考訳(メタデータ) (2026-08-25T23:14:36Z) - Benchmarking Quantum Machine Learning for Power-System Attack Detection: Evaluation Choices Decide the Outcome Before the Models Do [0.0]
我々は、チューニングされた古典モデルに対する電力システムサイバーアタックのための機械学習検出器をベンチマークする。
ベンチマークの回答は、モデルの前に評価者の選択によって設定される。
正の制御では、正確さはnullである: ラベルはパイプラインではなくパイプラインである。
論文 参考訳(メタデータ) (2026-08-16T08:32:39Z) - Self-Driving Negotiator: An interactive, verifiable benchmark for social negotiation and theory of mind under hidden intent [1.4935265696074094]
自動運転ネゴシエーター(Self-Driving Negotiator)は、運転中の暗黙の社会的調整を測定するための、テキストのみ、マルチターン、手続き的に生成された環境である。
エージェントは特定の駆動動作を生成する。リワードと診断は、モデルの説明からではなく、特権化されたシミュレータ状態から計算される。
本報告では、タスク設計、報酬およびアンチゲーム不変性、検証済みシナリオ、非LLMベースライン、および6モデル推論リーダーボードについて述べる。
論文 参考訳(メタデータ) (2026-06-13T05:58:48Z) - dVoting: Fast Voting for dLLMs [71.572316901001]
拡散大言語モデル(dLLMs)は自己回帰モデリングを超えた新しいパラダイムである。
dLLMは任意の位置で任意のトークンを並列に生成できるため、並列テストタイムスケーリングには大きな可能性がある。
トレーニングなしで推論能力を高める高速投票手法であるdVotingを導入する。
論文 参考訳(メタデータ) (2026-02-12T16:35:05Z) - One Battle After Another: Probing LLMs' Limits on Multi-Turn Instruction Following with a Benchmark Evolving Framework [51.50565654314582]
大規模言語モデルは、複数のトピックにまたがる対話を通して、ユーザの指示に従うことができる。
既存のベンチマークは、しばしば一定回数のターンに制限されるため、飽和の影響を受けにくく、ユーザのインタラクティブなエクスペリエンスを考慮できない。
マルチターン命令追従能力を評価するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-05T14:39:59Z) - Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities [93.09944267871163]
FullDuplexBenchは、重要なインタラクティブな振る舞いを体系的に評価するベンチマークである。
ベンチマークコードを公開することによって、音声対話モデリングの進歩と、より自然で魅力的なSDMの開発を目指しています。
論文 参考訳(メタデータ) (2025-03-06T18:59:16Z) - Perception Test: A Diagnostic Benchmark for Multimodal Video Models [78.64546291816117]
本稿では,事前学習したマルチモーダルモデルの知覚と推論能力を評価するために,新しいマルチモーダルビデオベンチマークを提案する。
知覚テストは、スキル(記憶、抽象化、物理学、セマンティックス)と、ビデオ、オーディオ、テキストモダリティ間の推論(記述的、説明的、予測的、反ファクト的)のタイプに焦点を当てている。
このベンチマークは、ゼロショット/少数ショットまたは限定的な微調整方式で、転送機能の事前訓練されたモデルを探索する。
論文 参考訳(メタデータ) (2023-05-23T07:54:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。