論文の概要: Real-TurnTurk: A Multimodal Turkish Corpus for Turn-Taking Prediction
- arxiv url: http://arxiv.org/abs/2608.22071v1
- Date: Sat, 22 Aug 2026 18:29:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.580526
- Title: Real-TurnTurk: A Multimodal Turkish Corpus for Turn-Taking Prediction
- Title(参考訳): Real-TurnTurk: ターンタイキング予測のためのマルチモーダルトルココーパス
- Authors: Ahmet Tuğrul Bayrak, Fatma Nur Korkmaz, Bekir Berker Türker, Mustafa Sertaç Türkel, Alper Kaplan,
- Abstract要約: ターンテイクは人間の会話の基本的な組織的特徴であり、自然な同期ダイアログシステムではモデル化が困難である。
本研究では, 話者ごとの音声チャンネル, 時刻順の書き起こしを含む, 未記述のディヤド対話のマルチモーダルなトルコ語データセットを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Turn-taking is a basic organizational feature of human conversation and remains difficult to model in natural, synchronous dialog systems. While existing research has explored multimodal approaches and large language models for turn-ending prediction, there is a lack of naturalistic conversational corpora specifically addressing turn-taking dynamics in Turkish. This study introduces a multimodal Turkish conversational dataset of unscripted dyadic interactions, comprising synchronized front-facing video, per-speaker audio channels that allow overlapping speech to be attributed to individual speakers, and time-aligned transcriptions. Turn-taking prediction is formulated as a binary classification problem, and a Genetic Algorithm (GA) is employed to optimize interpretable decision rules derived from visual, acoustic, and linguistic features. A hybrid AND-OR rule representation is adopted in the proposed framework to represent the alternative cue combinations that precede a turn transition.
- Abstract(参考訳): ターンテイクは人間の会話の基本的な組織的特徴であり、自然な同期ダイアログシステムではモデル化が困難である。
既存の研究では、ターンエンド予測のためのマルチモーダルアプローチと大規模言語モデルについて検討されているが、トルコのターンテイクダイナミクスに特化して対処する自然主義的な会話コーパスは存在しない。
本研究では,複数モーダルなトルコ語対話型対話データセットについて紹介する。前向きビデオの同期,重なり合う音声を個々の話者に帰属させる話者ごとの音声チャンネル,時刻順の書き起こしなどである。
ターンテイク予測は二項分類問題として定式化され、視覚的、音響的、言語的特徴から導かれる解釈可能な決定規則を最適化するために遺伝的アルゴリズム(GA)が用いられる。
ターン遷移に先立って、代替キューの組み合わせを表現するために、提案フレームワークにハイブリッドなAND-ORルール表現が採用されている。
関連論文リスト
- Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders [5.677986854981345]
ターンテイク予測は、人間と人間の相互作用に関わる社会ロボットにとって重要な要件である。
本研究は,音声のみのVAPを拡張するマルチモーダル音声活動投影フレームワークを提案する。
提案手法は、もともと音声関連タスクに最適化された事前訓練されたオーディオ視覚バックボーンに基づいて構築される。
論文 参考訳(メタデータ) (2026-07-08T11:34:00Z) - MOSS-TTSD: Text to Spoken Dialogue Generation [62.04179716555789]
複数の言語にまたがる多人数会話音声のための音声対話合成モデルであるMOSS-TTSDを提案する。
長文モデリングの強化により、MOSS-TTSDは明示的な話者タグを持つ対話スクリプトから長文音声対話を生成する。
このモデルは、英語や中国語を含む様々な主流言語をサポートし、いくつかの長文のシナリオに適応している。
論文 参考訳(メタデータ) (2026-03-20T08:23:31Z) - Aligning Spoken Dialogue Models from User Interactions [55.192134724622235]
本稿では,ユーザの対話からリアルタイム会話における音声対話モデルを改善するための新しい嗜好アライメントフレームワークを提案する。
AIフィードバックを付加した生のマルチターン音声会話から15万以上の好みペアのデータセットを作成する。
本研究は, 自然なリアルタイム音声対話システムにおいて重要な, 様々な力学におけるバランスの整合性の重要性を浮き彫りにした。
論文 参考訳(メタデータ) (2025-06-26T16:45:20Z) - Prompt-Guided Turn-Taking Prediction [20.002659517035557]
ターンテイク予測モデルは、音声対話システムや会話ロボットにおいて不可欠な要素である。
近年のアプローチでは、トランスフォーマーに基づくアーキテクチャを活用して、音声活動の連続的およびリアルタイムな予測を行っている。
本稿では,テキストのプロンプトによってターンテイク予測を動的に制御できる新しいモデルを提案する。
論文 参考訳(メタデータ) (2025-06-26T12:49:07Z) - TransVIP: Speech to Speech Translation System with Voice and Isochrony Preservation [97.54885207518946]
カスケード方式で多様なデータセットを活用する新しいモデルフレームワークTransVIPを提案する。
本稿では、話者の音声特性と、翻訳過程における音源音声からの等時性を維持するために、2つの分離エンコーダを提案する。
フランス語と英語のペアに関する実験により、我々のモデルは、現在最先端の音声音声翻訳モデルよりも優れていることを示した。
論文 参考訳(メタデータ) (2024-05-28T04:11:37Z) - Cross-Modal Mutual Learning for Cued Speech Recognition [10.225972737967249]
マルチモーダルインタラクションを促進するためのトランスフォーマーに基づく相互学習フレームワークを提案する。
我々のモデルは、モダリティ固有の異なるモダリティの情報に、モダリティ不変のコードブックを通らせるよう強制する。
中国語のための大規模多話者CSデータセットを新たに構築する。
論文 参考訳(メタデータ) (2022-12-02T10:45:33Z) - Learning to Listen: Modeling Non-Deterministic Dyadic Facial Motion [89.01668641930206]
本稿では,対話における対話コミュニケーションをモデル化するための枠組みを提案する。
我々は、対応するリスナー動作の複数の可能性を自動回帰的に出力する。
本手法は,非言語的ダイアド相互作用の多モーダルおよび非決定論的性質を有機的に捕捉する。
論文 参考訳(メタデータ) (2022-04-18T17:58:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。