論文の概要: On the Role of Conversational Timing in Synthetic Training Data for ASR
- arxiv url: http://arxiv.org/abs/2607.08371v1
- Date: Thu, 09 Jul 2026 11:40:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.510537
- Title: On the Role of Conversational Timing in Synthetic Training Data for ASR
- Title(参考訳): 合成学習データにおける会話タイミングの役割について
- Abstract要約: 本稿では,会話のタイミングを制御可能な学習変数として検討する。
複数の対話コーパスから推定した指数型タイピングファミリーを用いて、停止時間と重複タイミングの分布をパラメータ化する。
- 参考スコア(独自算出の注目度): 1.0251581485267474
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Synthetic multi-speaker conversations are widely used to train conversational automatic speech recognition (ASR) systems, but it remains unclear which timing properties make simulated data most useful. This paper studies conversational timing as a controllable training variable rather than merely as a corpus statistic to be reproduced. We parameterize pause and overlap timing distributions with an exponential-tilting family estimated from multiple conversational corpora, and then explore the resulting four-dimensional parameter space with Latin hypercube sampling and multi-objective Bayesian optimization. Each sampled timing configuration is used to generate simulated training conversations, train an ASR system, and evaluate concatenated-permutation word and character error rates (cpWER and cpCER) on a Hungarian dialogue corpus. The results show that downstream ASR behavior is explained more directly by induced timing statistics than by raw simulator coordinates or corpus proximity. In particular, higher overlap exposure is associated with lower cpWER, whereas longer and more variable gaps are associated with higher cpWER; cpCER follows the same trend, but with weaker statistical support. Bayesian optimization yields modest aggregate improvements, but its main value is analytical: it produces controlled timing interventions that reveal an overlap--gap trade-off in simulated conversational training data. These findings suggest that realistic simulation should be complemented by task-relevant diagnostics of overlap, gap, and timing-variability profiles.
- Abstract(参考訳): 合成多話者会話は、会話自動音声認識(ASR)システムの訓練に広く用いられているが、どのタイミング特性がシミュレーションデータを最も有用にするかは定かではない。
本稿では,会話のタイミングを単にコーパス統計としてではなく,制御可能な学習変数として検討する。
我々は,複数の対話コーパスから推定される指数型タイピングファミリーを用いて停止時間と重複タイミングの分布をパラメータ化し,ラテンハイパーキューブサンプリングと多目的ベイズ最適化を用いて結果の4次元パラメータ空間を探索する。
各サンプルタイミング設定は、シミュレートされたトレーニング会話を生成し、ASRシステムを訓練し、ハンガリーの対話コーパス上で連結置換語と文字誤り率(cpWERおよびcpCER)を評価する。
その結果、下流ASRの挙動は、生のシミュレータの座標やコーパスの近接よりも、より直接的に時間統計によって説明されることがわかった。
特に、高い重複露光はより低いcpWERに関連付けられ、一方、より長い変化のギャップは高いcpWERに関連付けられ、cpCERは同じ傾向を辿るが、より弱い統計的支持を持つ。
ベイズ最適化は、最小限の集約的改善をもたらすが、その主な価値は分析的であり、シミュレートされた会話訓練データにおいて、重なるギャップのトレードオフを明らかにする制御されたタイミング介入を生成する。
これらの結果から, 現実的なシミュレーションは, 重複, ギャップ, タイミング変数プロファイルのタスク関連診断によって補完されるべきであることが示唆された。
関連論文リスト
- PERMA: Benchmarking Personalized Memory Agents via Event-Driven Preference and Realistic Task Environments [72.02445514666428]
静的な嗜好リコールを超えてペルマの一貫性を評価するためのベンチマークであるPERMAを紹介する。
PerMAは、複数のセッションとドメインにまたがる時間的に順序付けられたインタラクションイベントと、時間とともに好みに関連するクエリで構成されている。
実験により、関連するインタラクションをリンクすることで、高度なメモリシステムはより正確な好みを抽出し、トークン消費を減らすことができることが示された。
論文 参考訳(メタデータ) (2026-03-24T14:04:11Z) - Speaker-Aware Simulation Improves Conversational Speech Recognition [1.0251581485267474]
ハンガリー語会話型ASRのためのSASCフレームワークを適応し実装する。
C-SASC(C-SASC)は、発話時間に条件付きポーズモデリングを組み込んだ拡張版である。
我々は、BEA-Largeコーパスから合成ハンガリー語対話を生成し、それらを実際の会話データと組み合わせてASR訓練を行う。
論文 参考訳(メタデータ) (2026-02-04T17:12:09Z) - Memory-T1: Reinforcement Learning for Temporal Reasoning in Multi-session Agents [80.33280979339123]
強化学習(RL)を用いた時間認識メモリ選択ポリシーを学習するフレームワークであるMemory-T1を紹介する。
Time-Dialogベンチマークでは、Memory-T1が7Bモデルを67.0%に引き上げ、オープンソースモデルの新たな最先端パフォーマンスを確立した。
論文 参考訳(メタデータ) (2025-12-23T06:37:29Z) - Cross Space and Time: A Spatio-Temporal Unitized Model for Traffic Flow Forecasting [16.782154479264126]
時間的要因間の複雑な相互作用により、バックボーン・時間的トラフィックフローを予測することが課題となる。
既存のアプローチでは、これらの次元を分離し、重要な相互依存を無視している。
本稿では,空間的および時間的依存関係の両方をキャプチャする統合フレームワークであるSanonymous-Temporal Unitized Unitized Cell (ASTUC)を紹介する。
論文 参考訳(メタデータ) (2024-11-14T07:34:31Z) - TIGER: Time-frequency Interleaved Gain Extraction and Reconstruction for Efficient Speech Separation [19.126525226518975]
パラメータと計算コストを大幅に削減した音声分離モデルを提案する。
TIGERは事前の知識を活用して周波数帯域を分割し、周波数情報を圧縮する。
我々はTIGERがパラメータ数を94.3%削減し、MACを95.3%削減することを示した。
論文 参考訳(メタデータ) (2024-10-02T12:21:06Z) - Predictive Speech Recognition and End-of-Utterance Detection Towards Spoken Dialog Systems [55.99999020778169]
本稿では,次の単語を予測し,発話終了まで残される時間を推定する機能について検討する。
我々は,音響情報と言語情報の両方を組み込んだクロスアテンションに基づくアルゴリズムを開発した。
その結果,提案モデルでは,提案する単語を予測し,将来のEOUイベントを実際のEOUより300ミリ秒前まで推定する能力を示した。
論文 参考訳(メタデータ) (2024-09-30T06:29:58Z) - TimeGraphs: Graph-based Temporal Reasoning [64.18083371645956]
TimeGraphsは階層的時間グラフとして動的相互作用を特徴付ける新しいアプローチである。
提案手法は,コンパクトなグラフベース表現を用いて相互作用をモデル化し,多種多様な時間スケールでの適応推論を可能にする。
我々は,サッカーシミュレータ,抵抗ゲーム,MOMA人間活動データセットなど,複雑でダイナミックなエージェントインタラクションを持つ複数のデータセット上でTimeGraphsを評価する。
論文 参考訳(メタデータ) (2024-01-06T06:26:49Z) - Soft Random Sampling: A Theoretical and Empirical Analysis [59.719035355483875]
ソフトランダムサンプリング(SRS)は、大量のデータを扱う際に、効率的なディープニューラルネットワークに対して単純だが効果的なアプローチである。
それは、各エポックに設定された各データセットから、ランダムに置換された均一な速度を選択する。
実世界の産業規模で重要な競争力を持つ、強力で競争力のある戦略であることが示されている。
論文 参考訳(メタデータ) (2023-11-21T17:03:21Z) - On the Relevance of Phoneme Duration Variability of Synthesized Training
Data for Automatic Speech Recognition [0.552480439325792]
合成データの時間構造とASRトレーニングとの関係に着目した。
本研究では, 合成データ品質の劣化が, 非自己回帰性TSの持続時間モデルにどの程度影響されているかを示す。
簡単なアルゴリズムを用いて,TTSシステムの音素持続時間分布を実時間に近づける。
論文 参考訳(メタデータ) (2023-10-12T08:45:21Z) - Using External Off-Policy Speech-To-Text Mappings in Contextual
End-To-End Automated Speech Recognition [19.489794740679024]
本稿では,外部知識の活用の可能性について検討する。
提案手法では,音声の音声埋め込みと意味的テキスト埋め込みを併用して,ASRに偏りを生じさせる。
LibiriSpeechと社内音声アシスタント/検索データセットの実験により、提案手法により、最大1KのGPU時間でドメイン適応時間を短縮できることが示された。
論文 参考訳(メタデータ) (2023-01-06T22:32:50Z) - Any-to-Many Voice Conversion with Location-Relative Sequence-to-Sequence
Modeling [61.351967629600594]
本稿では,非並列音声変換手法である非並列音声変換法(seq2seq)を提案する。
本手法では,ボトルネック特徴抽出器(BNE)とセック2セック合成モジュールを組み合わせる。
主観的および主観的評価は,提案手法が自然性と話者類似性の両方において優れた音声変換性能を有することを示す。
論文 参考訳(メタデータ) (2020-09-06T13:01:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。