論文の概要: The Role of Disfluencies in Speech Translation
- arxiv url: http://arxiv.org/abs/2608.02138v1
- Date: Mon, 03 Aug 2026 12:26:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.52891
- Title: The Role of Disfluencies in Speech Translation
- Title(参考訳): 音声翻訳における拡散の役割
- Abstract要約: 現在の音声翻訳システムは、翻訳するよりむしろ、文末や偽りの開始といった不一致を除去する傾向にある。
言論のクリーンアップ時に失われる意味を持つ不一致は、コストがかかることを示している。
推論時のデコーディングは、再トレーニングなしにこれを緩和し、ベンチマークとコードをリリースします。
- 参考スコア(独自算出の注目度): 74.9653116322058
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Current speech translation systems, including SpeechLLMs, are trained on cleaned text and tend to strip disfluencies like filled pauses and false starts rather than translate them. We show this comes at a cost: disfluencies carry meaning that gets lost when speech is cleaned up. To study this systematically, we introduce Uh-Mazing, a benchmark of human-translated, disfluency-annotated Switchboard speech covering English into eight target languages. Across these languages and several architectures, we find that false starts and self-repairs, not filled pauses or discourse markers, drive most of the translation-quality loss, and that models which fail to preserve a disfluency tend to omit it rather than mistranslate it. We show inference-time decoding can mitigate this without retraining, and release the benchmark and code.
- Abstract(参考訳): 現在、SpeechLLMsを含む音声翻訳システムは、クリーンテキストで訓練されており、翻訳するよりも、停止や偽開始などの障害を取り除く傾向にある。
言論のクリーンアップ時に失われる意味を持つ不一致は、コストがかかることを示している。
これを体系的に研究するために、Uh-Mazingは、人間の翻訳された、不規則な注釈付きスイッチボード音声のベンチマークで、英語を8つのターゲット言語にカバーする。
これらの言語といくつかのアーキテクチャ全体で、停止や談話マーカーが満たされていない偽の開始と自己修復が、翻訳品質の損失の大部分を駆動し、不規則を保存するのに失敗するモデルは、それを誤訳するよりも省略する傾向があることが分かりました。
推論時のデコーディングは、再トレーニングなしにこれを緩和し、ベンチマークとコードをリリースします。
関連論文リスト
- Automatic Labelling of Speech Translation Errors [11.234683445082188]
音声翻訳エラーラベリング(英: Speech Translation Error Labelling、STEL)は、音声翻訳の信頼性と品質評価を行う手法である。
我々は、アノテーションプロトコル、小さなエンドツーエンド評価データセットを作成し、既存のテキストのみおよび音声処理システムがどのようにSTELタスクを実行するかを解析する。
論文 参考訳(メタデータ) (2026-06-04T11:42:37Z) - Mind the Pause: Disfluency-Aware Objective Tuning for Multilingual Speech Correction with LLMs [32.94544776067079]
ASRの書き起こしには、フィラー、繰り返し、偽の開始などの不一致がしばしば含まれている。
既存のアプローチのほとんどは、除去のための非流動的なトークンを特定することに焦点を当てた古典的なモデルに依存している。
本稿では,まずシーケンスタグが不自由なトークンをマークする多言語補正パイプラインを提案し,これらの信号はLLMの微調整を指導し,書き起こしを流用テキストに書き換える。
論文 参考訳(メタデータ) (2026-05-12T15:11:36Z) - Simultaneous Speech-to-Speech Translation Without Aligned Data [52.467808474293605]
同時音声翻訳では、ソース音声を対象言語にリアルタイムで翻訳する必要がある。
単語レベルのアライメントを完全に不要にするヒビキゼロを提案する。
Hibiki-Zeroは5つのX-英語タスクの翻訳精度、レイテンシ、音声転送、自然性において最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-02-11T17:41:01Z) - Lost in Literalism: How Supervised Training Shapes Translationese in LLMs [51.04435855143767]
大規模言語モデル(LLM)は機械翻訳において顕著な成功を収めた。
しかし、過度にリテラルと不自然な翻訳を特徴とする翻訳は、依然として永続的な課題である。
我々は、黄金の基準を磨き、不自然なトレーニングインスタンスをフィルタリングするなど、これらのバイアスを軽減する方法を導入する。
論文 参考訳(メタデータ) (2025-03-06T12:14:45Z) - Crossing the Threshold: Idiomatic Machine Translation through Retrieval
Augmentation and Loss Weighting [66.02718577386426]
慣用的な翻訳と関連する問題を簡易に評価する。
我々は,変圧器をベースとした機械翻訳モデルが慣用的な翻訳に対して正しくデフォルトとなる点を明らかにするための合成実験を行った。
自然慣用句の翻訳を改善するために, 単純かつ効果的な2つの手法を導入する。
論文 参考訳(メタデータ) (2023-10-10T23:47:25Z) - DisfluencyFixer: A tool to enhance Language Learning through Speech To
Speech Disfluency Correction [50.51901599433536]
DisfluencyFixerは、英語とヒンディー語で音声から音声への拡散補正を行うツールである。
提案システムでは,入力音声からの拡散を除去し,出力として流速音声を返却する。
論文 参考訳(メタデータ) (2023-05-26T14:13:38Z) - Assessing Evaluation Metrics for Speech-to-Speech Translation [9.670709690031885]
音声から音声への翻訳は機械翻訳と音声合成を組み合わせたものである。
音声から音声への翻訳を自動的に評価する方法は、これまで検討されていないオープンな質問である。
論文 参考訳(メタデータ) (2021-10-26T17:35:20Z) - Bridging the Modality Gap for Speech-to-Text Translation [57.47099674461832]
エンド・ツー・エンドの音声翻訳は、ある言語における音声を、エンド・ツー・エンドの方法で他の言語におけるテキストに変換することを目的としている。
既存のほとんどの手法では、音響表現と意味情報を同時に学習するために、単一のエンコーダを持つエンコーダ・デコーダ構造を用いる。
本稿では,音声とテキスト間のモダリティギャップを埋めることで,エンドツーエンドのモデル性能を向上させることを目的とした音声翻訳モデルのための音声テキスト適応手法を提案する。
論文 参考訳(メタデータ) (2020-10-28T12:33:04Z) - Fluent and Low-latency Simultaneous Speech-to-Speech Translation with
Self-adaptive Training [40.71155396456831]
音声から音声への同時翻訳は広く有用であるが,極めて困難である。
ソース言語音声と並行してターゲット言語音声を生成する必要があるが、わずか数秒遅れている。
現在のアプローチは、話者がより速く話すときの遅延を徐々に蓄積し、話者がゆっくり話すときの不自然な停止を導入する。
そこで本稿では,翻訳の長さを柔軟に調整し,異なる音源の音声レートに対応する自己適応翻訳(SAT)を提案する。
論文 参考訳(メタデータ) (2020-10-20T06:02:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。