論文の概要: Transformer-based segmentation of prosodic boundaries in Brazilian Portuguese
- arxiv url: http://arxiv.org/abs/2607.07408v2
- Date: Mon, 13 Jul 2026 16:03:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.266099
- Title: Transformer-based segmentation of prosodic boundaries in Brazilian Portuguese
- Title(参考訳): ブラジルポルトガル語における韻律境界のトランスフォーマーに基づくセグメンテーション
- Authors: Rodrigo de Freitas Lima, Julio Cesar Galdino, Marcos Vinicius Treviso,
- Abstract要約: 本稿では,Whisper ベースセグメンタ SAMPA について述べる。
NURC-SPデータセットから手作業で分割した記録にWhisper large-v3を微調整する。
本モデルは, 韻律的境界を検出するための形態的, 意味的, 韻律的手がかりに従っていることを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Automatic prosodic segmentation identifies boundaries between speech units from acoustic and linguistic evidence. Although recent deep learning approaches have produced strong results for English, automatic segmentation for Brazilian Portuguese (BP) still relies mostly on rule-based or traditional machine-learning methods. This paper presents SAMPA, a Whisper-based segmenter that transcribes BP speech while inserting explicit markers for terminal prosodic boundaries. We fine-tune Whisper large-v3 on manually segmented recordings from the NURC-SP dataset and evaluate different training and test-time filtering configurations, including out-of-distribution testing on the MuPe-Diversidades dataset. SAMPA achieves competitive boundary-detection performance across settings, with the best models reaching F1=0.731 on the held-out test split and F1=0.796 on MuPe-Diversidades. Finally, through n-gram and acoustic-visual analyses, we show that our model follows morphosyntactic, semantic, and prosodic cues for detecting prosodic boundaries.
- Abstract(参考訳): 自動韻律分割は、音響的証拠と言語的証拠から音声単位の境界を識別する。
最近のディープラーニングアプローチは英語に強い結果をもたらしているが、ブラジルポルトガル語(BP)の自動セグメンテーションは依然としてルールベースや伝統的な機械学習手法に大きく依存している。
本稿では,Whisper ベースセグメンタ SAMPA について述べる。
NURC-SPデータセットから手動で分割した記録にWhisperの大容量v3を微調整し、MuPe-Diversidadesデータセットのアウト・オブ・ディストリビューションテストを含む、異なるトレーニングおよびテスト時間フィルタリング構成を評価する。
SAMPAは設定間での競合境界検出性能を達成し、最良モデルはホールドアウトテストスプリットでF1=0.731、MuPe-DiversidadesでF1=0.796に達する。
最後に, n-gram と音響視覚解析により, このモデルが韻律的境界を検出するための形態的, 意味的, 韻律的手がかりに従うことを示す。
関連論文リスト
- Unveiling Language Routing Isolation in Multilingual MoE Models for Interpretable Subnetwork Adaptation [65.69228479949693]
Mixture-of-Experts (MoE)モデルは、言語間での大幅なパフォーマンス格差を示す。
我々は、ルーティングアイソレーションを利用して言語固有のエキスパートワークを特定し、適応するフレームワークRISE(Routing isolation-guided Subnetwork Enhancement)を提案する。
論文 参考訳(メタデータ) (2026-04-04T04:56:35Z) - PRiSM: Benchmarking Phone Realization in Speech Models [70.82595415252682]
音声認識(PR)は言語に依存しない言語間音声処理と音声解析のためのアトミックインタフェースとして機能する。
PRiSMは、音声知覚における盲点を明らかにするために設計された、最初のオープンソースベンチマークである。
論文 参考訳(メタデータ) (2026-01-20T15:00:36Z) - Entropy-Driven Pre-Tokenization for Byte-Pair Encoding [4.145560327709288]
2つのエントロピーインフォームドプレトークン化戦略は、教師なし情報理論を用いたBPEセグメンテーションを導く。
両手法をPKUデータセットのサブセット上で評価し,通常のBPEと比較して,セグメンテーション精度,リコール,F1スコアが大幅に向上したことを示す。
論文 参考訳(メタデータ) (2025-06-18T21:25:55Z) - Advancing Topic Segmentation of Broadcasted Speech with Multilingual Semantic Embeddings [2.615008111842321]
セマンティック音声エンコーダを用いたトピックセグメンテーションのためのエンドツーエンドスキームを提案する。
そこで本研究では,1000時間の公開録音を特徴とするデータセットを用いて,音声ニューストピックセグメンテーションのための新しいベンチマークを提案する。
この結果から,従来のパイプライン方式では英語のP_k$スコアが0.2431であるのに対して,エンドツーエンドモデルは競争力のあるP_k$スコアが0.2564であることがわかった。
論文 参考訳(メタデータ) (2024-09-10T05:24:36Z) - MAGNET: Improving the Multilingual Fairness of Language Models with Adaptive Gradient-Based Tokenization [81.83460411131931]
マルチ言語設定では、非ラテン語スクリプトと低リソース言語は通常、言語モデルの実用性、効率、コストの点で不利である。
適応的勾配に基づくサブワードトークン化による過分割を低減するために,多言語適応型勾配ベーストークン化を提案する。
論文 参考訳(メタデータ) (2024-07-11T18:59:21Z) - Smart Speech Segmentation using Acousto-Linguistic Features with
look-ahead [3.579111205766969]
本稿では,音響情報と言語情報を併用してセグメンテーションを改善するハイブリッド手法を提案する。
平均して、私たちのモデルはセグメンテーション-F0.5スコアをベースラインで9.8%改善します。
機械翻訳の下流タスクでは、BLEUスコアを平均1.05ポイント改善する。
論文 参考訳(メタデータ) (2022-10-26T03:36:31Z) - Dealing with training and test segmentation mismatch: FBK@IWSLT2021 [13.89298686257514]
本稿では,FIWLT 2021オフライン音声翻訳タスクに対するFBKのシステム適用について述べる。
英語の音声データをドイツ語のテキストに変換するために訓練されたトランスフォーマーベースのアーキテクチャである。
訓練パイプラインは、知識蒸留と2段階の微調整手順により特徴づけられる。
論文 参考訳(メタデータ) (2021-06-23T18:11:32Z) - End-to-End Automatic Speech Recognition Integrated With CTC-Based Voice
Activity Detection [48.80449801938696]
本稿では,音声活動検出機能とエンドツーエンドの自動音声認識を統合する。
我々は,コネクショニストの時間的分類(CTC)と,同期/アテンションの拡張に焦点を当てた。
簡単なしきい値を用いた音声区間検出のためのキューとしてラベルを用いる。
論文 参考訳(メタデータ) (2020-02-03T03:36:34Z) - Continuous speech separation: dataset and analysis [52.10378896407332]
自然な会話では、音声信号は連続的であり、重複成分と重複成分の両方を含む。
本稿では,連続音声分離アルゴリズムを評価するためのデータセットとプロトコルについて述べる。
論文 参考訳(メタデータ) (2020-01-30T18:01:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。