論文の概要: Automatic Speech Recognition for Multilingual Oral History Research
- arxiv url: http://arxiv.org/abs/2609.04232v1
- Date: Tue, 21 Jul 2026 22:09:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.468209
- Title: Automatic Speech Recognition for Multilingual Oral History Research
- Title(参考訳): 多言語口腔史研究のための音声認識
- Abstract要約: コミュニティ主導の言語維持戦略として、ニュージーランドのカントン言語再生において、口頭の歴史は重要な役割を担っている。
W Whisperは手書きの書き起こしに要する時間のうち1%しか使わない最初のパスの書き起こしを提供することで有用なツールである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This paper offers a unique perspective on how speech technologies are being adopted by community-led heritage language preservation and revitalisation initiatives. As a community-led language maintenance strategy, oral histories play a crucial role in Cantonese language revitalisation in New Zealand. The development of Automatic Speech Recognition (ASR) toolkits, such as Whisper, have expedited what has often been a resource and time-intensive process of transcribing oral history collections. However, there is limited research into the effectiveness of ASR toolkits when applied to code-switched language contexts. Based on Word Error Rate (WER), the best performing Whisper model configuration achieved a WER of 12.10 at the expense of accurately transcribing unsupported non-English segments. However, Whisper remains a useful tool by providing a first-pass transcription using only 1% of the estimated time otherwise needed for manual transcription.
- Abstract(参考訳): 本稿では,コミュニティ主導の遺産言語保存・再生イニシアチブによって,音声技術がどのように採用されているかについて,ユニークな視点を提供する。
コミュニティ主導の言語維持戦略として、ニュージーランドのカントン言語再生において、口頭の歴史は重要な役割を担っている。
Whisperのような自動音声認識(ASR)ツールキットの開発は、しばしば口頭歴史コレクションを翻訳するリソースと時間集約的なプロセスの速さを増している。
しかし、コード切替言語コンテキストに適用した場合、ASRツールキットの有効性について限定的な研究がなされている。
Word Error Rate (WER)に基づいて、WERの最高の性能は、サポートされていない非英語セグメントを正確に翻訳するコストで、WERの12.10を達成した。
しかし、Whisperは手書きの書き起こしに要する時間のうち1%しか必要としないファーストパスの書き起こしを提供することによって有用なツールである。
関連論文リスト
- Fine-Tuning Whisper for Automatic Speech Recognition in Baniwa: A Preliminary Study [0.0]
本研究は,バニワにおける音声認識のためのWhisperの適応に関する予備的研究である。
実験は言語文書プロジェクトから得られた手書き記録1,373枚のコーパスを用いて行った。
単語誤り率(WER)と文字誤り率(CER)を用いた教師付き学習を用いてWhisper Small Modelを微調整した。
論文 参考訳(メタデータ) (2026-08-26T17:29:47Z) - Easper: An Accessible ASR Pipeline for Language Documentation [11.347609189188205]
Easperは、微調整自動音声認識モデルのためのオープンソースのノーコードワークフローである。
我々は3つのバヌアツ語での転写優先戦略を評価した。
ノイズの多い環境であっても,語彙的に豊かな物語の優先順位付けや音響・音声の繰り返しの増大は,より高速な音質向上につながることを示す。
論文 参考訳(メタデータ) (2026-08-12T04:25:08Z) - WESR: Scaling and Evaluating Word-level Event-Speech Recognition [59.21814194620928]
音声は言語情報だけでなく、笑ったり泣いたりするような豊富な非言語的な音声イベントも伝達する。
我々は,21の発声イベントの分類を改良し,個別(スタンドアローン)と連続(音声と混合)に分類した。
改良された分類法に基づくWESR-Benchは,新しい位置認識プロトコルを備えた専門家アノテート評価セット(900以上の発話)である。
論文 参考訳(メタデータ) (2026-01-08T02:23:21Z) - Enhancing Multilingual ASR for Unseen Languages via Language Embedding Modeling [50.62091603179394]
最も先進的なASRモデルの1つであるWhisperは99の言語を効果的に扱う。
しかし、ウィスパーは未確認の言語と戦っているが、それらは事前訓練には含まれていない。
本研究では,これらの関係を利用して未知言語上でのASR性能を向上させる手法を提案する。
論文 参考訳(メタデータ) (2024-12-21T04:05:43Z) - Accent conversion using discrete units with parallel data synthesized from controllable accented TTS [56.18382038512251]
アクセント変換(AC)の目的は、コンテンツと話者のアイデンティティを保ちながら、アクセントを変換することである。
従来の手法では、推論中に参照発話が必要であったり、話者のアイデンティティを十分に保持していなかったり、ネイティブでないアクセントごとにのみトレーニング可能な1対1のシステムを使用していた。
本稿では,これらの問題を克服するために,多くのアクセントをネイティブに変換する,有望なACモデルを提案する。
論文 参考訳(メタデータ) (2024-09-30T19:52:10Z) - Phonemic Representation and Transcription for Speech to Text
Applications for Under-resourced Indigenous African Languages: The Case of
Kiswahili [0.0]
キスワヒリを含むいくつかのアフリカ先住民の言語が技術的に不足していることが判明した。
本稿では,Kiswahili音声コーパスの転写過程と展開について検討する。
これは、CMU Sphinx 音声認識ツールボックスを使用して作成された ASR モデルのために、更新された Kiswahili 音素辞書を提供する。
論文 参考訳(メタデータ) (2022-10-29T09:04:09Z) - Self-Supervised Speech Representation Learning: A Review [105.1545308184483]
自己教師付き表現学習法は、幅広いタスクやドメインに利益をもたらす単一の普遍的モデルを約束する。
音声表現学習は、生成的、コントラスト的、予測的という3つの主要なカテゴリで同様の進歩を経験している。
本稿では,自己指導型音声表現学習のアプローチと,他の研究領域との関係について述べる。
論文 参考訳(メタデータ) (2022-05-21T16:52:57Z) - Automated speech tools for helping communities process restricted-access
corpora for language revival efforts [15.174963435891677]
絶滅危惧言語からの音声のアーカイブ記録の多くは、コミュニティメンバーや言語学習プログラムには注釈がなく、アクセスできないままである。
危険言語における音声がより広範に使われている言語と混在している場合に、両方のボトルネックを拡大するプライバシー保護ワークフローを提案する。
本報告では,英語とムルワリを混合した136時間アーカイブオーディオについて報告する。
論文 参考訳(メタデータ) (2022-04-15T00:05:23Z) - Zero-Shot Cross-lingual Aphasia Detection using Automatic Speech
Recognition [3.2631198264090746]
失語症(英: Aphasia)は、一般的には脳損傷や脳卒中によって引き起こされる言語障害であり、世界中の何百万人もの人々に影響を及ぼす。
本稿では,言語間音声表現を共用する事前学習型自動音声認識(ASR)モデルを用いたエンドツーエンドパイプラインを提案する。
論文 参考訳(メタデータ) (2022-04-01T14:05:02Z) - Cross-lingual Transfer for Speech Processing using Acoustic Language
Similarity [81.51206991542242]
言語間の移動は、このデジタル分割を橋渡しする魅力的な方法を提供する。
現在の言語間アルゴリズムは、テキストベースのタスクや音声関連タスクを低リソース言語で実現している。
本稿では,数百の言語をまたがる音響的言語間移動対を効率的に同定する言語類似性手法を提案する。
論文 参考訳(メタデータ) (2021-11-02T01:55:17Z) - Simple and Effective Zero-shot Cross-lingual Phoneme Recognition [46.76787843369816]
本稿では,複数言語で事前訓練されたwav2vec 2.0モデルを微調整し,未知の言語を転写することで,ゼロショット・クロスリンガル変換学習に関するこれまでの研究を拡張した。
実験によると、この単純な手法はタスク固有のアーキテクチャを導入した以前の作業よりも大幅に優れていた。
論文 参考訳(メタデータ) (2021-09-23T22:50:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。