論文の概要: A Modular Part-of-Speech Tagger for Scottish Gaelic using spaCy
- arxiv url: http://arxiv.org/abs/2608.04808v1
- Date: Wed, 05 Aug 2026 13:13:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.933339
- Title: A Modular Part-of-Speech Tagger for Scottish Gaelic using spaCy
- Title(参考訳): SpaCy を用いたスコットランドゲールのためのモジュラーパート・オブ・スポーチ・タガー
- Authors: Peter Stefan, Peter J Barclay, Alistair Lawson,
- Abstract要約: 本稿では、spurCy Natural Language Processingフレームワークを使用して、Gaidhligの音声タグを構築する方法について述べる。
スコットランドゲール語の注釈付きコーパス参照を用いて、最小限の事前処理と構成を持つ2つのモデルを訓練する。
その結果は、以前に公開された2つのGaidhligタグに匹敵する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Part-of-speech tagging for low-resource languages remains challenging due to limited annotated data, especially for linguistically complex languages. Gaidhlig (Scottish Gaelic) is a morphologically rich and endangered language with limited digital resources, making it suitable for examining a lightweight language processing approach. This paper describes using the modular spaCy Natural Language Processing framework to build part-of-speech taggers for Gaidhlig using the Annotated Reference Corpus of Scottish Gaelic. We train two models with minimal pre-processing and configuration: one using a fine-grained tagset and another using a reduced coarse-grained tagset. Both models are trained without external embeddings or pre-trained language models, using only supervised learning from the available corpus. The fine-grained model achieves 88.6% tagging accuracy, while the coarse-grained model achieves 93.7%. The results are comparable to those of the two previously published Gaidhlig taggers, indicating that simple, off-the-shelf language processing pipelines can demonstrate good performance in low-resource and morphologically complex linguistic settings.
- Abstract(参考訳): 低リソース言語に対する音声タグ付けは、特に言語学的に複雑な言語において、限られた注釈付きデータのために依然として困難である。
Gaidhlig(スコットランド・ゲール語)は、形態的にリッチで、限られたデジタルリソースを持つ絶滅危惧言語であり、軽量な言語処理アプローチを検討するのに適している。
本稿では,Modular SpaCy Natural Language Processingフレームワークを用いて,スコットランドゲール語の注釈付き参照コーパスを用いて,ゲイドヘリグのための音声タグを構築する。
1つはきめ細かいタグセットを使い、もう1つはきめ細かなタグセットを減らし、もう1つはきめ細かなタグセットを使用する。
どちらのモデルも、利用可能なコーパスからの教師付き学習のみを使用して、外部埋め込みや事前訓練された言語モデルなしでトレーニングされる。
きめ細かいモデルでは88.6%のタグ付け精度、粗いモデルでは93.7%である。
結果は、以前公開された2つのGaidhligタグと同等であり、単純で既製の言語処理パイプラインは、低リソースで形態学的に複雑な言語設定で優れたパフォーマンスを示すことができることを示している。
関連論文リスト
- On Multilingual Encoder Language Model Compression for Low-Resource Languages [10.937645683754313]
本稿では,多言語エンコーダのみの言語モデルに対して,2段階の知識蒸留,構造化プルーニング,トランケーション,ボキャブラリトリミングを組み合わせる。
我々の新しいアプローチは、層深さを極端に減らし、フィードフォワードの隠蔽サイズを小さくし、中間層埋め込みサイズを小さくし、モノリンガルモデルを作成する。
圧縮性能は最大92%, 圧縮性能は2~10%, 圧縮性能は最大8~13%である。
論文 参考訳(メタデータ) (2025-05-22T17:35:39Z) - A two-stage transliteration approach to improve performance of a multilingual ASR [1.9511556030544333]
本稿では,言語に依存しないエンドツーエンドモデルを構築するためのアプローチを提案する。
我々は2つのIndic言語に対するエンドツーエンドの多言語音声認識システムを用いて実験を行った。
論文 参考訳(メタデータ) (2024-10-09T05:30:33Z) - Zero-shot Sentiment Analysis in Low-Resource Languages Using a
Multilingual Sentiment Lexicon [78.12363425794214]
私たちは、34の言語にまたがるゼロショットの感情分析タスクに重点を置いています。
文レベルの感情データを使用しない多言語語彙を用いた事前学習は、英語の感情データセットに微調整されたモデルと比較して、ゼロショット性能が優れていることを示す。
論文 参考訳(メタデータ) (2024-02-03T10:41:05Z) - Soft Language Clustering for Multilingual Model Pre-training [57.18058739931463]
本稿では,インスタンスを条件付きで符号化するためのフレキシブルガイダンスとして,コンテキスト的にプロンプトを検索するXLM-Pを提案する。
我々のXLM-Pは、(1)言語間における言語不変および言語固有知識の軽量なモデリングを可能にし、(2)他の多言語事前学習手法との容易な統合を可能にする。
論文 参考訳(メタデータ) (2023-06-13T08:08:08Z) - Geographical Distance Is The New Hyperparameter: A Case Study Of Finding
The Optimal Pre-trained Language For English-isiZulu Machine Translation [0.0]
本研究は,英語訳フレームワークにおける翻訳学習の潜在的なメリットについて考察する。
1つの多言語コーパスを含む8つの言語コーパスから得られた結果から,isiXa-isiZuluがすべての言語より優れた結果を得た。
我々はまた,事前学習されたモデルに対する言語選択を容易にする新しい係数である,Nasir's Geographical Distance Coefficient (NGDC) も導出した。
論文 参考訳(メタデータ) (2022-05-17T20:41:25Z) - Linking Emergent and Natural Languages via Corpus Transfer [98.98724497178247]
創発言語と自然言語のコーパス転送によるリンクを確立する新しい方法を提案する。
このアプローチでは,言語モデリングとイメージキャプションという,2つの異なるタスクに対して,非自明な転送メリットを示す。
また,同一画像に基づく自然言語キャプションに創発的メッセージを翻訳することで,創発的言語の伝達可能性を予測する新しい指標を提案する。
論文 参考訳(メタデータ) (2022-03-24T21:24:54Z) - Multilingual Byte2Speech Text-To-Speech Models Are Few-shot Spoken
Language Learners [11.190877290770047]
本稿では、バイト入力をスペクトログラムにマッピングし、任意の入力スクリプトを可能にする多言語用エンドツーエンドテキスト合成フレームワークを提案する。
このフレームワークは、極端に低リソースのシナリオ下で、様々な新しい言語に適応する能力を示す。
多言語モデルのメカニズムをよりよく理解するために,言語固有のサブネットワークを抽出する新しい手法を提案する。
論文 参考訳(メタデータ) (2021-03-05T08:41:45Z) - Cross-lingual Machine Reading Comprehension with Language Branch
Knowledge Distillation [105.41167108465085]
言語間機械読解(CLMRC)は、ローソース言語に大規模なデータセットがないため、依然として難しい問題である。
本稿では,Language Branch Machine Reading (LBMRC) という新しい拡張手法を提案する。
LBMRCは、個々の言語に精通したMultiple Machine Read comprehension (MRC)モデルを訓練する。
複数の言語分岐モデルから全ての対象言語に対する単一モデルへのアマルガメート知識の多言語蒸留アプローチを考案する。
論文 参考訳(メタデータ) (2020-10-27T13:12:17Z) - Cross-lingual, Character-Level Neural Morphological Tagging [57.0020906265213]
文字レベルのリカレントなニューラルタグをトレーニングし、高リソース言語と低リソース言語を併用して形態的タグ付けを予測する。
複数の関連言語間の共同文字表現の学習は、高リソース言語から低リソース言語への知識伝達を成功させ、モノリンガルモデルの精度を最大30%向上させる。
論文 参考訳(メタデータ) (2017-08-30T08:14:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。