論文の概要: A POS Tier Is the Key to Automated Annotation for Low-Resource Language Documentation: Neural Interlinear Glossing for Irabu, a Southern Ryukyuan Language
- arxiv url: http://arxiv.org/abs/2607.13372v1
- Date: Wed, 15 Jul 2026 01:33:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.619811
- Title: A POS Tier Is the Key to Automated Annotation for Low-Resource Language Documentation: Neural Interlinear Glossing for Irabu, a Southern Ryukyuan Language
- Title(参考訳): 低リソース言語ドキュメンテーションのための自動アノテーションの鍵となるPOSタイア--南九州語「いらぶ」のためのニューラルインターライナーグロスリング
- Abstract要約: 我々はIrabu Ryukyuanのための完全なニューラルネットワークパイプライン(形態素セグメンテーション、POSタグ付け、光沢化)を実装した。
約1時間の完全注釈付き談話を教師付き資源として,現実的な制約の下で評価した。
注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Discourse data are the primary empirical basis of grammar writing in field linguistics, but producing interlinearized text is notoriously expensive - on the order of one hour of work per minute of recording. For endangered languages, where the time remaining to verify analyses with native speakers is itself limited, automating parts of the interlinearization workflow has direct documentary value. We implement a full neural annotation pipeline (morpheme segmentation, POS tagging, glossing) for Irabu Ryukyuan using deliberately small, transparent BiLSTM-CRF models, and evaluate it under a realistic hard constraint: approximately one hour of fully annotated discourse as the entire supervised resource. Two factors of the annotation itself are manipulated: its richness (with or without a POS tier) and its quantity (training budgets from 6 to 47 minutes). Gold POS improves grammatical glossing by +4.4 (SD 0.7) points (significant in all 5 seeds), and the gain grows as data shrink (+11.6 points at a quarter of the data); a POS tier more than halves the amount of glossed data needed to reach a given accuracy. In a fully automatic pipeline this gain is not yet realized: the tagger still errs on 12% of morphemes, and an incorrect POS misleads the glossing model more than no POS at all. The value is latent rather than lost: degrading gold POS with controlled noise shows the gain returning as tagger accuracy rises, with break-even near our tagger's current 88% and +1.6 to +3.2 points recovered at 92-96%. We conclude with a concrete recommendation for documentation practice: annotate quadrilinearly - text, POS, gloss, translation.
- Abstract(参考訳): 談話データ(英: Discourse data)は、フィールド言語学における文法記述の主要な経験的基礎であるが、一分間に1時間の作業の順序で、相互に翻訳されたテキストを生成することは、非常に高価である。
絶滅危惧言語では、ネイティブ話者による分析の検証に要する時間が限られているため、インターライン化ワークフローの一部を自動化することは、直接のドキュメンタリー価値を持つ。
我々はIrabu Ryukyuanに対して,意図的に小さく透明なBiLSTM-CRFモデルを用いて完全なニューラル・アノテーション・パイプライン(形態的セグメンテーション,POSタグ付け,光沢化)を実装し,それを現実的な制約の下で評価する。
アノテーション自体の2つの要素は、豊かさ(POSティアの有無に関わらず)と量(予算を6分から47分にトレーニングする)である。
金のPOSは、+4.4(SD 0.7)ポイントで文法的な光沢を向上し(全5種において重要な)、データの縮小(データの4分の1で+11.6ポイント)に伴って増加し、POS層は所定の精度に達するのに必要な光沢のあるデータの量を半減する。
タグがまだモルヒムの12%を占めており、不正確なPOSは、POSが全くない以上の光沢モデルを誤解させる。
制御ノイズによる金POSの劣化は、タグの精度が上昇するにつれて利得が回復し、タグの現在の88%と+1.6から+3.2ポイントが92-96%で回復したことを示している。
注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注:注、注:注:注:注、注:注:注:注:注:
関連論文リスト
- DocAtlas: Multilingual Document Understanding Across 80+ Languages [58.715440331861295]
本稿では,82言語を対象とした高忠実度OCRデータセットとベンチマークを構築するフレームワークDocAtlasを紹介する。
我々のデュアルパイプライン、ネイティブDOCX文書の微分レンダリング、左右スクリプトの合成ベース生成は正確な構造アノテーションを生成する。
論文 参考訳(メタデータ) (2026-05-12T18:09:38Z) - Simultaneous Speech-to-Speech Translation Without Aligned Data [52.467808474293605]
同時音声翻訳では、ソース音声を対象言語にリアルタイムで翻訳する必要がある。
単語レベルのアライメントを完全に不要にするヒビキゼロを提案する。
Hibiki-Zeroは5つのX-英語タスクの翻訳精度、レイテンシ、音声転送、自然性において最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-02-11T17:41:01Z) - Building Tailored Speech Recognizers for Japanese Speaking Assessment [6.152272170188488]
我々はアクセントマーカーで音声ラベルを出力する音声認識器を構築した。
日本語は資源に富んでいるが、正確な音素の書き起こしを行うための訓練用データはほとんどない。
論文 参考訳(メタデータ) (2025-09-25T01:26:11Z) - Recipe for Zero-shot POS Tagging: Is It Useful in Realistic Scenarios? [4.959459199361905]
本稿では、限られたデータを持つ言語に対するPOSタグ付けに焦点を当てる。
対象言語からのラベル付きトレーニングデータを用いることなく,POSタグ付けモデルのトレーニングに好適なデータセットの特徴を特定する。
論文 参考訳(メタデータ) (2024-10-14T14:51:13Z) - Effectiveness of Mining Audio and Text Pairs from Public Data for
Improving ASR Systems for Low-Resource Languages [15.214673043019395]
Shrutilipiは、12のインドの言語で6,400時間以上のラベル付きオーディオを含むデータセットです。
平均すると、Shrutilipiは公開ラベル付きデータよりも2.3倍増加する。
We show that that Shrutilipi to the training set of Wav2Vec models to a average down of WER for 7 languages。
論文 参考訳(メタデータ) (2022-08-26T13:37:45Z) - OneAligner: Zero-shot Cross-lingual Transfer with One Rich-Resource
Language Pair for Low-Resource Sentence Retrieval [91.76575626229824]
文検索タスク用に特別に設計されたアライメントモデルであるOneAlignerを提案する。
大規模並列多言語コーパス(OPUS-100)の全ての言語ペアで訓練すると、このモデルは最先端の結果が得られる。
実験結果から,文アライメントタスクの性能はモノリンガルおよび並列データサイズに大きく依存することがわかった。
論文 参考訳(メタデータ) (2022-05-17T19:52:42Z) - Contextual Semantic Parsing for Multilingual Task-Oriented Dialogues [7.8378818005171125]
1つの言語で大規模な対話データセットをセットすると、機械翻訳を用いて他の言語に対して効果的な意味を自動生成できる。
本稿では、スロット値の忠実な翻訳を保証するために、アライメント付き対話データセットの自動翻訳を提案する。
簡潔な表現が翻訳誤りの複合効果を減少させることを示す。
論文 参考訳(メタデータ) (2021-11-04T01:08:14Z) - Improving Multilingual Translation by Representation and Gradient
Regularization [82.42760103045083]
表現レベルと勾配レベルの両方でNMTモデルを正規化するための共同手法を提案する。
提案手法は,オフターゲット翻訳の発生率の低減とゼロショット翻訳性能の向上に有効であることを示す。
論文 参考訳(メタデータ) (2021-09-10T10:52:21Z) - Emergent Communication Pretraining for Few-Shot Machine Translation [66.48990742411033]
我々は、参照ゲームからの創発的コミュニケーションを介してニューラルネットワークを事前訓練する。
私たちの重要な前提は、実世界の環境の粗悪な近似として、画像に基づくコミュニケーションを基盤にすることで、帰納的に自然言語学習のモデルに偏りが生じる、ということです。
論文 参考訳(メタデータ) (2020-11-02T10:57:53Z) - Reliable Part-of-Speech Tagging of Historical Corpora through Set-Valued Prediction [21.67895423776014]
設定値予測の枠組みにおけるPOSタグ付けについて検討する。
最先端のPOSタグをセット値の予測に拡張すると、より正確で堅牢なタグ付けが得られます。
論文 参考訳(メタデータ) (2020-08-04T07:21:36Z) - Adversarial Transfer Learning for Punctuation Restoration [58.2201356693101]
句読点予測のためのタスク不変知識を学習するために,逆多タスク学習を導入する。
IWSLT2011データセットを用いて実験を行った。
論文 参考訳(メタデータ) (2020-04-01T06:19:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。