Fugu-MT 論文翻訳(概要): Bootstrapping Techniques for Polysynthetic Morphological Analysis

論文の概要: Bootstrapping Techniques for Polysynthetic Morphological Analysis

arxiv url: http://arxiv.org/abs/2005.00956v1
Date: Sun, 3 May 2020 00:35:19 GMT
ステータス: 翻訳完了
システム内更新日: 2022-12-07 06:33:39.988245
Title: Bootstrapping Techniques for Polysynthetic Morphological Analysis
Title（参考訳）: 合成形態解析のためのブートストラップ技術
Authors: William Lane and Steven Bird
Abstract要約: ニューラルモルフォロジーアナライザをブートストラップするための言語的インフォームドアプローチを提案する。有限状態トランスデューサからデータを生成し,エンコーダデコーダモデルを訓練する。学習データに欠落する言語構造を「ハロシン化」し、Zipf分布から再サンプリングすることで、形態素のより自然な分布をシミュレートすることでモデルを改善する。
参考スコア（独自算出の注目度）: 9.655349059913888
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Abstract: Polysynthetic languages have exceptionally large and sparse vocabularies, thanks to the number of morpheme slots and combinations in a word. This complexity, together with a general scarcity of written data, poses a challenge to the development of natural language technologies. To address this challenge, we offer linguistically-informed approaches for bootstrapping a neural morphological analyzer, and demonstrate its application to Kunwinjku, a polysynthetic Australian language. We generate data from a finite state transducer to train an encoder-decoder model. We improve the model by "hallucinating" missing linguistic structure into the training data, and by resampling from a Zipf distribution to simulate a more natural distribution of morphemes. The best model accounts for all instances of reduplication in the test set and achieves an accuracy of 94.7% overall, a 10 percentage point improvement over the FST baseline. This process demonstrates the feasibility of bootstrapping a neural morph analyzer from minimal resources.
Abstract（参考訳）: 多合成言語は、形態素のスロットの数と単語の組合せによって、非常に大きくて希薄な語彙を持つ。この複雑さと、書かれたデータの全般的な不足は、自然言語技術の発展にとって課題となる。この課題に対処するために,神経形態素解析装置をブートストラップする言語的不定形アプローチを提案し,多合成オーストラリア語kunwinjkuへの応用を実証する。有限状態トランスデューサからデータを生成し,エンコーダデコーダモデルを訓練する。学習データに欠落している言語構造を「幻覚」し、zipf分布から再サンプリングし、モルヒネのより自然な分布をシミュレートすることで、モデルを改善する。最良のモデルはテストセットのすべてのインスタンスを考慮し、全体の94.7%の精度を達成し、FSTベースラインよりも10パーセント改善した。このプロセスは、最小限のリソースから神経形態解析器をブートストラップする可能性を示す。

関連論文リスト

Information Locality as an Inductive Bias for Neural Language Models [52.92279412466086]
本稿では,Transformer と LSTM LM の言語学習において,$m$local entropy は困難であることを示す。これらの結果は、ニューラルネットワークが言語の統計構造に非常に敏感であることを示唆している。
論文参考訳（メタデータ） (2025-06-05T15:21:05Z)
Learning Beyond Limits: Multitask Learning and Synthetic Data for Low-Resource Canonical Morpheme Segmentation [7.766518675734386]
低リソースのトレーニング信号を増強する変圧器を用いた形態素セグメンテーションシステムを提案する。本フレームワークは, 形態的セグメントとグルースを図形入力から共同で予測する。我々は,大規模言語モデル(LLM)によって生成された合成学習データを,文脈内学習を用いて統合する。
論文参考訳（メタデータ） (2025-05-22T15:40:09Z)
Slaves to the Law of Large Numbers: An Asymptotic Equipartition Property for Perplexity in Generative Language Models [0.0]
言語モデルにより生成された大きなテキストの対数的パープレキシティは、トークン分布の平均エントロピーに収束しなければならないことを示す。これは、言語モデルによって生成される全ての長い合成テキストが属しなければならない「典型的集合」を定義する。その結果, (a) 合成AI生成テキストの検出や, (b) テキストが言語モデルの学習に使用されたかどうかの検証など,重要な実践的問題への応用の可能性が示唆された。
論文参考訳（メタデータ） (2024-05-22T16:23:40Z)
In-Context Language Learning: Architectures and Algorithms [73.93205821154605]
我々は、文脈言語学習(ICLL)において、私たちが用語する新しいモデル問題群(英語版)のレンズを通してICLを研究する。我々は,通常のICLLタスクにおいて,多種多様なニューラルシーケンスモデルを評価する。
論文参考訳（メタデータ） (2024-01-23T18:59:21Z)
Synthetic Pre-Training Tasks for Neural Machine Translation [16.6378815054841]
我々のゴールは、合成資源を使用する場合の事前学習モデルの有効性に寄与する要因を理解することである。本稿では,語彙的および構造的知識のレベルが異なる事前学習型翻訳モデルを提案する。複数の言語ペアに対する実験により,高レベルの難読化や純粋に合成された並列データであっても,事前学習のメリットが実現できることが明らかになった。
論文参考訳（メタデータ） (2022-12-19T21:34:00Z)
Multi-Scales Data Augmentation Approach In Natural Language Inference For Artifacts Mitigation And Pre-Trained Model Optimization [0.0]
クラウドソーシングされたStanford Natural Language Inference corpus内でデータセットのアーティファクトを分析し、配置するための様々な技術を提供する。データセットアーティファクトを緩和するために、2つの異なるフレームワークで独自のマルチスケールデータ拡張技術を採用している。本手法は, 摂動試験に対するモデルの抵抗性を向上し, トレーニング済みベースラインの連続的な性能向上を可能にする。
論文参考訳（メタデータ） (2022-12-16T23:37:44Z)
Syntax-informed Question Answering with Heterogeneous Graph Transformer [2.139714421848487]
本稿では、事前学習されたニューラルネットワークモデルを拡張し、微調整する言語インフォームド質問応答手法を提案する。本稿では,トークンと仮想トークンを接続する依存関係グラフ構造と領域グラフィック構造という形で,構文情報の追加によるアプローチについて説明する。
論文参考訳（メタデータ） (2022-04-01T07:48:03Z)
Modeling Target-Side Morphology in Neural Machine Translation: A Comparison of Strategies [72.56158036639707]
形態的に豊かな言語は機械翻訳に困難をもたらす。多数の異なる屈折する単語曲面は、より大きな語彙を必要とする。いくつかの頻度の低い用語は、通常、トレーニングコーパスには現れない。言語的合意は、出力文中の屈折語形間の文法的カテゴリを正しく一致させる必要がある。
論文参考訳（メタデータ） (2022-03-25T10:13:20Z)
Improving Classifier Training Efficiency for Automatic Cyberbullying Detection with Feature Density [58.64907136562178]
言語支援の異なる特徴前処理手法を用いて特徴密度(FD)の有効性を検討した。データセットの複雑さを推定することで、必要な実験の数を削減できると仮定する。データセットの言語的複雑さの違いにより、言語的に支援された単語前処理の有効性を議論することが可能になる。
論文参考訳（メタデータ） (2021-11-02T15:48:28Z)
Exploiting Language Model for Efficient Linguistic Steganalysis: An Empirical Study [23.311007481830647]
言語ステガナリシスを効果的に行うための2つの方法を提案する。 1つはRNNに基づく言語モデルの事前トレーニングであり、もう1つはシーケンスオートエンコーダの事前トレーニングである。
論文参考訳（メタデータ） (2021-07-26T12:37:18Z)
Unnatural Language Inference [48.45003475966808]
我々は、RoBERTaやBARTのような最先端のNLIモデルは、ランダムに並べ替えられた単語の例に不変であり、時にはよりよく機能することさえあります。我々の発見は、自然言語理解モデルと、その進捗を測定するために使われるタスクが、本当に人間のような構文理解を必要とするという考えに疑問を投げかけている。
論文参考訳（メタデータ） (2020-12-30T20:40:48Z)
Data Augmentation for Spoken Language Understanding via Pretrained Language Models [113.56329266325902]
音声言語理解(SLU)モデルの訓練は、しばしばデータ不足の問題に直面している。我々は,事前学習言語モデルを用いたデータ拡張手法を提案し,生成した発話の変動性と精度を向上した。
論文参考訳（メタデータ） (2020-04-29T04:07:12Z)
Unnatural Language Processing: Bridging the Gap Between Synthetic and Natural Language Data [37.542036032277466]
本稿では,言語理解問題における-simulation-to-real'転送手法を提案する。我々のアプローチは、いくつかのドメインで自然言語データに基づいて訓練された最先端のモデルと一致または性能を向上する。
論文参考訳（メタデータ） (2020-04-28T16:41:00Z)
Parameter Space Factorization for Zero-Shot Learning across Tasks and Languages [112.65994041398481]
本稿では,ニューラルパラメータの空間に対するベイズ生成モデルを提案する。タスク言語の組み合わせから得られたデータに基づいて、そのような潜伏変数よりも後部を推測する。我々のモデルは、最先端のゼロショットの言語間転送手法よりも、同等か良い結果が得られる。
論文参考訳（メタデータ） (2020-01-30T16:58:56Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。