論文の概要: Pretraining Language Models with Subword Regularization: An Empirical Study of BPE Dropout in Low-Resource NLP
- arxiv url: http://arxiv.org/abs/2605.13436v1
- Date: Wed, 13 May 2026 12:31:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-14 23:30:28.042167
- Title: Pretraining Language Models with Subword Regularization: An Empirical Study of BPE Dropout in Low-Resource NLP
- Title(参考訳): サブワード正規化による事前学習言語モデル:低リソースNLPにおけるBPEドロップアウトの実証的研究
- Authors: Ruan Visser, Trienko Grobler, Marcel Dunaiski,
- Abstract要約: BPEドロップアウトのようなサブワード正規化手法は微調整時にのみ適用され、プリトレーニングは通常決定論的トークン化によって行われる。
これにより、事前学習と微調整の間の潜在的なセグメンテーションミスマッチが生成される。
XNLI, PAWS-X, PAN-X, MasakhaNER 2.0で, 英語, ドイツ語, フランス語, スペイン語, Kiswahili, およびisiXhosaで単言語およびバイリンガルBERTモデルを訓練し, 評価を行った。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Subword regularization methods such as BPE dropout are typically applied only during fine-tuning, while pretraining is usually done with deterministic tokenization. This creates a potential segmentation mismatch between pretraining and fine-tuning. We investigate whether applying BPE dropout during pretraining improves downstream performance in low-resource NLP. We train monolingual and bilingual BERT models on downsampled subsets of English, German, French, Spanish, Kiswahili, and isiXhosa, and evaluate them on XNLI, PAWS-X, PAN-X, and MasakhaNER 2.0. Across tasks, the best results are typically obtained when stochastic tokenization is applied during both pretraining and fine-tuning, whereas applying BPE dropout only during fine-tuning can underperform deterministic tokenization in smaller-data settings. This disadvantage diminishes as fine-tuning data increases, while the benefits of pretraining-time BPE dropout are largest when either pretraining or fine-tuning data is scarce. The benefits of BPE dropout are often attributed to better compositional representations, especially for rare words. To examine this, we measure morphological boundary alignment under BPE dropout and find only modest improvements in expected alignment, while better-aligned segmentations remain rare. This suggests that fine-tuning alone may provide limited exposure to such segmentations, whereas stochastic tokenization during pretraining exposes the model to them more consistently. We further show that selectively introducing morphologically aligned segmentations during fine-tuning improves performance mainly for models pretrained without BPE dropout. Overall, these findings suggest that exposure to better-aligned segmentations may contribute to the downstream benefits of applying BPE dropout during pretraining.
- Abstract(参考訳): BPEドロップアウトのようなサブワード正規化手法は、通常は微調整時にのみ適用されるが、事前訓練は通常決定論的トークン化によって行われる。
これにより、事前学習と微調整の間の潜在的なセグメンテーションミスマッチが生成される。
プレトレーニング中にBPEのドロップアウトを適用することで,低リソースNLPのダウンストリーム性能が向上するかどうかを検討する。
XNLI, PAWS-X, PAN-X, MasakhaNER 2.0で, 英語, ドイツ語, フランス語, スペイン語, Kiswahili, およびisiXhosaで単言語およびバイリンガルBERTモデルを訓練し, 評価を行った。
タスク全体では、確率的トークン化が事前トレーニングと微調整の両方で適用されるのに対して、微調整でのみBPEドロップアウトを適用すると、より小さなデータ設定で決定論的トークン化を過小評価する。
微調整データの増加に伴い、この欠点は減少するが、事前訓練データや微調整データが少ない場合には、事前訓練時のBPEドロップアウトの利点が最大になる。
BPEドロップアウトの利点は、しばしばより優れた構成表現、特にまれな単語によるものである。
そこで本研究では,BPEドロップアウト下での形態的境界アライメントを測定し,期待されるアライメントをわずかに改善する一方,より良いアライメントのセグメンテーションは稀である。
このことは、微調整だけではそのようなセグメンテーションに限定的な露出を与えるが、事前訓練中の確率的トークン化はより一貫してモデルを公開することを示唆している。
さらに,BPEドロップアウトなしで事前学習したモデルに対して,微調整中に形態的に整列したセグメンテーションを選択的に導入することで,性能が向上することを示す。
以上の結果から, より整合性のあるセグメンテーションへの曝露は, プレトレーニング中にBPEドロップアウトを施すことによる下流の利点に寄与する可能性が示唆された。
関連論文リスト
- Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data [32.68918472543787]
大規模な言語モデルは、事前学習のためにWebスケールのコーパスに依存している。
データキュレーションは緩和されるが、そのようなノイズを排除できないため、訓練前のコーパスは実際にはノイズが残る。
本研究は,プレトレーニング段階において,軽量なプレトレーニング段階がノイズデータに抵抗するかどうかを考察する。
論文 参考訳(メタデータ) (2026-05-11T07:40:39Z) - When Priors Backfire: On the Vulnerability of Unlearnable Examples to Pretraining [28.704214093822472]
Unlearnable Examples (UEs) は、データ保護戦略として機能し、誤解を招くモデルに対して知覚できない摂動を発生させ、基礎となる意味論ではなく素早い相関を学習する。
本稿では,事前学習モデルから学習を開始すると現れるUEの基本的脆弱性を明らかにする。
本稿では,新しい二段階最適化法であるBAIT(Binding Artificial perturbations to Incorrect Targets)を提案する。
論文 参考訳(メタデータ) (2026-03-05T02:10:40Z) - Extending the Context of Pretrained LLMs by Dropping Their Positional Embeddings [14.342802193320365]
トレーニング後のLMの位置埋め込み(DroPE)は、3つの重要な理論的および経験的観察によって動機付けられる。
位置埋め込み(PE)は、事前訓練において重要な役割を担い、重要な誘導バイアスを与える。
DroPEは、長いコンテキストの微調整なしに、シームレスなゼロショットコンテキスト拡張をもたらす。
論文 参考訳(メタデータ) (2025-12-13T04:23:47Z) - Mitigating Spurious Correlations in LLMs via Causality-Aware Post-Training [57.03005244917803]
大規模言語モデル (LLMs) は、事前学習中に得られた素早い相関関係により、アウト・オブ・ディストリビューション (OOD) のサンプルで失敗することが多い。
ここでは、因果認識後学習(CAPT)を通して、このような素因的相関を緩和することを目的とする。
公式因果推論ベンチマークCLadderと論理推論データセットPrOntoQAの実験により、CAPTで微調整された3Bスケールの言語モデルでは、従来のSFTおよびより大きなLLMを分散処理(ID)およびOODタスクで上回る結果が得られた。
論文 参考訳(メタデータ) (2025-06-11T06:30:28Z) - ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining [53.893792844055106]
大規模言語モデルの事前学習は計算集約的であるが、多くのトークンが学習にわずかに寄与し、非効率になる。
Selective Efficient Language Modelingは、オンライントークンレベルのバッチ選択を行うことで、トレーニング効率と分散ロバスト性を改善するリスク認識アルゴリズムである。
GPT-2プレトレーニング実験の結果、ESLMはベースラインに比べて複雑度と下流性能の両面を維持・改善しながら、トレーニングFLOPを著しく低減することが示された。
論文 参考訳(メタデータ) (2025-05-26T12:23:26Z) - Adaptive BPE Tokenization for Enhanced Vocabulary Adaptation in Finetuning Pretrained Language Models [26.442558912559658]
Byte-Pair を用いた語彙適応手法の基本的な限界を示す。
(BPE)エキスパートドメインへの微調整事前学習言語モデル(PLM)のトークン化方式。
本稿では,BPEのトークン化フェーズが変更され,文字レベルでのトークン化の前に,付加(ターゲット)語彙上で最も長い文字列マッチングが実行されるAdaptBPEを提案する。
論文 参考訳(メタデータ) (2024-10-04T09:24:55Z) - Toward Understanding BERT-Like Pre-Training for DNA Foundation Models [78.48760388079523]
既存のDNA配列の事前訓練方法は、NLPからのBERT事前訓練の直接的な採用に依存している。
マスク境界を連続的に拡張することにより,BERTライクな事前学習作業の難易度を徐々に向上させるRandomMaskという新しい手法を提案する。
RandomMaskは、マシューのエピジェネティック・マーク・予測の相関係数の68.16%を突破し、ベースラインの19.85%を突破した。
論文 参考訳(メタデータ) (2023-10-11T16:40:57Z) - Examining the Effect of Pre-training on Time Series Classification [21.38211396933795]
本研究では, プレトレーニング後の微調整が微調整過程に及ぼす影響について検討した。
150の分類データセットを網羅的に検討した。
事前学習は、データに適合しないモデルの最適化プロセスを改善するのにしか役立ちません。
事前学習データを追加することで一般化は向上しないが、元のデータボリュームの事前学習の利点を強化することができる。
論文 参考訳(メタデータ) (2023-09-11T06:26:57Z) - Sample-Efficient Optimisation with Probabilistic Transformer Surrogates [66.98962321504085]
本稿では,ベイズ最適化における最先端確率変換器の適用可能性について検討する。
トレーニング手順と損失定義から生じる2つの欠点を観察し、ブラックボックス最適化のプロキシとして直接デプロイすることを妨げる。
1)非一様分散点を前処理するBO調整トレーニング,2)予測性能を向上させるために最適な定常点をフィルタする新しい近似後正則整定器トレードオフ精度と入力感度を導入する。
論文 参考訳(メタデータ) (2022-05-27T11:13:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。