論文の概要: BnBERT-iPET: Sparse Few-Shot Language Modeling for Bengali via Lottery Ticket Pruning
- arxiv url: http://arxiv.org/abs/2608.05104v1
- Date: Wed, 05 Aug 2026 17:42:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:44.062781
- Title: BnBERT-iPET: Sparse Few-Shot Language Modeling for Bengali via Lottery Ticket Pruning
- Title(参考訳): BnBERT-iPET: Lottery Ticket PruningによるBengaliのスパースFew-Shot言語モデリング
- Authors: Sajib Hossain, Md Kamrus Samad, Anan Ghosh, Labib Imam Chowdhury, Nabeel Mohammed,
- Abstract要約: BnBERT-iPETはベンガル語のためのスパース数発の言語モデリング手法である。
BERTのような初期モデルのエッジの10%しか持たない軽量な数発学習言語モデルでは,Bengaliのようなリソース制約言語に対する課題タスクにおいて,より大規模なモデルで首と首を動作させることができることを示す。
- 参考スコア(独自算出の注目度): 2.3439063716727078
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Deep neural networks have shown impressive success in NLP tasks owing to their complex structure and huge number of edges. Achieving state-of-the-art performance in natural language processing with a large pre-trained model such as BERT is expensive and time-consuming, carries a large carbon footprint, and is difficult to realize on machines with minimal computational capability. This creates a barrier to training complex models for resource-constrained languages such as Bengali. However, in a complex neural model, not all edges are equally impactful, and the contributions of some of them can be neglected. Pruning promises to reduce the memory footprint of regular networks, shorten the training time of ever-growing networks, and increase inference efficiency without sacrificing comparable performance. In this work, we introduce BnBERT-iPET, a sparse few-shot language modeling approach for Bengali, and experimentally show that a lightweight few-shot-learned language model retaining only 10% of the edges of an initial model such as BERT can perform neck and neck with much larger models on challenging tasks for a resource-constrained language such as Bengali. By learning from few shots through iterative pattern exploiting training and achieving 90% sparsity with the Lottery Ticket Hypothesis pruning technique, our pruned BnBERT-iPET model proves to be a tough competitor to state-of-the-art language models such as Bangla Electra, Indic-BERT, and XLM-RoBERTa on downstream tasks over standard benchmark datasets of the Bengali language.
- Abstract(参考訳): ディープニューラルネットワークは、複雑な構造と膨大な数のエッジのため、NLPタスクにおいて驚くべき成功を収めている。
BERTのような大規模事前学習モデルによる自然言語処理における最先端性能の実現には費用がかかり、時間を要するため、炭素フットプリントが大きくなり、最小限の計算能力を持つマシンでは実現が困難である。
これにより、Bengaliのようなリソース制約のある言語のための複雑なモデルをトレーニングする障壁が生まれる。
しかし、複雑なニューラルモデルでは、すべてのエッジが等しく影響を受けており、それらの一部の貢献は無視できる。
Pruningは、通常のネットワークのメモリフットプリントを削減し、成長を続けるネットワークのトレーニング時間を短縮し、同等のパフォーマンスを犠牲にすることなく推論効率を向上させることを約束する。
本研究では,ベンガル語におけるスパースな少数ショット言語モデリング手法であるBnBERT-iPETを紹介し,ベンガル語のような資源制約言語において,より大規模なモデルを用いて,BERTのような初期モデルのエッジの10%しか維持できない軽量の少数ショット言語モデルについて実験的に示す。
ランニングされたBnBERT-iPETモデルは、トレーニングを反復的に活用して90%の間隔を達成することで、Bangla Electra、Indic-BERT、XLM-RoBERTaといった最先端の言語モデルに対して、ベンガル語の標準ベンチマークデータセットよりも下流のタスクにおいて、難しい競合となることを証明した。
関連論文リスト
- On Importance of Layer Pruning for Smaller BERT Models and Low Resource Languages [0.4194295877935868]
本研究では,低リソース言語における特定の下流タスクに適したBERTモデルの開発において,レイヤプルーニングの有効性について検討する。
MahaBERT-v2 や Google-Muril などいくつかの BERT 変種を実験し、異なるプルーニング戦略を適用し、その性能を MahaBERT-Small や MahaBERT-Smaller のような小さなスクラッチトレーニングモデルと比較した。
以上の結果から,プルーニングモデルでは,層数が少ないにもかかわらず,スクラッチトレーニングモデルと同等の性能を保ちながら,スクラッチトレーニングモデルと同等の性能を保っていることがわかった。
論文 参考訳(メタデータ) (2025-01-01T05:30:10Z) - Sparse*BERT: Sparse Models Generalize To New tasks and Domains [79.42527716035879]
本稿では, 階層的非構造的マグニチュード・プルーニング(Gradual Unstructured Magnitude Pruning)を用いて, ドメイン間およびタスク間を移動可能なモデルについて検討する。
Sparse*BERTは、非構造化バイオメディカルテキスト上で圧縮されたアーキテクチャを事前学習することで、SparseBioBERTとなることを示す。
論文 参考訳(メタデータ) (2022-05-25T02:51:12Z) - MoEBERT: from BERT to Mixture-of-Experts via Importance-Guided
Adaptation [68.30497162547768]
本研究では,Mixture-of-Experts構造を用いてモデルキャパシティと推論速度を向上させるMoEBERTを提案する。
自然言語理解と質問応答タスクにおけるMoEBERTの有効性と有効性を検証する。
論文 参考訳(メタデータ) (2022-04-15T23:19:37Z) - Revisiting CNN for Highly Inflected Bengali and Hindi Language Modeling [0.5382679710017696]
そこで本研究では,CNNアーキテクチャと名づけられた,エンド・ツー・エンドのトレーニング可能なメモリ効率の高いCNNアーキテクチャを提案する。
特に、単語と文レベルで学習可能な2つの畳み込みサブモデルを導入する。
我々は、事前訓練されたBERTを含む最先端(SOTA)トランスフォーマーモデルが、必ずしもベンガルとヒンディーにとって最高の性能をもたらすとは限らないことを示す。
論文 参考訳(メタデータ) (2021-10-25T15:14:42Z) - bert2BERT: Towards Reusable Pretrained Language Models [51.078081486422896]
本稿では,既存のより小さな事前学習モデルの知識を大規模モデルに効果的に伝達できるbert2BERTを提案する。
bert2BERTは、ほぼ半分の大きさのモデルを再利用することで、BERT_BASEとGPT_BASEの事前トレーニングに約45%と47%の計算コストを節約する。
論文 参考訳(メタデータ) (2021-10-14T04:05:25Z) - Neural Models for Offensive Language Detection [0.0]
攻撃的言語検出は、成長を続ける自然言語処理(NLP)アプリケーションである。
このような有害なコンテンツと戦うために、さまざまな機械学習モデルの改善と比較に貢献することが、この論文の重要な、挑戦的な目標である、と私たちは信じています。
論文 参考訳(メタデータ) (2021-05-30T13:02:45Z) - EarlyBERT: Efficient BERT Training via Early-bird Lottery Tickets [106.79387235014379]
EarlyBERTは、大規模言語モデルの事前学習と微調整の両方に適用できる一般的な計算効率のトレーニングアルゴリズムである。
BERTトレーニングの初期段階において、構造化された入賞チケットを最初に識別し、効率的なトレーニングに使用します。
EarlyBERTは、トレーニング時間を3545%短縮した標準BERTと同等のパフォーマンスを簡単に達成します。
論文 参考訳(メタデータ) (2020-12-31T20:38:20Z) - ParsBERT: Transformer-based Model for Persian Language Understanding [0.7646713951724012]
本稿ではペルシャ語用単言語BERT(ParsBERT)を提案する。
他のアーキテクチャや多言語モデルと比較すると、最先端のパフォーマンスを示している。
ParsBERTは、既存のデータセットや合成データセットを含む、すべてのデータセットでより高いスコアを取得する。
論文 参考訳(メタデータ) (2020-05-26T05:05:32Z) - A Continuous Space Neural Language Model for Bengali Language [0.4799822253865053]
本稿では, 連続空間ニューラル言語モデル, より具体的にはASGD重量減少型LSTM言語モデル, およびベンガル語で効率的に学習する手法を提案する。
提案したアーキテクチャは、ベンガルの保持されたデータセットにおいて、推論の難易度を51.2まで低くすることで、それよりも優れている。
論文 参考訳(メタデータ) (2020-01-11T14:50:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。