論文の概要: Efficient Multilingual Neural Machine Translation via Corpus-Driven Vocabulary Pruning: An English-Arabic Case Study
- arxiv url: http://arxiv.org/abs/2608.03480v1
- Date: Tue, 04 Aug 2026 11:17:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.154123
- Title: Efficient Multilingual Neural Machine Translation via Corpus-Driven Vocabulary Pruning: An English-Arabic Case Study
- Title(参考訳): コーパス駆動語彙解析による多言語ニューラルネットワークの効率的な翻訳:英語とアラビア語のケーススタディ
- Authors: Ahmed Amine Aliane, Nasredine Semmar, Hassina Aliane,
- Abstract要約: 本稿では,MNMTモデルに対する語彙プルーニング手法と微調整プロトコルを併用した汎用最適化フレームワークを提案する。
提案手法は3つのモデル(M2M100, NLLB-200, mBART-50)を英語とアラビア語のペア上で評価する。
その結果、最適化された多言語モデルでは、専用バイリンガルベースラインの性能に適合または超えることができることがわかった。
- 参考スコア(独自算出の注目度): 0.19921702137386235
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The adoption of large pre-trained multilingual models for neural machine translation (MNMT) faces a major challenge: excessive memory and computational consumption due to overly large vocabularies and embedding layers. Although existing compression methods like pruning, quantization and knowledge distillation reduce parameter redundancy, they mainly preserve the structure of the original vocabulary, thereby leaving a major source of inefficiency unresolved. We propose in this paper a general optimization framework that combines a vocabulary pruning method with a targeted fine-tuning protocol for MNMT models. We evaluate the proposed framework using three models (M2M100, NLLB-200, mBART-50) on the English-Arabic language pair. Our approach reduces the vocabulary size from over 128,000 to approximately 10,000 tokens, enabling a 60% memory saving without any loss in performance. Results show that optimized multilingual models can match or exceed the performance of dedicated bilingual baselines. In particular, the pruned and fine-tuned M2M100 model achieves a competitive BLEU score of 42.04 (against 44.59 for the OPUS-MTen- ar bilingual model) while it significantly outperforms it on the COMET metric (0.8730 vs 0.7911) revealing superior semantic adequacy and fluency.
- Abstract(参考訳): ニューラルネットワーク翻訳(MNMT)のための大規模な事前学習された多言語モデルの採用は、過大な語彙と埋め込み層による過剰なメモリと計算消費という大きな課題に直面している。
プルーニング、量子化、知識蒸留といった既存の圧縮手法はパラメータ冗長性を低下させるが、それらは主に元の語彙の構造を保ち、主要な非効率性の源は未解決のままである。
本稿では,MNMTモデルに対して,ボキャブラリプルーニング法と微調整プロトコルを併用した汎用最適化フレームワークを提案する。
提案手法は3つのモデル(M2M100, NLLB-200, mBART-50)を英語とアラビア語のペア上で評価する。
提案手法では,語彙サイズを128,000個以上から約10,000個に削減し,性能を損なうことなく60%のメモリ節約を実現している。
その結果、最適化された多言語モデルでは、専用バイリンガルベースラインの性能に適合または超えることができることがわかった。
特に、細調整されたM2M100モデルは、競合するBLEUスコア42.04(OPUS-MTen-arバイリンガルモデルでは44.59)を達成し、COMET(0.8730対0.7911)ではかなり上回っている。
関連論文リスト
- TernaryLM: Memory-Efficient Language Modeling via Native 1-Bit Quantization with Adaptive Layer-wise Scaling [0.39287497907611874]
本稿では, ネイティブな1ビット3次量子化 -1, 0, +1 を用いた 132M パラメータトランスフォーマアーキテクチャである TernaryLM を提案する。
この結果から,ネイティブな1ビットトレーニングが,効率的なニューラルネットワークモデルにとって有望な方向であることが示唆された。
論文 参考訳(メタデータ) (2026-02-07T05:35:17Z) - Machine Translation for Ge'ez Language [0.0]
Ge'ezのような低リソース言語の機械翻訳は、語彙外単語、ドメインミスマッチ、ラベル付きトレーニングデータの欠如といった課題に直面している。
言語関連性に基づく多言語ニューラルマシン翻訳(MNMT)モデルを開発した。
また,最新のLCMであるGPT-3.5を用いて,ファジィマッチングを用いた数ショット翻訳実験を行った。
論文 参考訳(メタデータ) (2023-11-24T14:55:23Z) - Memory-efficient NLLB-200: Language-specific Expert Pruning of a
Massively Multilingual Machine Translation Model [92.91310997807936]
NLLB-200は202言語をカバーする多言語ニューラルネットワークモデルである。
そこで本研究では,最大80%のエキスパートの除去を,それ以上の微調整を行なわずに行うことができるプルーニング法を提案する。
論文 参考訳(メタデータ) (2022-12-19T19:29:40Z) - SMaLL-100: Introducing Shallow Multilingual Machine Translation Model
for Low-Resource Languages [102.50127671423752]
本稿では,100言語をカバーするM2M-100(12B)機械翻訳モデルの蒸留版であるSMaLL-100を紹介する。
我々はSMALL-100を全ての言語対を均一にサンプリングすることで訓練し、低リソース言語の性能を維持することに重点を置いている。
我々のモデルはM2M-100(1.2B)に匹敵する結果を得るが、推論では3.6倍小さく、4.3倍高速である。
論文 参考訳(メタデータ) (2022-10-20T22:32:29Z) - Distributionally Robust Multilingual Machine Translation [94.51866646879337]
本稿では,分散的ロバストな最適化に基づくMNMT(Multilingual Neural Machine Translation)の新しい学習目標を提案する。
この目的を,反復的最適応答方式を用いて,大規模翻訳コーパスに対して実用的に最適化する方法を示す。
本手法は,多対一の翻訳設定と多対多の翻訳設定の両方において,平均と言語毎のパフォーマンスにおいて,強いベースライン法より一貫して優れる。
論文 参考訳(メタデータ) (2021-09-09T03:48:35Z) - Improving Massively Multilingual Neural Machine Translation and
Zero-Shot Translation [81.7786241489002]
ニューラルネットワーク翻訳(NMT)の多言語モデルは理論的には魅力的であるが、しばしばバイリンガルモデルに劣る。
我々は,多言語NMTが言語ペアをサポートするためにより強力なモデリング能力を必要とすることを論じる。
未知のトレーニング言語ペアの翻訳を強制するために,ランダムなオンライン翻訳を提案する。
論文 参考訳(メタデータ) (2020-04-24T17:21:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。