論文の概要: Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension
- arxiv url: http://arxiv.org/abs/2608.03494v1
- Date: Tue, 04 Aug 2026 11:32:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.157359
- Title: Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension
- Title(参考訳): 初期化損失を超えて: LLM語彙拡張のためのToken Embedding初期化戦略の体系的研究
- Abstract要約: 我々は,Nemotron-3-Nano-30B-A3Bにおけるヒンディー語語彙拡張のための20以上の戦略の体系的研究を行った。
FOCUS,トップk検索,残留意味マッピング,サブワード構成,ノルムキャリブレーション,入力出力非対称性などである。
- 参考スコア(独自算出の注目度): 3.180834345553136
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vocabulary extension is an efficient way to adapt pretrained large language models (LLMs) to new languages, but the initialization of newly added token embeddings can strongly affect continued pre-training (CPT) efficiency. We present a systematic study of more than 20 initialization strategies for Hindi vocabulary extension in Nemotron-3-Nano-30B-A3B. Our comparison spans vocabulary-averaging baselines; external and learned initialization methods, including FOCUS, top-k semantic retrieval, and residual MLP mappings; subword composition; norm calibration; and input-output asymmetry. We find that subword composition methods outperform both vocabulary averaging and external/learned initialization approaches. Within subword composition, asymmetric variants achieve the lowest observed early validation loss and reveal distinct preferences for input and output embedding initialization. The best observed configuration initializes the input embedding matrix with uniform subword averaging and Hindi-specific norm calibration, and the output language modeling head with character-length-weighted subword averaging. Relative to the standard Mean-all baseline, this full initialization pipeline reaches comparable validation loss with over a 6x reduction in CPT steps and exceeds the baseline's 3,500-step MILU-Hindi accuracy after only 500 steps. Finally, we show that initialization loss and initialization bits-per-byte (Init BPB) are unreliable predictors of downstream convergence, whereas lightweight CPT, as few as 50 steps, provides a cost-effective and reliable signal for selecting the best initialization strategy.
- Abstract(参考訳): 語彙拡張は、事前訓練された大規模言語モデル(LLM)を新しい言語に適応させる効率的な方法であるが、新たに追加されたトークン埋め込みの初期化は、継続事前学習(CPT)効率に強く影響を与える。
我々は,Nemotron-3-Nano-30B-A3Bにおけるヒンディー語語彙拡張のための20以上の初期化戦略について系統的研究を行った。
FOCUS,トップkセマンティック検索,残留MLPマッピング,サブワード構成,ノルムキャリブレーション,入力出力非対称性などの外部および学習初期化手法の比較を行った。
単語合成法は語彙平均化法と外部学習型初期化法の両方に優れることがわかった。
サブワード構成において、非対称な変種は、観測された最も低い早期検証損失を達成し、入力と出力の埋め込み初期化に対する明確な選好を明らかにする。
最適な構成は、入力埋め込み行列を一様サブワード平均化とヒンディー語固有のノルムキャリブレーションで初期化し、出力言語モデリングヘッドを文字長重み付きサブワード平均化で初期化する。
標準のMean-allベースラインとは対照的に、この完全な初期化パイプラインはCPTステップの6倍以上の削減で同等の検証損失に達し、500ステップの後にベースラインの3500ステップのMILU-Hindi精度を超える。
最後に、初期化損失と初期化ビット/バイト(Init BPB)がダウンストリーム収束の信頼できない予測因子であることを示し、軽量CPTは50ステップ以内で、最適な初期化戦略を選択するためのコスト効率と信頼性の高い信号を提供する。
関連論文リスト
- Reducing quantum measurements in qubit-based overlapping grouping methods for quantum energy estimation through better initializations [0.8594140167290097]
グループ戦略はハミルトン人の期待値を推定するコストを大幅に削減する。
重なり合う方法には、イニシャルとしてSorted Insertion (SI) アルゴリズムから得られるハミルトン群の非重複なグループ化が必要である。
VarSIグルーピングは、重複メソッドによって既に必要とされていた共分散インフォームド辞書を利用して、より良い非重複グループを構築する。
論文 参考訳(メタデータ) (2026-07-02T22:12:00Z) - LGSE: Lexically Grounded Subword Embedding Initialization for Low-Resource Language Adaptation [7.623227616015147]
本稿では,新しいトークンの埋め込みを初期化するための形態的情報セグメント化を導入したLexically Grounded Subword Embedding Initializationフレームワークを提案する。
ランダムなベクトルや任意のサブワードを使う代わりに、LGSEは単語を構成形態素に分解し、意味的に一貫性のある埋め込みを構成する。
質問応答、名前付きエンティティ認識、テキスト分類の3つのNLPタスクにおいて、LGSEを2つの形態的にリッチで低リソースな言語で評価する。
論文 参考訳(メタデータ) (2026-03-23T23:07:16Z) - HYPEROFA: Expanding LLM Vocabulary to New Languages via Hypernetwork-Based Embedding Initialization [50.27950279695363]
多くの事前訓練された言語モデル (PLM) は、中級言語と低級言語で最適な性能を示す。
これを解決するための一般的な戦略は、ターゲット言語固有の新しいトークンを導入し、埋め込みを初期化し、ターゲット言語データに連続的な事前トレーニングを適用することである。
より適応的なトークン埋め込みのためのハイパーネットワークベースのアプローチであるHYPEROFAを提案する。
論文 参考訳(メタデータ) (2025-04-21T19:40:32Z) - The First Few Tokens Are All You Need: An Efficient and Effective Unsupervised Prefix Fine-Tuning Method for Reasoning Models [69.798277882245]
大規模言語モデルの推論効率を向上させるために,Unsupervised Prefix Fine-Tuning (UPFT)を導入した。
UPFTはラベル付きデータや徹底的なサンプリングの必要性を取り除く。
実験の結果,UPFTは教師付き手法の性能と一致していることがわかった。
論文 参考訳(メタデータ) (2025-03-04T18:56:03Z) - Tag&Tab: Pretraining Data Detection in Large Language Models Using Keyword-Based Membership Inference Attack [24.973527478947982]
大規模言語モデルの事前学習に使用されるデータを検出する新しい手法であるTag&Tabを提案する。
4つのベンチマークデータセットに対する実験は、最先端の手法よりも平均5.3%から17.6%のAUCスコアが増加したことを示している。
論文 参考訳(メタデータ) (2025-01-14T21:55:37Z) - An Empirical Comparison of Vocabulary Expansion and Initialization Approaches for Language Models [31.231720803637085]
言語モデル(LM)は英語の自然言語処理タスクに優れるが、他のほとんどの言語では性能が低下している。
オリジナルのモデルのトークン化子の語彙範囲が限定されているため、新しい言語の表現が不十分になる。
制約付きWord2Vec (CW2V) は言語間埋め込みを必要としない。
論文 参考訳(メタデータ) (2024-07-08T11:38:49Z) - OFA: A Framework of Initializing Unseen Subword Embeddings for Efficient Large-scale Multilingual Continued Pretraining [49.213120730582354]
言語モデルをスクラッチから事前学習する代わりに、既存の事前学習言語モデル(PLM)を語彙拡張と継続事前学習を通じて新しい言語に適応させることがより効率的な方法である。
我々は、新しいフレームワークを提案する: $textbfO$ne $textbfF$or $textbfA$ll。
論文 参考訳(メタデータ) (2023-11-15T10:40:45Z) - Data-driven Weight Initialization with Sylvester Solvers [72.11163104763071]
本稿では,ディープニューラルネットワークのパラメータを初期化するためのデータ駆動方式を提案する。
提案手法は,特にショットや微調整の設定において有効であることを示す。
論文 参考訳(メタデータ) (2021-05-02T07:33:16Z) - Pre-training Is (Almost) All You Need: An Application to Commonsense
Reasoning [61.32992639292889]
事前学習されたトランスモデルの微調整は、一般的なNLPタスクを解決するための標準的なアプローチとなっている。
そこで本研究では,可視性ランキングタスクをフルテキスト形式でキャストする新たなスコアリング手法を提案する。
提案手法は, ランダム再起動にまたがって, より安定した学習段階を提供することを示す。
論文 参考訳(メタデータ) (2020-04-29T10:54:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。