論文の概要: Adapting Multilingual Embedding Models to Turkish via Cross-Lingual Tokenizer Surgery and Offline Distillation
- arxiv url: http://arxiv.org/abs/2605.29992v1
- Date: Thu, 28 May 2026 14:24:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-30 02:45:56.38769
- Title: Adapting Multilingual Embedding Models to Turkish via Cross-Lingual Tokenizer Surgery and Offline Distillation
- Title(参考訳): クロスリンガル・トケナイザー手術とオフライン蒸留によるトルコ語への多言語埋め込みモデルの適用
- Authors: M. Ali Bayram, Banu Diri, Savaş Yıldırım,
- Abstract要約: 文の埋め込みはセマンティック検索、クラスタリング、分類、検索強化生成のための基礎的なコンポーネントである。
本稿では,768次元のL2正規化ベクトルを生成するトルコの文埋め込みモデルであるembeddingmagibu-200mについて述べる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Sentence embeddings are a foundational component for semantic search, clustering, classification, and retrieval-augmented generation. This paper presents embeddingmagibu-200m, a Turkish-focused sentence embedding model that produces 768-dimensional L2-normalized vectors and supports an 8,192-token context window, far exceeding the 512-token limit of earlier BERT-based Turkish encoders. Instead of full pretraining, an efficient three-stage adaptation pipeline is introduced: (1) construct a Turkish-optimized multilingual tokenizer with a 131,072 vocabulary by pruning redundant tokens from the teacher's vocabulary and incorporating multilingual tokens via frequency analysis on a 40-language corpus, (2) clone a teacher embedding model while preserving transformer backbone weights and initializing a compatible embedding table for the new vocabulary via mean-composition token mapping, and (3) perform offline embedding distillation from precomputed teacher vectors using a cosine similarity objective over a balanced 40-language Wikipedia corpus. The resulting student model contains approximately 200M parameters and trains in roughly four hours on a single GPU by avoiding online teacher inference during training, at a total cost of $5-$20. Empirically, Pearson/Spearman correlations of 77.55%/77.45% are obtained on STSbTR, surpassing the 300M-parameter teacher model (73.84%/72.92%). On TR-MTEB (26 tasks), a mean score of 63.9% is achieved (7th out of 26 models), providing a competitive cost-quality trade-off with 33% fewer parameters than the teacher. To facilitate reproducibility and downstream use, all artifacts are released including model weights, tokenizer files, precomputed embedding datasets, and open-source cloning and distillation tooling.
- Abstract(参考訳): 文の埋め込みはセマンティック検索、クラスタリング、分類、検索強化生成のための基礎的なコンポーネントである。
本稿では,768次元L2正規化ベクトルを生成するトルコの文埋め込みモデルである Embeddingmagibu-200m について述べる。
教師の語彙から冗長なトークンを抽出し、40言語コーパス上で周波数解析により多言語トークンを組み込んだトルコ語最適化多言語トークンライザを構築し、(2)トランスフォーマーバックボーンの重みを保ちつつ教師の埋め込みモデルをクローンし、平均合成トークンマッピングにより新しい語彙に対する互換性のある埋め込みテーブルを初期化し、(3)バランスの取れた40言語ウィキペディアコーパス上でコサイン類似度を用いて、事前計算された教師ベクトルからオフライン埋め込み蒸留を行う。
結果として得られた学生モデルは、約2億のパラメータを含み、トレーニング中のオンライン教師の推論を回避して、1つのGPU上で約4時間でトレーニングする。
経験的には、STSbTRではピアソンとスピアマンの相関が77.55%/77.45%であり、300Mパラメーターの教師モデル(73.84%/72.92%)を上回っている。
TR-MTEB(26タスク)では、平均スコア63.9%(26モデル中7位)が達成され、教師よりも33%少ないパラメータで競争力のあるコスト品質のトレードオフを提供する。
再現性とダウンストリームの使用を容易にするため、モデルウェイト、トークン化ファイル、事前計算された埋め込みデータセット、オープンソースのクローニングと蒸留ツールを含むすべてのアーティファクトがリリースされた。
関連論文リスト
- A Systematic Benchmark of Machine Transliteration Models for the Tajik-Farsi Language Pair: A Comparative Study from Rule-Based to Transformer Architectures [0.0]
本稿では,タジク文字(キリル文字)とペルシア文字(アラビア文字)の文字化のための現代機械学習アーキテクチャの包括的比較分析について述べる。
最初のデータセットは328,253対の文対で構成され、成層ランダムサンプリングを用いて4万対の代表的サブセットが形成された。
結果は、他のモデルよりもByT5(TajikからFarsiへのchrF++ 87.4、逆の80.1)の圧倒的な優位性を示している。
論文 参考訳(メタデータ) (2026-05-04T06:24:51Z) - Evolve: A Persistent Knowledge Lifecycle for Small Language Models [0.0]
Evolveは、小さなローカル言語モデルと、永続的で教師がコンパイルしたナレッジストアをペアリングする。
新たなセクションは、取得、教師によるマージによる統合オフライン、期限切れ時のインライン更新に設定されている。
統合後、知識ストアは3つの独立したベンチマークで31-33.5%圧縮され、精度は維持される。
論文 参考訳(メタデータ) (2026-04-25T19:39:21Z) - TabiBERT: A Large-Scale ModernBERT Foundation Model and A Unified Benchmark for Turkish [0.7233065479782755]
TabiBERTはModernBERTアーキテクチャをベースとしたモノリンガルのトルコ語エンコーダである。
8,192トークンのコンテキスト長(16xオリジナルBERT)をサポートし、最大2.65倍のスピードアップを実現し、GPUメモリ使用量を削減する。
タビベンチで77.58を獲得し、BERTurkを1.62ポイント上回り、8つのカテゴリーのうち5つの最先端技術を確立した。
論文 参考訳(メタデータ) (2025-12-28T20:18:22Z) - DataComp-LM: In search of the next generation of training sets for language models [200.5293181577585]
DataComp for Language Models (DCLM)は、制御されたデータセット実験のためのテストベッドであり、言語モデルを改善することを目的としている。
我々は、Common Crawlから抽出された240Tトークンの標準化コーパス、OpenLMフレームワークに基づく効果的な事前学習レシピ、53の下流評価スイートを提供する。
DCLMベンチマークの参加者は、412Mから7Bパラメータのモデルスケールでの重複、フィルタリング、データ混合などのデータキュレーション戦略を実験することができる。
論文 参考訳(メタデータ) (2024-06-17T17:42:57Z) - Adapted Multimodal BERT with Layer-wise Fusion for Sentiment Analysis [84.12658971655253]
本稿では,マルチモーダルタスクのためのBERTベースのアーキテクチャであるAdapted Multimodal BERTを提案する。
アダプタはタスクの事前訓練された言語モデルを手動で調整し、融合層はタスク固有の層ワイドな音声視覚情報とテキストBERT表現を融合させる。
われわれは、このアプローチがより効率的なモデルにつながり、微調整されたモデルよりも優れ、ノイズの入力に堅牢であることを示した。
論文 参考訳(メタデータ) (2022-12-01T17:31:42Z) - OneAligner: Zero-shot Cross-lingual Transfer with One Rich-Resource
Language Pair for Low-Resource Sentence Retrieval [91.76575626229824]
文検索タスク用に特別に設計されたアライメントモデルであるOneAlignerを提案する。
大規模並列多言語コーパス(OPUS-100)の全ての言語ペアで訓練すると、このモデルは最先端の結果が得られる。
実験結果から,文アライメントタスクの性能はモノリンガルおよび並列データサイズに大きく依存することがわかった。
論文 参考訳(メタデータ) (2022-05-17T19:52:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。