論文の概要: Beyond Atomic Tokens: Factorizing Syllables for Language Model Pretraining
- arxiv url: http://arxiv.org/abs/2609.21362v2
- Date: Fri, 25 Sep 2026 01:00:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.013921
- Title: Beyond Atomic Tokens: Factorizing Syllables for Language Model Pretraining
- Title(参考訳): アトミックトークンを超えて - 言語モデルの事前トレーニングのためのSyllableを分解する
- Abstract要約: ベトナム語と中国語の言語的に動機づけられたトークンであるtextbfPhonemic Tokenizerを紹介した。
各音節をIPAに変換し、その音節をオンセット、ライム、トーンの3つの音韻的要素に分解する。
textbfPhonemicBERTでは、分解されたコンポーネントの埋め込みと完全なマスク付き音節の再構成を組み合わせたトークン化をインスタンス化する。
- 参考スコア(独自算出の注目度): 8.518399717813192
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Conventional tokenizers represent text as characters or statistically derived subwords, overlooking the internal phonological structure of syllables and often requiring large vocabularies. We introduce \textbf{Phonemic Tokenizer}, a linguistically motivated tokenizer for Vietnamese and Chinese that converts each syllable into IPA and factorizes it into three phonological components: onset, rime, and tone. The three components jointly occupy one contextual position, preserving syllable-level sequence length while enabling representation sharing across phonologically related syllables. Non-phonological and unsupported units are handled through character-level fallback. This deterministic design requires no corpus-dependent vocabulary learning and yields vocabularies of only 112 entries for Chinese and 256 for Vietnamese. Intrinsic evaluation shows that the tokenizer achieves substantially higher Rényi efficiency in both languages, represents every entry in a standard Vietnamese syllable dictionary with a Fertility of exactly one, and generally produces shorter Vietnamese sequences than existing pretrained tokenizers. We further instantiate the tokenizer in \textbf{PhonemicBERT}, which combines factorized component embeddings and reconstructs complete masked syllables using three prediction heads. Under a controlled Chinese pretraining setup, PhonemicBERT-Zh is competitive with or outperforms character, subword, and SubChar alternatives across diverse language-understanding tasks. PhonemicBERT-Vi also achieves competitive or superior results to established Vietnamese and multilingual pretrained models. These results establish phonemic factorization as a compact, efficient, and interpretable alternative to atomic and statistically segmented text representations.
- Abstract(参考訳): 従来のトークン化器は文字または統計的に派生したサブワードとしてテキストを表現し、音節の内部の音韻構造を見下ろし、しばしば大きな語彙を必要とする。
ベトナム語と中国語の言語的に動機付けられたトークン化ツールである「textbf{Phonemic Tokenizer}」を導入し、各音節をIPAに変換して音韻成分(オンセット、ライム、トーン)に分解する。
3つのコンポーネントは1つの文脈的位置を共同で占有し、音韻関係の音節間の表現共有を可能にしながら音節レベルのシーケンス長を保存する。
非音韻単位および非音韻単位は文字レベルのフォールバックによって処理される。
この決定論的設計では、コーパスに依存した語彙学習は必要とせず、中国語は112語、ベトナム語は256語である。
内在的評価は、トークン化剤が両方の言語でかなり高いレニイ効率を達成することを示し、標準ベトナム語音節辞書の全てのエントリを正確に1つのフェルティリティで表現し、一般に既存の事前訓練されたトークン化剤よりも短いベトナム語シーケンスを生成することを示している。
さらに、3つの予測ヘッドを用いて、分解成分の埋め込みと完全なマスク付き音節の再構成を組み合わせた「textbf{PhonemicBERT}」でトークン化器をインスタンス化する。
制御された中国の事前訓練設定の下では、PhonemicBERT-Zhは様々な言語に従属するタスクにまたがる文字、サブワード、サブCharの代替品に競争力がある。
また、PhonemicBERT-Viはベトナム語および多言語事前訓練モデルの競争力や優位性も達成している。
これらの結果は、原子と統計的に区切られたテキスト表現のコンパクトで効率的で解釈可能な代替品として音素分解を確立する。
関連論文リスト
- Speech Codec Probing from Semantic and Phonetic Perspectives [49.01048570474675]
音声トークン化器は,マルチモーダルシステムにおいて,音声を大言語モデル (LLM) に接続するために必須である。
新たな証拠は、音声表現において「意味」と呼ばれるものは、テキスト由来の意味論と一致しないことを示している。
論文 参考訳(メタデータ) (2026-03-11T03:32:25Z) - Parallel Tokenizers: Rethinking Vocabulary Design for Cross-Lingual Transfer [13.630754537249707]
トークン化は多言語言語モデルの基盤を定義する。
新しいフレームワークは、単言語でトークンを訓練し、バイリンガル辞書や単語間翻訳を用いて語彙を徹底的に調整する。
論文 参考訳(メタデータ) (2025-10-07T17:05:49Z) - Tokens with Meaning: A Hybrid Tokenization Approach for NLP [0.2826977330147589]
自然言語処理(NLP)におけるトークン化の役割
規則に基づく形態素解析と統計的サブワードセグメンテーションを組み合わせたハイブリッドトークン化フレームワークを提案する。
本手法は, 音韻正規化, ルートアフィックス, および形態素保存と語彙効率のバランスをとる新しいアルゴリズムを用いる。
論文 参考訳(メタデータ) (2025-08-19T22:17:42Z) - Disambiguation of Chinese Polyphones in an End-to-End Framework with Semantic Features Extracted by Pre-trained BERT [81.99600765234285]
ポリフォニック文字の発音を予測するためのエンドツーエンドフレームワークを提案する。
提案手法は,Transformers(BERT)モデルとニューラルネットワーク(NN)に基づく分類器から,事前訓練された双方向エンコーダ表現からなる。
論文 参考訳(メタデータ) (2025-01-02T06:51:52Z) - Learn Your Tokens: Word-Pooled Tokenization for Language Modeling [11.40976202290724]
言語モデルは典型的には、トークンを長い文字列に組み合わせた決定論的手作業で、テキストをサブワードにトークン化する。
最近のコンテクスト長の圧縮と制限の試みは,単語境界を完全に無視するが有用である。
本稿では,単語境界を利用して単語表現にバイト/文字をプールする「学習する」方式について考察する。
論文 参考訳(メタデータ) (2023-10-17T23:34:39Z) - Dict-TTS: Learning to Pronounce with Prior Dictionary Knowledge for
Text-to-Speech [88.22544315633687]
ポリホンの曖昧さは, 音声合成システムにおいて, 自然なテキストシーケンスから正確な発音知識を抽出することを目的としている。
オンラインウェブサイト辞書を用いた意味認識型テキスト音声合成モデルであるDict-TTSを提案する。
3つの言語による実験結果から,我々のモデルは発音精度においていくつかの強いベースラインモデルより優れていることが示された。
論文 参考訳(メタデータ) (2022-06-05T10:50:34Z) - More Than Words: Collocation Tokenization for Latent Dirichlet
Allocation Models [71.42030830910227]
モデルが異なる環境でクラスタリングの品質を測定するための新しい指標を提案する。
マージトークンでトレーニングされたトピックは、マージされていないモデルよりも、より明確で、一貫性があり、トピックを区別する効果が高いトピックキーをもたらすことを示す。
論文 参考訳(メタデータ) (2021-08-24T14:08:19Z) - SHUOWEN-JIEZI: Linguistically Informed Tokenizers For Chinese Language
Model Pretraining [48.880840711568425]
事前学習された言語モデルの中国語トークン化に対する3つの要因の影響について検討する。
本稿では,発音に基づくトークン化システムであるSHUOWEN (Talk Word) と,グリフに基づくトークン化システムであるJIEZI (Solve Character) の3種類のトークン化手法を提案する。
SHUOWENとJIEZIは、一般的に従来のシングル文字トークンよりも優れた性能を持つ。
論文 参考訳(メタデータ) (2021-06-01T11:20:02Z) - Augmenting Part-of-speech Tagging with Syntactic Information for
Vietnamese and Chinese [0.32228025627337864]
我々は,ベトナム語の単語分割と音声タグ付けの一部を,簡易な選挙区を用いて改善するという考え方を実装した。
共同語分割とパート・オブ・音声タギングのためのニューラルモデルは,音節に基づく構成のアーキテクチャを持つ。
このモデルは、予測された単語境界と、他のツールによる音声タグで拡張することができる。
論文 参考訳(メタデータ) (2021-02-24T08:57:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。