論文の概要: Morphology Aware Reversible Semantic Tokenization and Hierarchical Word Composition for Tamil Language Models
- arxiv url: http://arxiv.org/abs/2608.01153v1
- Date: Sun, 02 Aug 2026 11:07:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.105521
- Title: Morphology Aware Reversible Semantic Tokenization and Hierarchical Word Composition for Tamil Language Models
- Title(参考訳): タミル語モデルに対する可逆的意味的トークン化と階層的単語構成を考慮した形態素
- Authors: Anand Murugan,
- Abstract要約: オープンソースのThamizhiMorphアナライザとジェネレータを拡張したタミル形態解析システムを提案する。
本稿では,Sarvam-1,AI4Bharat IndicBERTv2,BrahmicTokenizer-131Kに基づくフラットな形態素トークン化器,信号保存語合成器,およびトークン化器を比較した。
明示的なタミル形態は、固定された小モデル予算の下での翻訳を改善する一方、階層的な構成は、シーケンスの長さと推定推論コストを大幅に削減する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Statistical subword tokenizers can process arbitrary text, but their units need not align with lexical or grammatical structure. This is especially important for Tamil, where a written word may encode stem changes, case, number, tense, agreement, voice, clitics, and linked verbs. We present a Tamil morphology system extending the open-source ThamizhiMorph analyzer and generator, together with a byte-exact semantic tokenizer and a learned hierarchical word composer. Twelve finite-state transducers analyze words into lemmas and grammatical features, while character and byte fallbacks preserve exact reconstruction. We compare a flat morphology tokenizer, a signal-preserving word composer, and tokenizers based on Sarvam-1, AI4Bharat IndicBERTv2, and BrahmicTokenizer-131K. All systems use the same 69,591 Tamil-English training pairs, 18.97-million-parameter encoder-decoder, 40,000 updates, target tokenizer, optimizer, positional method, and generation settings. On a protected 3,539-row IN22 and FLORES+ evaluation, morphology-flat achieves the best pooled scores: 10.63 BLEU, 35.26 chrF++, and 0.6276 COMETKiwi. Relative to AI4Bharat, the strongest external-tokenizer baseline, these are improvements of 7.2%, 3.2%, and 2.6%. The word composer scores 10.30, 34.88, and 0.6241, improving on AI4Bharat by 3.8%, 2.1%, and 2.0%. The composer reduces mean global source states from 71.48 to 29.08, a 59.3% reduction, and is estimated to require 9-21% fewer inference FLOPs depending on decoder caching. Its remaining quality gap is concentrated in longer FLORES+ sentences. These results show that explicit Tamil morphology improves translation under a fixed small-model budget, while hierarchical composition substantially reduces sequence length and estimated inference cost.
- Abstract(参考訳): 統計的サブワードトークンーは任意のテキストを処理できるが、それらのユニットは語彙構造や文法構造と整合する必要はない。
これはタミル語にとって特に重要であり、ある単語が幹の変化、例、数、時制、合意、声、クレティクス、連結動詞をエンコードすることがある。
本稿では,オープンソースのThamizhiMorphアナライザとジェネレータを拡張したTamizhiMorphの形態解析システムについて述べる。
12の有限状態トランスデューサは単語を補題と文法的特徴に分析し、文字とバイトのフォールバックは正確な再構成を保っている。
我々は,Sarvam-1,AI4Bharat IndicBERTv2,BrahmicTokenizer-131Kに基づくフラットな形態素トークン化器,信号保存語合成器,およびトークン化器を比較した。
すべてのシステムは、69,591のタミル・イングリッシュ・トレーニングペア、18.97ミリパラメーター・エンコーダ・デコーダ、40,000の更新、ターゲットトークンー、オプティマイザ、位置決め方法、生成設定を使用する。
保護された3,539-row IN22とFLORES+の評価では、10.63 BLEU、35.26 chrF++、0.6276 COMETKiwiである。
最強の外部トケナイザーベースラインであるAI4Bharatに対して、これらは7.2%、3.2%、および2.6%の改善である。
作曲家のスコアは10.30、34.88、0.6241で、AI4Bharatでは3.8%、2.1%、2.0%向上している。
この作曲家は平均的なグローバルソース状態を 71.48 から 29.08 に減らし、59.3% に減らし、デコーダキャッシングによって9-21% の推論FLOP を必要とすると見積もられている。
残りの品質差は長いFLORES+文に集中している。
これらの結果から, 明確なタミル語形態は固定された小モデル予算下での翻訳を改善する一方, 階層的構成は配列長と推定推論コストを大幅に削減することがわかった。
関連論文リスト
- BHARATI: Morphology-Aware Tokenizers for Classical Indian Languages with Subword Fertility Analysis [0.0]
本稿では、7つの言語にまたがるバランスのとれた741MBコーパスでトレーニングされたSentencePiece BPEトークンの集合であるBharaTIについて述べる。
v1(英語とサンスクリット語のみ)、v2(タミル語でバイトフォールバックをサポートする4言語サポート)、v3(フル7言語ネイティブサブワードカバレッジ)の3つの連続したトークン化バージョンについて説明する。
サブワードの肥大分析によると、v3はインド知識システム(IKS)の技術用語当たり平均2.6トークンであり、GPT-2のトークン化器では年間5.25トークン、多言語SentencePieceベースラインでは3.75トークンである。
論文 参考訳(メタデータ) (2026-07-25T18:23:06Z) - Context-Aware Distillation and Ablation for Text2DSL [78.29352305480285]
我々は、コンテクスト対応蒸留により、プロンプトのみの合成生成を置き換える。
教師の大きな言語モデルは、明示的に定義された構造化コンテキストの下で機能する。
これは、検証されたポルキットベンチコーパスを4,204対から10,073対にスケールする。
論文 参考訳(メタデータ) (2026-06-21T16:27:24Z) - Separate Before You Compress: The WWHO Tokenization Architecture [0.0]
現在のLarge Language Models (LLM) は、主にBPE(Byte Pair Linguist)ベースのトークンライザを使用している。
WWHO(Where-What-How)とSGPE(Syllable Grapheme Pair Linguist)というアルゴリズムを提案する。
Sinhala と Devanagari (Hindi/Sanskrit) を非常に複雑な Abugida スクリプトとして使用し、クリーン化された30万文データセットで WWHO をトレーニングし、1,499,950文のテストセットで評価した。
論文 参考訳(メタデータ) (2026-03-26T10:56:48Z) - Omnilingual SONAR: Cross-Lingual and Cross-Modal Sentence Embeddings Bridging Massively Multilingual Text and Speech [61.759910921200834]
言語間の文エンコーダは通常、数百の言語をカバーしている。
我々はOmniSONARを紹介した。OmniSONARは全言語、言語横断、言語横断の文埋め込みモデルである。
論文 参考訳(メタデータ) (2026-03-17T14:47:35Z) - Simultaneous Speech-to-Speech Translation Without Aligned Data [52.467808474293605]
同時音声翻訳では、ソース音声を対象言語にリアルタイムで翻訳する必要がある。
単語レベルのアライメントを完全に不要にするヒビキゼロを提案する。
Hibiki-Zeroは5つのX-英語タスクの翻訳精度、レイテンシ、音声転送、自然性において最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-02-11T17:41:01Z) - AraToken: Optimizing Arabic Tokenization with Normalization Pipeline and Language Extension for Qwen3 [4.284434049360481]
本稿では、SentencePiece Unigramアルゴリズム上に構築されたアラビア最適化トークンであるAraTokenを紹介する。
正常化したSentencePieceは、非正規化ベースラインに比べて18%低い受精率(1.199対1.35トークン/ワード)を達成することを示す。
実験の結果,LEPは100Kアラビアサンプルの800段階において,評価損失を8.28から2.43に減少させることがわかった。
論文 参考訳(メタデータ) (2025-12-20T15:32:10Z) - Tokens with Meaning: A Hybrid Tokenization Approach for NLP [0.2826977330147589]
自然言語処理(NLP)におけるトークン化の役割
規則に基づく形態素解析と統計的サブワードセグメンテーションを組み合わせたハイブリッドトークン化フレームワークを提案する。
本手法は, 音韻正規化, ルートアフィックス, および形態素保存と語彙効率のバランスをとる新しいアルゴリズムを用いる。
論文 参考訳(メタデータ) (2025-08-19T22:17:42Z) - SupraTok: Cross-Boundary Tokenization for Enhanced Language Model Performance [1.9336815376402718]
トークン化は、自然言語処理の根本的かつ未発見のボトルネックである。
サブワードセグメンテーションを再現する新しいトークン化アーキテクチャであるSupraTokを提案する。
提案手法は,英語のトークン化効率を31%向上させる。
論文 参考訳(メタデータ) (2025-08-16T00:54:20Z) - Broken Tokens? Your Language Model can Secretly Handle Non-Canonical Tokenizations [83.93566096400723]
ランダムにサンプリングされたトークン化が与えられた場合、命令調整されたモデルは元の性能の最大93.4%を維持している。
文字レベルのセグメンテーションは文字列操作とコード理解タスクを最大+14%改善する。
右列桁のグルーピングは、大数の算術を+33%向上させる。
論文 参考訳(メタデータ) (2025-06-23T18:02:26Z) - Span Pointer Networks for Non-Autoregressive Task-Oriented Semantic
Parsing [55.97957664897004]
seq2seq、非自動回帰的、タスク指向を構築するための効果的なレシピは、3つのステップで発話とセマンティックフレームをマッピングする。
これらのモデルは通常、長さ予測によってボトルネックとなる。
本研究では,デコードタスクをテキスト生成からスパン予測へシフトさせる非自己回帰手法を提案する。
論文 参考訳(メタデータ) (2021-04-15T07:02:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。