論文の概要: BHARATI: Morphology-Aware Tokenizers for Classical Indian Languages with Subword Fertility Analysis
- arxiv url: http://arxiv.org/abs/2607.23319v1
- Date: Sat, 25 Jul 2026 18:23:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.060489
- Title: BHARATI: Morphology-Aware Tokenizers for Classical Indian Languages with Subword Fertility Analysis
- Title(参考訳): BharaTI: サブワード・フェーティリティ分析を用いた古典インドの言語用形態素認識トークン
- Authors: Poornima Kumaresan, Pavithra Muruganantham, Lakshmi Rajendran, Santhosh Sivasubramani,
- Abstract要約: 本稿では、7つの言語にまたがるバランスのとれた741MBコーパスでトレーニングされたSentencePiece BPEトークンの集合であるBharaTIについて述べる。
v1(英語とサンスクリット語のみ)、v2(タミル語でバイトフォールバックをサポートする4言語サポート)、v3(フル7言語ネイティブサブワードカバレッジ)の3つの連続したトークン化バージョンについて説明する。
サブワードの肥大分析によると、v3はインド知識システム(IKS)の技術用語当たり平均2.6トークンであり、GPT-2のトークン化器では年間5.25トークン、多言語SentencePieceベースラインでは3.75トークンである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Standard subword tokenization algorithms such as Byte-Pair Encoding (BPE) and SentencePiece are trained predominantly on modern language corpora and produce inefficient segmentations when applied to classical Indian languages. Sanskrit, Tamil, and other classical Indic languages exhibit agglutinative morphology, productive sandhi (phonological fusion at word boundaries), and domain-specific vocabularies absent from general-purpose training data. This paper presents BHARATI, a set of SentencePiece BPE tokenizers trained on a balanced 781 MB corpus spanning seven languages (English, Hindi, Sanskrit, Tamil, Telugu, Kannada, and Malayalam) with native script support for all languages. We describe three successive tokenizer versions: v1 (English and Sanskrit only, with broken byte-fallback for Tamil), v2 (four-language support with byte-level fallback for southern languages), and v3 (full seven-language native subword coverage). Subword fertility analysis demonstrates that v3 averages 2.6 tokens per Indian Knowledge System (IKS) technical term, compared to 5.25 tokens per term with GPT-2's tokenizer and 3.75 tokens with the multilingual SentencePiece baseline, with the largest gains on a set of reserved IKS terms that are represented as single tokens by construction. On a held-out test set of 490 IKS-domain sentences (70 per language across seven languages, released with the measurement script), v3 reduces sequence length by roughly 90% relative to GPT-2 and byte-level encoding (which lack native Indic subwords) and by approximately 25% relative to the mBART-50 multilingual baseline, averaged across the six Indic languages, directly translating to increased effective context length for downstream language models. The tokenizer models (32,000 vocabulary), training scripts, and evaluation benchmarks are released under open licenses.
- Abstract(参考訳): Byte-Pair Encoding (BPE) や SentencePiece のような標準的なサブワードのトークン化アルゴリズムは、現代の言語コーパスに基づいて主に訓練され、古典インドの言語に適用された場合、非効率的なセグメンテーションを生成する。
サンスクリット語、タミル語、その他の古典インド諸語は、一般的な訓練データから欠く、凝集形態、生産的なサンディー語(単語境界での音韻的融合)、およびドメイン固有の語彙を表現している。
本稿では,7つの言語(英語,ヒンディー語,サンスクリット語,タミル語,テルグ語,カンナダ語,マラヤラム語)にまたがるバランスの取れた771MBコーパス上で訓練されたセンテンスピースBPEトークンのセットであるBharaTIについて述べる。
v1(英語とサンスクリット語のみ、タミル語でバイトフォールバックが壊れた)、v2(南部言語でバイトレベルのフォールバックを持つ4言語サポート)、v3(フル7言語ネイティブサブワードカバレッジ)である。
インド知識システム(IKS)の技術用語あたりのv3の平均は2.6トークンであり、GPT-2のトークン化器では5.25トークン、多言語のSentencePieceベースラインでは3.75トークンである。
490 IKS- domain sentences (70言語毎の7つの言語に対して、測定スクリプトと共にリリースされた)の保留テストセットでは、v3はシーケンス長を、GPT-2とバイトレベルのエンコーディング(ネイティブのIndicサブワードを欠いている)に対して約90%削減し、mBART-50の多言語ベースラインに対して約25%削減する。
トークン化モデル(32,000語彙)、トレーニングスクリプト、評価ベンチマークは、オープンライセンス下でリリースされている。
関連論文リスト
- Separate Before You Compress: The WWHO Tokenization Architecture [0.0]
現在のLarge Language Models (LLM) は、主にBPE(Byte Pair Linguist)ベースのトークンライザを使用している。
WWHO(Where-What-How)とSGPE(Syllable Grapheme Pair Linguist)というアルゴリズムを提案する。
Sinhala と Devanagari (Hindi/Sanskrit) を非常に複雑な Abugida スクリプトとして使用し、クリーン化された30万文データセットで WWHO をトレーニングし、1,499,950文のテストセットで評価した。
論文 参考訳(メタデータ) (2026-03-26T10:56:48Z) - Omnilingual SONAR: Cross-Lingual and Cross-Modal Sentence Embeddings Bridging Massively Multilingual Text and Speech [61.759910921200834]
言語間の文エンコーダは通常、数百の言語をカバーしている。
我々はOmniSONARを紹介した。OmniSONARは全言語、言語横断、言語横断の文埋め込みモデルである。
論文 参考訳(メタデータ) (2026-03-17T14:47:35Z) - VerChol -- Grammar-First Tokenization for Agglutinative Languages [0.0]
トークン化は、すべての大規模言語モデル(LLM)パイプラインの基本的なステップである。
集約言語では、一つの単語がルート、時制、アスペクト、人、番号、性別合意、ケース、姿勢を1つの正書法単位にエンコードすることができる。
統計トークン化器は、これらの単語をバイトペアのチャンクに分解し、モルデム境界とトークン数を減らす。
論文 参考訳(メタデータ) (2026-03-06T04:07:15Z) - Evaluating Subword Tokenization Techniques for Bengali: A Benchmark Study with BengaliBPE [0.0]
BengaliBPEは、ベンガル文字用の言語対応のサブワードトークンである。
Unicode正規化とモルフォロジーを意識したマージルールを適用して、言語の一貫性を維持し、サブワードの整合性を維持する。
最も詳細なセグメンテーションと最良の形態的解釈性を提供するが、計算コストはわずかに高い。
論文 参考訳(メタデータ) (2025-11-07T15:23:32Z) - Tokenization Matters: Improving Zero-Shot NER for Indic Languages [2.964265227875254]
トークン化は自然言語処理(NLP)の重要な構成要素である
この研究は、BPE、SentencePiece、およびIndic言語を用いた文字レベルのトークン化戦略を体系的に比較する。
その結果、SentencePieceは低リソースのIndic言語において、NERのBPEよりも一貫して優れたパフォーマンスのアプローチであることがわかった。
論文 参考訳(メタデータ) (2025-04-23T17:28:38Z) - CoSTA: Code-Switched Speech Translation using Aligned Speech-Text Interleaving [61.73180469072787]
インド語から英語のテキストへのコード変更音声の音声翻訳(ST)の問題に焦点をあてる。
本稿では、事前訓練された自動音声認識(ASR)と機械翻訳(MT)モジュールを足場として、新しいエンドツーエンドモデルアーキテクチャCOSTAを提案する。
COSTAは、多くの競合するカスケードおよびエンドツーエンドのマルチモーダルベースラインを3.5BLEUポイントまで上回っている。
論文 参考訳(メタデータ) (2024-06-16T16:10:51Z) - Parrot: Multilingual Visual Instruction Tuning [66.65963606552839]
既存の手法では、視覚エンコーダを教師付き微調整(SFT)を介してMLLM(Multimodal Large Language Models)と整列させるのが一般的である。
言語レベルでの視覚的トークンアライメントにテキストガイダンスを活用する新しいアプローチであるPARROTを提案する。
我々は6言語、15カテゴリ、12,000の質問からなる新しいベンチマークであるMassive Multilingual Multimodal Benchmark (MMMB)を紹介する。
論文 参考訳(メタデータ) (2024-06-04T17:56:28Z) - Machine Translation by Projecting Text into the Same
Phonetic-Orthographic Space Using a Common Encoding [3.0422770070015295]
本稿では,言語類似性を利用した共通多言語ラテン文字符号化(WX表記法)を提案する。
提案手法を類似言語対の実験により検証する。
また、遠距離とゼロショットの言語ペアで最大1BLEUポイントの改善も行います。
論文 参考訳(メタデータ) (2023-05-21T06:46:33Z) - CLSE: Corpus of Linguistically Significant Entities [58.29901964387952]
専門家が注釈を付けた言語学的に重要なエンティティ(CLSE)のコーパスをリリースする。
CLSEは74種類のセマンティックタイプをカバーし、航空券売機からビデオゲームまで様々なアプリケーションをサポートする。
言語的に代表されるNLG評価ベンチマークを,フランス語,マラティー語,ロシア語の3言語で作成する。
論文 参考訳(メタデータ) (2022-11-04T12:56:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。