論文の概要: Tokenizing Crosslingual Homographs
- arxiv url: http://arxiv.org/abs/2607.17689v1
- Date: Mon, 20 Jul 2026 08:37:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.551741
- Title: Tokenizing Crosslingual Homographs
- Title(参考訳): クロスリンガル・ホモグラフのトークン化
- Abstract要約: 多言語言語モデルは、限られた数のトークン単位内で複数の言語を表現するために、共有サブワード語彙に依存している。
我々はこの制限を言語間ホモグラフと偽の友人を通して検討する。
そこで本稿では,共有語彙単語の初期文字を置き換える言語固有の文字を用いた,単純なトークン化レベル介入を提案する。
- 参考スコア(独自算出の注目度): 8.254230288283258
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Multilingual language models rely on shared subword vocabularies to represent multiple languages within a limited number of token units. While such sharing is often useful, it can also create cases in which identical surface forms are treated too uniformly across languages, even when their meanings or usage differ. We investigate this limitation through cross-lingual homographs and false friends, and examine whether introducing language information earlier in the tokenization process can improve their treatment. We propose a simple tokenizer-level intervention based on language cues: language-specific characters replacing initial characters of shared-vocabulary words, reducing common identity during vocabulary construction. In intrinsic analysis, we find through tokenizer-level statistics that BPE and UnigramLM often treat cross-lingual homographs in a largely language agnostic way, whereas the context-sensitive SaGe tokenizer diverges more strongly; our intervention removes this gap. In downstream English-to-X machine translation, our cues yield modest improvements in several settings, especially under BPE, although the effect is not consistent across all languages and evaluation sets. Overall, the findings suggest that adding lightweight language information at the tokenizer level is a promising direction for further exploration.
- Abstract(参考訳): 多言語言語モデルは、限られた数のトークン単位内で複数の言語を表現するために、共有サブワード語彙に依存している。
このような共有はしばしば有用であるが、同じ表面形態が言語間で不均一に扱われる場合も、意味や用法が違っても発生することがある。
本稿では,この制限を言語間ホモグラフと偽の友人を通して検討し,トークン化プロセスで早期に言語情報を導入することで治療を改善するかを検討する。
そこで本稿では,言語固有の文字が単語の最初の文字を置換し,語彙構築時の共通化を減らすことを目的とした,単純なトークン化レベル介入を提案する。
内在的分析では, BPE と UnigramLM が言語に依存しない方法で言語間ホモグラフを扱うことが多いが, 文脈に敏感な SaGe トークン化器はより強く分散し, 介入によってこのギャップが取り除かれる。
下流のイングリッシュ・トゥ・X機械翻訳では、いくつかの設定において、特にBPEでは、その効果は全ての言語と評価セットで一致していないが、最も改善されている。
全体としては、トークン化レベルに軽量な言語情報を追加することが、さらなる探索の有望な方向であることを示唆している。
関連論文リスト
- Soft Token Alignment for Cross-Lingual Reasoning [31.882767320907572]
SOLARは教師付き微調整のための補助的目的であり、言語間でソフトトケン表現を整列させる。
次に、共有埋め込み空間において、各非英語のソフトトーケン要約を英語のそれと一致させる。
SOLARの精度はベースモデルで+17.7ポイント、標準教師付き微調整で+3.8ポイント向上している。
論文 参考訳(メタデータ) (2026-06-25T00:01:58Z) - Parallel Tokenizers: Rethinking Vocabulary Design for Cross-Lingual Transfer [13.630754537249707]
トークン化は多言語言語モデルの基盤を定義する。
新しいフレームワークは、単言語でトークンを訓練し、バイリンガル辞書や単語間翻訳を用いて語彙を徹底的に調整する。
論文 参考訳(メタデータ) (2025-10-07T17:05:49Z) - False Friends Are Not Foes: Investigating Vocabulary Overlap in Multilingual Language Models [53.01170039144264]
多言語コーパスで訓練されたサブワードトークンライザは、言語間で重複するトークンを自然に生成する。
トークンの重複は言語間転送を促進するのか、それとも言語間の干渉を導入するのか?
相反する語彙を持つモデルでは、重なり合う結果が得られます。
論文 参考訳(メタデータ) (2025-09-23T07:47:54Z) - Tokens with Meaning: A Hybrid Tokenization Approach for NLP [0.2826977330147589]
自然言語処理(NLP)におけるトークン化の役割
規則に基づく形態素解析と統計的サブワードセグメンテーションを組み合わせたハイブリッドトークン化フレームワークを提案する。
本手法は, 音韻正規化, ルートアフィックス, および形態素保存と語彙効率のバランスをとる新しいアルゴリズムを用いる。
論文 参考訳(メタデータ) (2025-08-19T22:17:42Z) - Beyond Literal Token Overlap: Token Alignability for Multilinguality [53.680462160878925]
我々は,多言語トークン化の効果と品質を理解する新しい方法として,サブワードトークン整合性を提案する。
特に、この指標は、スクリプトが異なっており、リテラルトークンの重複が低い場合、多言語性を予測する。
言語間移動のための最適な言語ペアを特定するために,我々のサブワードトークン整合性指標を推奨する。
論文 参考訳(メタデータ) (2025-02-10T13:50:12Z) - Discovering Low-rank Subspaces for Language-agnostic Multilingual
Representations [38.56175462620892]
ML-LM(ML-LM)は,ゼロショット言語間移動の顕著な能力を示す。
多言語埋め込み空間から言語固有の要素を投影する新しい視点を提案する。
本手法を適用すれば,ML-LMよりも一貫した改善が期待できることを示す。
論文 参考訳(メタデータ) (2024-01-11T09:54:11Z) - Exposing Cross-Lingual Lexical Knowledge from Multilingual Sentence
Encoders [85.80950708769923]
本稿では,多言語言語モデルを用いて,それらのパラメータに格納された言語間語彙の知識量を探索し,元の多言語LMと比較する。
また、この知識を付加的に微調整した多言語モデルにより公開する新しい手法も考案した。
標準ベンチマークの大幅な向上を報告します。
論文 参考訳(メタデータ) (2022-04-30T13:23:16Z) - Inducing Language-Agnostic Multilingual Representations [61.97381112847459]
言語間の表現は、世界中のほとんどの言語でNLP技術が利用可能になる可能性がある。
i) 対象言語のベクトル空間をピボットソース言語に再配置すること、(ii) 言語固有の手段と分散を取り除くこと、(ii) 副産物としての埋め込みの識別性を向上すること、(iii) 形態的制約や文の並べ替えを除去することによって言語間の入力類似性を高めること、の3つのアプローチを検討する。
論文 参考訳(メタデータ) (2020-08-20T17:58:56Z) - Bridging Linguistic Typology and Multilingual Machine Translation with
Multi-View Language Representations [83.27475281544868]
特異ベクトル標準相関解析を用いて、各情報源からどのような情報が誘導されるかを調べる。
我々の表現は類型学を組み込み、言語関係と相関関係を強化する。
次に、多言語機械翻訳のための多視点言語ベクトル空間を利用して、競合する全体的な翻訳精度を実現する。
論文 参考訳(メタデータ) (2020-04-30T16:25:39Z) - On the Language Neutrality of Pre-trained Multilingual Representations [70.93503607755055]
語彙意味論に関して,多言語文脈埋め込みの言語中立性を直接的に検討する。
その結果、文脈埋め込みは言語ニュートラルであり、概して静的な単語型埋め込みよりも情報的であることがわかった。
本稿では,言語識別における最先端の精度に到達し,並列文の単語アライメントのための統計的手法の性能を一致させる方法について述べる。
論文 参考訳(メタデータ) (2020-04-09T19:50:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。