論文の概要: Soft Token Alignment for Cross-Lingual Reasoning
- arxiv url: http://arxiv.org/abs/2606.26466v1
- Date: Thu, 25 Jun 2026 00:01:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.116217
- Title: Soft Token Alignment for Cross-Lingual Reasoning
- Title(参考訳): 言語間共振のためのソフトトークンアライメント
- Authors: Jiayi He, Jungsoo Park, Wei Xu, Alan Ritter,
- Abstract要約: SOLARは教師付き微調整のための補助的目的であり、言語間でソフトトケン表現を整列させる。
次に、共有埋め込み空間において、各非英語のソフトトーケン要約を英語のそれと一致させる。
SOLARの精度はベースモデルで+17.7ポイント、標準教師付き微調整で+3.8ポイント向上している。
- 参考スコア(独自算出の注目度): 31.882767320907572
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multilingual large language models often produce inconsistent reasoning and answers for semantically equivalent prompts in different languages. Prior work suggests that intermediate representations can be relatively language-agnostic, but generation becomes increasingly language-specific as models commit to discrete output tokens. This is problematic because language-specific lexical choices can cause semantically equivalent reasoning paths to diverge across languages. These divergences motivate searching for a cross-lingual alignment signal that is less tied to any single vocabulary item or script. We propose SOLAR, an auxiliary objective for supervised fine-tuning that aligns soft-token representations across languages, using English as a pivot. Soft tokens are probability-weighted mixtures over the vocabulary embeddings, yielding continuous representations that can aggregate information from semantically related tokens across languages. We then align each non-English soft-token summary to its English counterpart in the shared embedding space. Across four multilingual reasoning benchmarks, SOLAR improves accuracy by up to +17.7 points over the base model and +3.8 over standard supervised fine-tuning, with the largest gains on low-resource languages. SOLAR also strengthens final-layer cross-lingual similarity and substantially reduces language-cluster separability, suggesting that aligning soft-token representations helps preserve shared semantic structure during multilingual reasoning.
- Abstract(参考訳): 多言語大言語モデルは、しばしば異なる言語で意味論的に等価なプロンプトに対する矛盾した推論と答えを生成する。
以前の研究は、中間表現は比較的言語に依存しないが、モデルが離散的な出力トークンにコミットするにつれて、生成は言語固有のものになりつつあることを示唆していた。
言語固有の語彙選択が意味論的に等価な推論経路を言語に分散させる可能性があるため、これは問題となる。
これらの発散は、単一の語彙項目やスクリプトに結び付けられていない言語間アライメント信号を探す動機付けとなる。
SOLARは、英語をピボットとして用い、言語間でソフトトケン表現を整列させる教師付き微調整の補助的目的である。
ソフトトークンは語彙埋め込み上の確率重み付き混合であり、言語間で意味論的に関連付けられたトークンから情報を集約する連続表現をもたらす。
次に、共有埋め込み空間において、各非英語のソフトトーケン要約を英語のそれと一致させる。
4つの多言語推論ベンチマークで、SOLARはベースモデルで最大+17.7ポイント、標準教師付き微調整で+3.8ポイントの精度を向上し、低リソース言語で最大の利益を上げている。
SOLARはまた、最終層間の言語間類似性を強化し、言語クラスタの分離可能性を大幅に低減し、ソフトトーケン表現の整合が多言語推論における共有意味構造の維持に役立つことを示唆している。
関連論文リスト
- Parallel Tokenizers: Rethinking Vocabulary Design for Cross-Lingual Transfer [13.630754537249707]
トークン化は多言語言語モデルの基盤を定義する。
新しいフレームワークは、単言語でトークンを訓練し、バイリンガル辞書や単語間翻訳を用いて語彙を徹底的に調整する。
論文 参考訳(メタデータ) (2025-10-07T17:05:49Z) - False Friends Are Not Foes: Investigating Vocabulary Overlap in Multilingual Language Models [53.01170039144264]
多言語コーパスで訓練されたサブワードトークンライザは、言語間で重複するトークンを自然に生成する。
トークンの重複は言語間転送を促進するのか、それとも言語間の干渉を導入するのか?
相反する語彙を持つモデルでは、重なり合う結果が得られます。
論文 参考訳(メタデータ) (2025-09-23T07:47:54Z) - Beyond Literal Token Overlap: Token Alignability for Multilinguality [53.680462160878925]
我々は,多言語トークン化の効果と品質を理解する新しい方法として,サブワードトークン整合性を提案する。
特に、この指標は、スクリプトが異なっており、リテラルトークンの重複が低い場合、多言語性を予測する。
言語間移動のための最適な言語ペアを特定するために,我々のサブワードトークン整合性指標を推奨する。
論文 参考訳(メタデータ) (2025-02-10T13:50:12Z) - Tokenization Impacts Multilingual Language Modeling: Assessing
Vocabulary Allocation and Overlap Across Languages [3.716965622352967]
サブワードトークン化器で観測される語彙表現と語彙重複の質を評価するための新しい基準を提案する。
以上の結果から,言語間の語彙の重複は,特定の下流課題に支障を来す可能性があることが示唆された。
論文 参考訳(メタデータ) (2023-05-26T18:06:49Z) - Discovering Representation Sprachbund For Multilingual Pre-Training [139.05668687865688]
多言語事前学習モデルから言語表現を生成し、言語分析を行う。
すべての対象言語を複数のグループにクラスタリングし、表現のスプラックバンドとして各グループに名前を付ける。
言語間ベンチマークで実験を行い、強いベースラインと比較して大幅な改善が達成された。
論文 参考訳(メタデータ) (2021-09-01T09:32:06Z) - VECO: Variable and Flexible Cross-lingual Pre-training for Language
Understanding and Generation [77.82373082024934]
我々はTransformerエンコーダにクロスアテンションモジュールを挿入し、言語間の相互依存を明確に構築する。
独自の言語でコンテキストにのみ条件付けされたマスク付き単語の予測の退化を効果的に回避することができる。
提案した言語間モデルでは,XTREMEベンチマークのさまざまな言語間理解タスクに対して,最先端の新たな結果が提供される。
論文 参考訳(メタデータ) (2020-10-30T03:41:38Z) - On the Language Neutrality of Pre-trained Multilingual Representations [70.93503607755055]
語彙意味論に関して,多言語文脈埋め込みの言語中立性を直接的に検討する。
その結果、文脈埋め込みは言語ニュートラルであり、概して静的な単語型埋め込みよりも情報的であることがわかった。
本稿では,言語識別における最先端の精度に到達し,並列文の単語アライメントのための統計的手法の性能を一致させる方法について述べる。
論文 参考訳(メタデータ) (2020-04-09T19:50:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。