論文の概要: LLMs Get Smarter from Targeted Synthetic Multilingual Data
- arxiv url: http://arxiv.org/abs/2608.15964v1
- Date: Sun, 16 Aug 2026 23:38:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.48197
- Title: LLMs Get Smarter from Targeted Synthetic Multilingual Data
- Title(参考訳): LLMは、ターゲットとする合成多言語データからより賢くなる
- Abstract要約: 言語固有の能力(Language-specific competency、LSC)は、プロンプトの言語によって、より良く、より悪く機能する言語モデルの現象である。
HotFIXRは多言語合成トレーニングデータを生成することができ、多言語のパフォーマンスを向上させることができる。
- 参考スコア(独自算出の注目度): 14.98964079460135
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Language-specific competency (LSC) is the phenomenon of a language model performing better or worse depending on the language of the prompt. In other words, a language model outputs different (and potentially incorrect) responses to the same semantic query when prompted in different languages. Prior work attributes this to an internal misalignment of semantic representation across languages. Currently, there are two main approaches to address LSC in the literature: (1) routing all queries through English, improving performance, but limiting language expressivity to English; or (2) training on language-balanced data, equalizing model performance across languages, but reducing overall performance. In this work, we take a data centric perspective and introduce HOTFIXR: Hardness Optimized Training data For Improving X-Lingual Reasoning. It is a data generation framework that uses models to probe and learn a student model's multilingual weaknesses, and generates data to mitigate them. HOTFIXR can generate multilingual synthetic training data that can improve multilingual performance. We evaluate on three in-distribution tasks, three out-of-distribution tasks, and four out-of-distribution languages. On average, HOTFIXR (1) improves in-distribution performance by 6.2%, (2) reduces catastrophic forgetting (induced by fine-tuning) on OOD tasks by 3.7%, and (3) on OOD languages by 7.1%. Overall, as many real-world applications requires multilingual LLMs, our work contributes to the efforts of making LLMs multilingually proficient. We will release code upon acceptance.
- Abstract(参考訳): 言語固有の能力(Language-specific competency、LSC)は、プロンプトの言語によって、より良く、より悪く機能する言語モデルの現象である。
言い換えれば、言語モデルは異なる言語でトリガーされたとき、同じセマンティッククエリに対して異なる(そして潜在的に間違った)応答を出力する。
以前の作業では、言語間のセマンティック表現の内部的なミスアライメントによるものだった。
現在、LSCに対処する主なアプローチは、(1)全てのクエリを英語でルーティングし、性能を改善し、言語表現性を英語に制限する、(2)言語バランスのデータによるトレーニング、言語間でのモデルパフォーマンスの平等化、そして全体的なパフォーマンスの低下である。
本稿では、データ中心の観点からHOTFIXR: Hardness Optimized Training data for Improving X-Lingual Reasoningを紹介する。
それは、モデルを使用して、学生モデルの多言語的弱点を探索し、学習し、それらを緩和するためにデータを生成するデータ生成フレームワークである。
HOTFIXRは多言語合成学習データを生成することができ、多言語性能を向上させることができる。
我々は,3つの分配タスク,3つの分配タスク,および4つの分配言語について評価した。
HOTFIXR (1) は平均して, 分配性能を6.2%向上し, (2) OODタスクにおける破滅的忘れ(微調整による)を3.7%減少させ, (3) OOD言語における忘れ(微調整)を7.1%低減させる。
全体として、多くの実世界のアプリケーションが多言語LLMを必要としているため、我々の研究は多言語LLMを多言語で熟練させる努力に寄与している。
私たちは受け入れに応じてコードを公開します。
関連論文リスト
- Assessing the Role of Data Quality in Training Bilingual Language Models [17.603371705571107]
データ量だけでなく不平等なデータ品質も、バイリンガル設定のパフォーマンス劣化の主要な要因であることを示す。
本稿では,高品質な英語データのみを用いて,高品質なバイリンガル学習データを選択するための簡易かつ効果的なデータフィルタリング手法を提案する。
論文 参考訳(メタデータ) (2025-06-15T21:08:51Z) - Enhancing Code Generation for Low-Resource Languages: No Silver Bullet [55.39571645315926]
大規模言語モデル(LLM)は、プログラミング言語の構文、意味論、使用パターンを学ぶために、大規模で多様なデータセットに依存している。
低リソース言語では、そのようなデータの限られた可用性は、モデルを効果的に一般化する能力を損なう。
本稿では,低リソース言語におけるLLMの性能向上のためのいくつかの手法の有効性を実証研究する。
論文 参考訳(メタデータ) (2025-01-31T12:23:28Z) - Multi-IF: Benchmarking LLMs on Multi-Turn and Multilingual Instructions Following [51.18383180774354]
Multi-IFは,大規模言語モデルの習熟度を多元的および多言語的指示に従って評価するための新しいベンチマークである。
Multi-IF 上での14の最先端 LLM の評価結果から,既存のベンチマークよりもはるかに難しい課題であることが判明した。
非ラテン文字(ヒンディー語、ロシア語、中国語)を持つ言語は一般的に高いエラー率を示し、モデルの多言語能力の潜在的な制限を示唆している。
論文 参考訳(メタデータ) (2024-10-21T00:59:47Z) - Crosslingual Capabilities and Knowledge Barriers in Multilingual Large Language Models [62.91524967852552]
大規模言語モデル(LLM)は、多言語コーパスの事前訓練のため、一般的に多言語である。
しかし、これらのモデルは言語間の対応する概念、すなわち言語を横断的に関連付けることができるだろうか?
本研究は,言語横断的タスクにおける最先端LLMの評価である。
論文 参考訳(メタデータ) (2024-06-23T15:15:17Z) - Mitigating Language-Level Performance Disparity in mPLMs via Teacher Language Selection and Cross-lingual Self-Distillation [25.850573463743352]
大規模多言語事前訓練言語モデル(mPLMs)は、言語横断タスクにおいて優れた性能を発揮する。
しかし、mPLM内では異なる言語にまたがって大きな性能格差が存在する。
我々は ALSACE を導入し,優れた言語から学んだ知識を活用して,mPLM の低性能言語を誘導する。
論文 参考訳(メタデータ) (2024-04-12T14:19:16Z) - Soft Language Clustering for Multilingual Model Pre-training [57.18058739931463]
本稿では,インスタンスを条件付きで符号化するためのフレキシブルガイダンスとして,コンテキスト的にプロンプトを検索するXLM-Pを提案する。
我々のXLM-Pは、(1)言語間における言語不変および言語固有知識の軽量なモデリングを可能にし、(2)他の多言語事前学習手法との容易な統合を可能にする。
論文 参考訳(メタデータ) (2023-06-13T08:08:08Z) - Not All Languages Are Created Equal in LLMs: Improving Multilingual
Capability by Cross-Lingual-Thought Prompting [123.16452714740106]
大規模言語モデル(LLM)は印象的な多言語機能を示すが、その性能は言語によって大きく異なる。
XLT (cross-lingual- Thought prompting) という,シンプルで効果的な方法を提案する。
XLTは汎用テンプレートプロンプトで、言語間および論理的推論スキルを刺激し、言語間のタスクパフォーマンスを向上させる。
論文 参考訳(メタデータ) (2023-05-11T17:44:17Z) - Efficiently Aligned Cross-Lingual Transfer Learning for Conversational
Tasks using Prompt-Tuning [98.60739735409243]
英語のような高リソース言語で訓練された言語モデルの言語間移動は、多くのNLPタスクのために広く研究されている。
並列および大規模多言語会話データセットである言語間アライメント事前学習のためのXSGDを導入する。
協調的な言語間表現を容易にするために,アライメントプロンプトを学習するための効率的なプロンプトチューニング手法を開発した。
論文 参考訳(メタデータ) (2023-04-03T18:46:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。