論文の概要: Meta-Learning Preferences for Multilingual LLM Alignment
- arxiv url: http://arxiv.org/abs/2607.13315v2
- Date: Tue, 21 Jul 2026 18:05:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 16:42:31.411671
- Title: Meta-Learning Preferences for Multilingual LLM Alignment
- Title(参考訳): 多言語LLMアライメントのメタラーニング選好
- Abstract要約: 言語間での人間の嗜好データの不平等は、多言語設定で大規模言語モデルを整列させる上での課題である。
本稿では,人間のフィードバックと直接選好最適化による強化学習のためのメタラーニングフレームワークを提案する。
- 参考スコア(独自算出の注目度): 31.4144889231502
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Unequal availability of human preference data across languages poses a significant challenge for aligning large language models in multilingual settings. To address the lack of sufficient data in low-resource language alignment, we propose a meta-learning framework for Reinforcement Learning from Human Feedback and Direct Preference Optimization. By leveraging preference data from other languages, our framework learns a transferable initialization that enables effective adaptation to a target language with minimal data. We provide theoretical guarantees for both the meta-reward modeling and meta-policy optimization settings, and empirically demonstrate the effectiveness of our approach on multilingual benchmarks. In an extremely low-resource setting with only 100 target-language preference samples, our approach achieves up to $28\%$ win-rate improvements over baseline methods, and consistently outperforms baselines across multiple target languages and model scales. Our approaches retain these advantages across different combinations of meta-training languages and varying linguistic distances from the target languages.
- Abstract(参考訳): 言語間での人間の嗜好データの不平等は、多言語設定で大きな言語モデルを整合させる上で大きな課題となる。
低リソース言語アライメントにおける十分なデータ不足を解決するため,人間からの強化学習と直接選好最適化のためのメタラーニングフレームワークを提案する。
フレームワークは,他言語からの好みデータを活用することで,最小限のデータを持つ対象言語への効果的な適応を可能にする転送可能な初期化を学習する。
メタ・リワードモデルとメタ・ポリティクスの最適化設定の両方について理論的保証を提供し、マルチリンガルベンチマークにおけるアプローチの有効性を実証的に実証する。
ターゲット言語選好サンプルが100個しかない非常に低リソースの環境では,ベースライン手法よりも最大2,8 %$のウィンレート改善を実現し,複数のターゲット言語やモデルスケールのベースラインを一貫して上回っている。
メタ学習言語の異なる組み合わせと、対象言語と異なる言語距離にまたがるこれらの利点を維持している。
関連論文リスト
- COMPASS: COntinual Multilingual PEFT with Adaptive Semantic Sampling [0.023074632109535153]
ターゲット言語に大規模言語モデルを適用するための,データ中心のフレームワークを導入する。
我々は、既存のトレーニングデータとターゲット利用分布のセマンティックギャップを特定するために、分布対応サンプリング戦略を用いる。
我々はこれを継続的学習フレームワークに拡張し、本番環境でのデータ分散シフトを監視し、アダプタを動的に更新し、モデルの不安定さを防ぐ。
論文 参考訳(メタデータ) (2026-04-22T16:07:10Z) - LangGPS: Language Separability Guided Data Pre-Selection for Joint Multilingual Instruction Tuning [49.22807995935406]
大規模言語モデル(LLM)の多言語命令追従能力と下流性能を改善するための多言語命令チューニングは広く採用されている手法である。
既存の選択法は、しばしばテキストの品質、多様性、タスク関連性といった特徴に基づいており、典型的には多言語データの固有の言語構造を見落としている。
言語分離性によって導かれる軽量な2段階事前選択フレームワークであるLangGPSを提案する。
論文 参考訳(メタデータ) (2025-11-13T12:02:32Z) - Exploring Polyglot Harmony: On Multilingual Data Allocation for Large Language Models Pretraining [16.590296049892576]
本稿では,多言語データアロケーションを体系的に最適化する新しいフレームワークであるClimbを紹介する。
Climbの中核となるのは、言語間の相互作用を意識した言語比率を導入し、言語間の依存関係をキャプチャすることで、各言語の効果的なアロケーションを明示的に定量化している。
大規模な実験により、Climbは様々な多言語間相互作用を正確に測定できることを確認した。
論文 参考訳(メタデータ) (2025-09-19T03:34:34Z) - CM-Align: Consistency-based Multilingual Alignment for Large Language Models [84.19366314925593]
高品質な多言語嗜好データを構築するための一貫性に基づくデータ手法を提案する。
具体的には、一貫性のある英語参照選択と、言語間一貫性に基づく多言語嗜好データ構築の2つの部分を含む。
論文 参考訳(メタデータ) (2025-09-10T12:40:49Z) - Enhancing Multilingual LLM Pretraining with Model-Based Data Selection [33.68104398807581]
本稿では,多言語データセットを対象としたモデルベースフィルタリングフレームワークを提案する。
当社のアプローチは透明性、単純さ、効率性を重視しています。
フレームワークを20言語に拡張し、洗練された事前トレーニングデータセットをリリースします。
論文 参考訳(メタデータ) (2025-02-14T18:42:07Z) - MetaAlign: Align Large Language Models with Diverse Preferences during Inference Time [50.41806216615488]
大規模言語モデル(LLM)は、広範なテキストコーパスから広範な知識と顕著な能力を取得する。
LLMをより使いやすくするためには、それらを人間の好みに合わせることが不可欠である。
提案手法は,LLMが推論時に指定される様々な明示的あるいは暗黙的な選好と動的に整合するのを支援することを目的としている。
論文 参考訳(メタデータ) (2024-10-18T05:31:13Z) - Soft Language Clustering for Multilingual Model Pre-training [57.18058739931463]
本稿では,インスタンスを条件付きで符号化するためのフレキシブルガイダンスとして,コンテキスト的にプロンプトを検索するXLM-Pを提案する。
我々のXLM-Pは、(1)言語間における言語不変および言語固有知識の軽量なモデリングを可能にし、(2)他の多言語事前学習手法との容易な統合を可能にする。
論文 参考訳(メタデータ) (2023-06-13T08:08:08Z) - Distributionally Robust Multilingual Machine Translation [94.51866646879337]
本稿では,分散的ロバストな最適化に基づくMNMT(Multilingual Neural Machine Translation)の新しい学習目標を提案する。
この目的を,反復的最適応答方式を用いて,大規模翻訳コーパスに対して実用的に最適化する方法を示す。
本手法は,多対一の翻訳設定と多対多の翻訳設定の両方において,平均と言語毎のパフォーマンスにおいて,強いベースライン法より一貫して優れる。
論文 参考訳(メタデータ) (2021-09-09T03:48:35Z) - Multilingual and cross-lingual document classification: A meta-learning
approach [24.66829920826166]
本稿では,文書分類におけるメタラーニング手法を提案する。
提案手法の有効性は2つの設定で示される:少数ショット,未確認言語への言語間適応,多言語共同訓練である。
論文 参考訳(メタデータ) (2021-01-27T10:22:56Z) - Gradient Vaccine: Investigating and Improving Multi-task Optimization in
Massively Multilingual Models [63.92643612630657]
本稿では、損失関数幾何学のレンズを通して多言語最適化のブラックボックスを覗き込もうとする。
最適化軌道に沿って測定された勾配類似性は重要な信号であり、言語近接とよく相関している。
そこで我々はGradient Vaccineというシンプルでスケーラブルな最適化手法を考案した。
論文 参考訳(メタデータ) (2020-10-12T17:26:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。