論文の概要: CroCo: Cross-Lingual Contrastive Preference Tuning on Self-Generations
- arxiv url: http://arxiv.org/abs/2605.26293v1
- Date: Mon, 25 May 2026 19:30:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-27 17:51:41.387112
- Title: CroCo: Cross-Lingual Contrastive Preference Tuning on Self-Generations
- Title(参考訳): CroCo: 自己生成に基づく言語間のコントラスト推論チューニング
- Abstract要約: 報酬スコアによって設定された大規模言語モデルからの自己生成応答のコントラスト性の制御により、英語のダウンストリーム選好チューニングが改善される。
本手法を複数の言語に拡張し,タスクの多種多様なセットにおいて,14の高低リソース言語を対象とした2つのモデルを評価する。
- 参考スコア(独自算出の注目度): 15.323051310503688
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Prior work establishes that controlled contrastiveness between self-generated responses from large language models, set via reward scores, improves downstream preference tuning in English. We extend this method to multiple languages and evaluate two models across a total of 14 high and low-resource languages on a diverse set of tasks. Our central finding is that cross-lingual contrastive preference tuning on self-generations (CroCo) transfers without language-specific preference annotation. A reward model trained on English preferences (atop a multilingual base) produces useful within-language rankings across most languages, and pairing in either a monolingual or multilingual setting improves over each model on the majority of setups while preventing the catastrophic forgetting of supervised fine-tuning. We observe that the gains require on-policy data. Off-policy responses reduce the benefit and online preference optimization fails to improve over the offline variant. Specifically, on structured tasks, our method matches or exceeds the base in 6/7 languages for EuroLLM-9B and 4/7 settings for Aya-3B. On open-ended generation, both tuned models win against their respective base across 11 evaluated languages. Overall, we show promising directions for multilingual preference tuning.
- Abstract(参考訳): 先行研究は、報酬スコアによって設定された大きな言語モデルからの自己生成応答間のコントラスト性を制御することで、英語における下流の嗜好チューニングを改善することを確立している。
本手法を複数の言語に拡張し,タスクの多種多様なセットにおいて,14の高低リソース言語を対象とした2つのモデルを評価する。
我々の中心的な発見は、言語固有の嗜好アノテーションを使わずに、自己生成(CroCo)転送の言語横断的なコントラスト的嗜好チューニングを行うことである。
英語の選好に基づいて訓練された報酬モデル(多言語ベース)は、多くの言語で有用な言語内ランキングを生成し、単一言語または多言語設定のペアリングは、ほとんどの設定において各モデルよりも改善され、教師付き微調整の破滅的な忘れ込みを防ぐ。
我々は、利益が政治上のデータを必要とすることを観察する。
オフラインのレスポンスは利点を減らし、オンラインの好みの最適化はオフラインのバリエーションよりも改善されない。
具体的には、構造化タスクにおいて、EuroLLM-9Bの6/7言語とAya-3Bの4/7設定の6/7言語において、本手法はベースと一致または上回っている。
オープンエンド世代では、両方のチューニングされたモデルが、評価された11の言語でそれぞれのベースに対して勝利する。
全体として、多言語嗜好調整のための有望な方向を示す。
関連論文リスト
- Language Chain in Alignment: Cross-lingual Ranking Preference Optimization [23.860944668713696]
対象言語における嗜好アライメントを促進するために,英語からの堅牢な嗜好知識を活用する新しいフレームワークを提案する。
我々は、言語内および言語間選好を協調的に最適化するために、対象言語と英語をまたいだ並列選好ペア内の階層構造を設計する。
リソーススケールの異なる5言語を対象とした実験により、CRPOは命令追従と知識利用の両面で標準的アプローチを一貫して上回っていることが示された。
論文 参考訳(メタデータ) (2026-08-24T11:54:36Z) - CM-Align: Consistency-based Multilingual Alignment for Large Language Models [84.19366314925593]
高品質な多言語嗜好データを構築するための一貫性に基づくデータ手法を提案する。
具体的には、一貫性のある英語参照選択と、言語間一貫性に基づく多言語嗜好データ構築の2つの部分を含む。
論文 参考訳(メタデータ) (2025-09-10T12:40:49Z) - Seed-X: Building Strong Multilingual Translation LLM with 7B Parameters [53.59868121093848]
7Bパラメータサイズを持つオープンソースの言語モデル(LLM)のファミリーであるSeed-Xを紹介する。
ベースモデルは、28言語にわたるモノリンガルコンテンツとバイリンガルコンテンツの両方を含む、多種多様な高品質データセットで事前訓練されている。
その後、インストラクションモデルは、Chain-of-Thought(CoT)推論によって翻訳され、強化学習(RL)によりさらに強化され、多様な言語対をまたいだより良い一般化が達成される。
論文 参考訳(メタデータ) (2025-07-18T03:19:43Z) - Implicit Cross-Lingual Rewarding for Efficient Multilingual Preference Alignment [35.1576728251478]
提案手法は,暗黙の報奨によって適切に整合した英語モデルからの好みを捉え,反復学習を通じて他言語に伝達する手法である。
2回に分けて微調整したLlama3はウィンレートを平均12.72%改善し、X-AlpacaEvalのリーダーボード上でのトレーニング言語全体の長さ制御ウィンレートを5.97%向上させた。
論文 参考訳(メタデータ) (2025-03-06T17:33:01Z) - AdaMCoT: Rethinking Cross-Lingual Factual Reasoning through Adaptive Multilingual Chain-of-Thought [40.16140566668239]
AdaMCOTは多言語の事実推論を強化するフレームワークである。
AdaMCOTは、ターゲット言語応答を生成する前に、中間言語における思考プロセスを動的にルーティングする。
本評価は, 事実推論品質と言語間整合性の両方において, 大幅な改善を示すものである。
論文 参考訳(メタデータ) (2025-01-27T15:48:57Z) - MAPO: Advancing Multilingual Reasoning through Multilingual Alignment-as-Preference Optimization [65.31411639849516]
本稿では,他言語の推論過程を支配言語と整合させるために,MAPO(Multilingual-Alignment-as-Preference Optimization)フレームワークを提案する。
具体的には,非支配言語と支配言語における回答の整合性について,既成の翻訳モデルを用いて検討する。
実験により、MAPOは様々なモデルの多言語推論において、安定して大幅な改善を達成できることが示された。
論文 参考訳(メタデータ) (2024-01-12T18:03:54Z) - Turning English-centric LLMs Into Polyglots: How Much Multilinguality Is Needed? [40.13166574854085]
英語中心の大規模言語モデルにおいて,多言語間の一般化を実現するために必要な最小限の多言語性について検討する。
複数言語から3言語までの多言語命令チューニングは,効果的な言語間一般化を実現するのに必要かつ十分であることがわかった。
論文 参考訳(メタデータ) (2023-12-20T00:49:52Z) - Prompt-Tuning Can Be Much Better Than Fine-Tuning on Cross-lingual
Understanding With Multilingual Language Models [95.32691891392903]
本稿では,プロンプトチューニングを用いた様々なNLUタスクの言語間評価を行い,それを微調整と比較する。
その結果, アクシデントチューニングは, データセット間の微調整よりもはるかに優れた言語間移動を実現することがわかった。
論文 参考訳(メタデータ) (2022-10-22T05:48:02Z) - Language-Family Adapters for Low-Resource Multilingual Neural Machine
Translation [129.99918589405675]
自己超越で訓練された大規模多言語モデルは、幅広い自然言語処理タスクにおいて最先端の結果を達成する。
マルチリンガルな微調整は低リソース言語のパフォーマンスを向上させるが、モデル全体を変更する必要があるため、極めて高価である。
言語間移動を容易にするため,mBART-50上で言語ファミリーアダプタを訓練する。
論文 参考訳(メタデータ) (2022-09-30T05:02:42Z) - XCOPA: A Multilingual Dataset for Causal Commonsense Reasoning [68.57658225995966]
XCOPA (Cross-lingual Choice of Plausible Alternatives) は11言語における因果コモンセンス推論のための多言語データセットである。
提案手法は,翻訳に基づく転送と比較して,現在の手法の性能が低下していることを明らかにする。
論文 参考訳(メタデータ) (2020-05-01T12:22:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。