論文の概要: Language Chain in Alignment: Cross-lingual Ranking Preference Optimization
- arxiv url: http://arxiv.org/abs/2608.23149v2
- Date: Thu, 27 Aug 2026 10:14:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 14:16:51.701524
- Title: Language Chain in Alignment: Cross-lingual Ranking Preference Optimization
- Title(参考訳): アライメントにおける言語チェイン: 言語間ランキングの優先度最適化
- Authors: Seungyoon Lee, Minhyuk Kim, Jungseob Lee, Heuiseok Lim,
- Abstract要約: 対象言語における嗜好アライメントを促進するために,英語からの堅牢な嗜好知識を活用する新しいフレームワークを提案する。
我々は、言語内および言語間選好を協調的に最適化するために、対象言語と英語をまたいだ並列選好ペア内の階層構造を設計する。
リソーススケールの異なる5言語を対象とした実験により、CRPOは命令追従と知識利用の両面で標準的アプローチを一貫して上回っていることが示された。
- 参考スコア(独自算出の注目度): 23.860944668713696
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The alignment of Large Language Models heavily relies on English-centric high-quality preference data, which often leads to suboptimal performance in other languages. In this paper, we propose Cross-lingual Ranking Preference Optimization~(CRPO), a novel framework that leverages robust preference knowledge from English to facilitate preference alignment in the target language. We design a hierarchical structure within parallel preference pairs across the target language and English to jointly optimize intra- and inter-lingual preferences, thereby enhancing language adaptation and output quality. Building on the LambdaLoss framework, CRPO goes beyond the binary comparison based optimization by providing a relative ranking signal across multiple candidate responses. Our experiments across five languages with varying resource scales demonstrate that CRPO consistently outperforms standard approaches in both instruction-following and knowledge utilization capability. Notably, the robust performance gains observed across various weighting schemes further validate the empirical effectiveness of our hierarchical design in a multilingual setup. Furthermore, our findings highlight that CRPO significantly improves both reward margins and the log-probability of desirable responses, contributing to a more stable preference manifold for cross-lingual alignment. Our code is available at https://github.com/dltmddbs100/CRPO.
- Abstract(参考訳): 大規模言語モデルのアライメントは、英語中心の高品質な嗜好データに大きく依存する。
本稿では、英語からの堅牢な嗜好知識を活用して、対象言語での選好調整を容易にする新しいフレームワークであるクロスランガルランク付け選好最適化(CRPO)を提案する。
対象言語と英語の並列選好ペア内の階層構造を設計し、言語内および言語間選好を協調的に最適化し、言語適応と出力品質を向上させる。
LambdaLossフレームワーク上に構築されているCRPOは、複数の候補応答にまたがる相対的なランキング信号を提供することで、バイナリ比較ベースの最適化を越えている。
リソーススケールの異なる5言語を対象とした実験により、CRPOは命令追従能力と知識利用能力の両方において、標準的アプローチを一貫して上回っていることが示された。
特に、様々な重み付け方式で観測された頑健な性能向上は、多言語構成における階層設計の実証的有効性をさらに検証する。
さらに,CRPOは報酬マージンと望ましい応答の対数確率の両方を著しく改善し,言語間アライメントのためのより安定した選好多様体に寄与することを示した。
私たちのコードはhttps://github.com/dltmddbs100/CRPOで利用可能です。
関連論文リスト
- Meta-Learning Preferences for Multilingual LLM Alignment [31.4144889231502]
言語間での人間の嗜好データの不平等は、多言語設定で大規模言語モデルを整列させる上での課題である。
本稿では,人間のフィードバックと直接選好最適化による強化学習のためのメタラーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-14T22:38:39Z) - CAPO: Confidence Aware Preference Optimization Learning for Multilingual Preferences [4.460583138505673]
優先順位最適化は、大きな言語モデルと人間の好みを合わせるのに使われ、通常はランク付けされた応答ペアを微調整する。
本稿では,DPO の優先ペアの固定処理を動的損失スケーリング機構に置き換える CAPO (Confidence-Aware Preference Optimization) を提案する。
CAPOは、多言語テキストでよく見られるノイズや低マージンの比較に頑健さを増す。
論文 参考訳(メタデータ) (2025-11-10T23:28:12Z) - CM-Align: Consistency-based Multilingual Alignment for Large Language Models [84.19366314925593]
高品質な多言語嗜好データを構築するための一貫性に基づくデータ手法を提案する。
具体的には、一貫性のある英語参照選択と、言語間一貫性に基づく多言語嗜好データ構築の2つの部分を含む。
論文 参考訳(メタデータ) (2025-09-10T12:40:49Z) - Preference Alignment Improves Language Model-Based TTS [76.70693823683091]
選好アライメントアルゴリズムは、報酬モデルの嗜好に合わせてLMを調整し、生成されたコンテンツの望ましさを高める。
1.15B のパラメータ LM に基づく TTS モデルを用いて、嗜好の整合性は常に知性、話者類似性、代用主観的評価スコアを向上することを示した。
論文 参考訳(メタデータ) (2024-09-19T01:58:19Z) - Unintended Impacts of LLM Alignment on Global Representation [62.6579934112071]
開発者は、RLHF(Reinforcement Learning From Human Feedback)やDPO(Direct Preference Optimization)など、様々な手順で、大規模言語モデル(LLM)をユーザの好みに合わせることができる。
我々は、アライメントが、グローバルな表現の3つの軸、すなわち、英語方言、多言語主義、世界各国の意見にどのように影響するかを探求する。
これらの意図しない影響に繋がる設計決定と、より公平な選好チューニングの推奨を議論することで、私たちは結論付けました。
論文 参考訳(メタデータ) (2024-02-22T23:31:22Z) - MAPO: Advancing Multilingual Reasoning through Multilingual Alignment-as-Preference Optimization [65.31411639849516]
本稿では,他言語の推論過程を支配言語と整合させるために,MAPO(Multilingual-Alignment-as-Preference Optimization)フレームワークを提案する。
具体的には,非支配言語と支配言語における回答の整合性について,既成の翻訳モデルを用いて検討する。
実験により、MAPOは様々なモデルの多言語推論において、安定して大幅な改善を達成できることが示された。
論文 参考訳(メタデータ) (2024-01-12T18:03:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。