論文の概要: A Systematic Evaluation of Cross-Lingual Consistency Enhancement Methods in Multilingual Language Models
- arxiv url: http://arxiv.org/abs/2609.04409v1
- Date: Thu, 03 Sep 2026 19:18:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.802483
- Title: A Systematic Evaluation of Cross-Lingual Consistency Enhancement Methods in Multilingual Language Models
- Title(参考訳): 多言語言語モデルにおける言語間整合性向上手法の体系的評価
- Abstract要約: 本稿では,質問応答,推論時間介入,学習後アプローチにおける代表的CLC強調手法の統一評価について述べる。
その結果, 後学習法は一般に信頼性が高く, 直接分布アライメントはモデル・データセットの組み合わせ間で連続的にCLCを改善していることがわかった。
CLCの強化がモデルに異なる応答能力を与えるかどうかを考察する。
- 参考スコア(独自算出の注目度): 50.27606276000142
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multilingual language models often produce inconsistent answers to semantically equivalent questions across languages, motivating methods to improve cross-lingual consistency (CLC). However, existing methods are typically evaluated using different models, tasks, and protocols, leaving their relative strengths unclear. In this work, we present a unified evaluation of representative CLC-enhancement methods for question answering, spanning inference-time interventions and post-training approaches across three model families and three closed-form benchmarks. The results show that post-training methods are generally more reliable, with direct distribution alignment consistently improving CLC across all model-dataset combinations, while other methods are more sensitive to answer format and the breadth of language coverage. Notably, cross-domain transfer is limited unless source and target tasks share similar output formats. We further investigate whether CLC enhancement hurts models' ability to respond differently *when needed*, that is, when asked culture-dependent questions. Across two benchmarks of culturally diverse question answering, we find no systematic degradation in controlled closed-form evaluation, whereas open-ended generation reveals occasional accuracy reductions, particularly for non-English responses. Our work highlights the need to evaluate CLC enhancement for both cross-domain robustness and culturally appropriate variation, informing future work in post-training and benchmark development.
- Abstract(参考訳): 多言語モデルはしばしば、言語間で意味論的に等価な質問に対する矛盾した回答を生成し、言語間整合性(CLC)を改善する方法の動機付けを行う。
しかし、既存の手法は一般的に異なるモデル、タスク、プロトコルを用いて評価され、それらの相対的な強みははっきりしない。
本研究では,3つのモデルファミリと3つのクローズドフォームベンチマークに対して,質問応答,推論時間介入,トレーニング後のアプローチを統一的に評価する。
その結果, 学習後手法は一般に信頼性が高く, 直接分布アライメントはモデル・データセットの組み合わせのCLCを一貫して改善する一方, 他の手法は応答形式や言語カバレッジの幅に敏感であることがわかった。
特に、ソースとターゲットタスクが同様の出力フォーマットを共有しない限り、クロスドメイン転送は制限される。
さらに、CLCの強化がモデルが異なる反応をする能力、すなわち文化に依存した質問に影響を及ぼすかどうかについても検討する。
文化的に多様な質問応答の2つのベンチマークでは、制御されたクローズドフォームの評価において体系的な劣化は見られず、一方、オープンエンド生成では、特に非英語応答において、時折精度が低下する。
我々の研究は、クロスドメインロバスト性と文化的に適切なバリエーションの両方に対するLCCの強化を評価することの必要性を強調し、ポストトレーニングとベンチマーク開発における今後の成果を知らせるものである。
関連論文リスト
- Inference-Time Steering for Cross-Lingual Factual Consistency in LLMs [51.56484100374058]
大規模言語モデル(LLM)は目覚ましい多言語流布を示すが、その内部知識表現はハイリソース言語に対して不均等に偏っている。
我々は,これらのバイアスを推論時に緩和できるかどうかを考察し,対象言語でクエリされたかのように,英語の確率モデルに答えるように強制する。
Gemma 3 12Bの実験では、最も強い全体的な介入、効率性のバランス、安全性、ドメイン外の一般化を促すペルソナが明らかにされている。
論文 参考訳(メタデータ) (2026-07-21T16:15:05Z) - Optimizing Language Models for Crosslingual Knowledge Consistency [90.86445137816942]
大規模な言語モデルは、しばしば一貫性のない知識を示すことが知られている。
これは、モデルが異なる言語で同様の質問をすることが多い、多言語シナリオにおいて特に問題となる。
本研究では,この問題を構造化報酬関数を用いた強化学習を用いて緩和することができることを示す。
論文 参考訳(メタデータ) (2026-03-04T23:36:55Z) - CM-Align: Consistency-based Multilingual Alignment for Large Language Models [84.19366314925593]
高品質な多言語嗜好データを構築するための一貫性に基づくデータ手法を提案する。
具体的には、一貫性のある英語参照選択と、言語間一貫性に基づく多言語嗜好データ構築の2つの部分を含む。
論文 参考訳(メタデータ) (2025-09-10T12:40:49Z) - Cross-Lingual Pitfalls: Automatic Probing Cross-Lingual Weakness of Multilingual Large Language Models [55.14276067678253]
本稿では,Large Language Models (LLMs) における言語間関係の弱点を効率的に同定するための新しい手法を提案する。
この手法を用いて16言語で6,000以上のバイリンガルペアからなる新しいデータセットを構築し、最先端のモデルにおいても弱点を明らかにする効果を実証した。
さらに,言語的類似性と言語間の弱点との関係について検討し,言語的関連言語が類似した演奏パターンを共有することを明らかにした。
論文 参考訳(メタデータ) (2025-05-24T12:31:27Z) - CALM: Unleashing the Cross-Lingual Self-Aligning Ability of Language Model Question Answering [42.92810049636768]
大規模言語モデル(LLM)は、言語固有の文化的知識と一般知識の両方を取得するために、多言語コーパスで事前訓練されている。
言語モデル(CALM)の言語間知識の整合性について検討する。
我々は、異なる言語間でモデルの知識を整合させるために、直接選好最適化(DPO)を用いる。
論文 参考訳(メタデータ) (2025-01-30T16:15:38Z) - Align, Generate, Learn: A Novel Closed-Loop Framework for Cross-Lingual In-Context Learning [0.0]
言語間インコンテキスト学習(XICL)は、多言語タスクに対処するために大規模言語モデル(LLM)を活用するための変換パラダイムとして登場した。
タスク関連事例を内部的に選択・活用するために, LLMの生成能力を活用する, 自己管理型フレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-12T05:36:51Z) - ConVerSum: A Contrastive Learning-based Approach for Data-Scarce Solution of Cross-Lingual Summarization Beyond Direct Equivalents [4.029675201787349]
言語間の要約は自然言語処理の洗練された分野である。
高品質なCLSデータがない場合、CLSには実現可能な解決策がない。
コントラスト学習のパワーを活かしたCLSのための新しいデータ効率のアプローチであるConVerSumを提案する。
論文 参考訳(メタデータ) (2024-08-17T19:03:53Z) - Evaluating Knowledge-based Cross-lingual Inconsistency in Large Language Models [16.942897938964638]
大規模言語モデル(LLM)は、様々な自然言語処理(NLP)タスクにおいて例外的な性能を示している。
彼らの成功にもかかわらず、これらのモデルはしばしば異なる言語で同じ概念を処理する際に大きな矛盾を示す。
本研究は,LLMにおける言語間不整合の存在,これらの不整合が現れる特定の側面,LLMの言語間整合性と多言語機能との相関の3つの主要な疑問に焦点をあてる。
論文 参考訳(メタデータ) (2024-07-01T15:11:37Z) - Improving the Consistency in Cross-Lingual Cross-Modal Retrieval with 1-to-K Contrastive Learning [23.54908503106691]
CCR(Cross-lingual Cross-modal Retrieval)は,Web検索において重要なタスクである。
本稿では,各言語を等しく扱う1対Kのコントラスト学習手法を提案する。
提案手法は,より小規模な事前学習データを用いて,リコール率と平均ランク変動(MRV)の両方を改善する。
論文 参考訳(メタデータ) (2024-06-26T11:04:25Z) - The Power of Question Translation Training in Multilingual Reasoning: Broadened Scope and Deepened Insights [108.40766216456413]
大規模言語モデルの英語と非英語のパフォーマンスのギャップを埋めるための質問アライメントフレームワークを提案する。
実験結果から、さまざまな推論シナリオ、モデルファミリー、サイズにわたって、多言語のパフォーマンスを向上できることが示された。
我々は、表現空間、生成された応答とデータスケールを分析し、質問翻訳訓練がLLM内の言語アライメントをどのように強化するかを明らかにする。
論文 参考訳(メタデータ) (2024-05-02T14:49:50Z) - Cross-lingual QA: A Key to Unlocking In-context Cross-lingual Performance [2.371686365695081]
クロスランガルQAは、質問と回答の部分のみを翻訳し、翻訳コストを削減できる言語間プロンプト手法である。
4つのタイプ的多言語ベンチマークの実験により、クロスランガルQAはモデルに効果的に刺激を与え、クロスランガルの知識を引き出すことを示した。
本研究は,言語間実例を用いたオープンソースMLLMの高速化により,モデルスケールの増大に伴い,性能が向上することを示す。
論文 参考訳(メタデータ) (2023-05-24T15:14:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。