論文の概要: Apples to Apples? Towards Comparable Crosslingual Language Model Evaluation
- arxiv url: http://arxiv.org/abs/2608.25089v2
- Date: Sun, 30 Aug 2026 15:53:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 15:47:04.08867
- Title: Apples to Apples? Towards Comparable Crosslingual Language Model Evaluation
- Title(参考訳): AppleからAppleへ? 比較可能な言語モデル評価を目指して
- Abstract要約: 並列データに基づいて訓練された制御単言語言語モデルを用いて言語間評価手法を検討する。
この結果から, トークン化, エンコーディング, 正書法の違いに根ざした多言語的バイアスが広く用いられている。
対照的に、意味論的に等価なシーケンスで計算された文レベルの負の対数類似性は、より有意義で一貫した言語間比較を提供する。
- 参考スコア(独自算出の注目度): 4.651750987298774
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Crosslingual evaluation of language models that enables fair comparisons remains a fundamental challenge in multilingual NLP. Existing studies adopt a variety of downstream tasks and intrinsic metrics with different theoretical justifications, yet there has been little empirical investigation into whether these approaches yield meaningful crosslingual conclusions. We systematically examine crosslingual evaluation approaches using controlled monolingual language models trained on parallel data with varying tokenizer vocabulary sizes and model sizes, and further validate our findings on multilingual LLMs. We further discuss challenges in achieving comparable downstream evaluation across languages. Our results show that several widely used normalized metrics introduce crosslinguistic biases rooted in tokenization, encoding, and orthographic differences. In contrast, sentence-level negative log-likelihood computed over semantically equivalent sequences provides more meaningful and consistent crosslingual comparisons.
- Abstract(参考訳): 公平な比較が可能な言語モデルの言語横断的評価は、多言語NLPにおける根本的な課題である。
既存の研究では、異なる理論的正当化を伴う様々な下流のタスクと固有のメトリクスが採用されているが、これらのアプローチが有意義な言語横断的な結論をもたらすかどうかについての実証的な研究はほとんど行われていない。
異なるトークン化語彙とモデルサイズを持つ並列データに基づいて訓練された一言語言語モデルを用いて言語間評価手法を体系的に検討し,さらに多言語LLMに関する知見を検証した。
さらに、言語間で比較可能なダウンストリーム評価を実現する上での課題についても論じる。
この結果から, トークン化, エンコーディング, 正書法の違いに根ざした多言語的バイアスが広く用いられている。
対照的に、意味論的に等価なシーケンスで計算された文レベルの負の対数類似性は、より有意義で一貫した言語間比較を提供する。
関連論文リスト
- Benchmarking Concept-Spilling Across Languages in LLMs [7.577675422356702]
大規模言語モデル(LLM)は言語間の優れた能力を示すが、他の言語からの表現に対する体系的なバイアスを示すことが多い。
本稿では,言語間の多文語をモデルがどう扱うかを測定することで,多言語意味的ロバスト性を評価するための新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-18T19:28:26Z) - Are Knowledge and Reference in Multilingual Language Models Cross-Lingually Consistent? [29.155049176669916]
言語間の一貫性は、言語間の伝達性を評価するために考慮すべきである。
コードスイッチングトレーニングと言語間単語アライメントの目的は、最も有望な結果を示す。
論文 参考訳(メタデータ) (2025-07-17T06:55:15Z) - Cross-Lingual Pitfalls: Automatic Probing Cross-Lingual Weakness of Multilingual Large Language Models [55.14276067678253]
本稿では,Large Language Models (LLMs) における言語間関係の弱点を効率的に同定するための新しい手法を提案する。
この手法を用いて16言語で6,000以上のバイリンガルペアからなる新しいデータセットを構築し、最先端のモデルにおいても弱点を明らかにする効果を実証した。
さらに,言語的類似性と言語間の弱点との関係について検討し,言語的関連言語が類似した演奏パターンを共有することを明らかにした。
論文 参考訳(メタデータ) (2025-05-24T12:31:27Z) - Understanding and Mitigating Language Confusion in LLMs [76.96033035093204]
我々は,既存の英語および多言語プロンプトを用いた15の型的多様言語の評価を行った。
Llama Instruct と Mistral のモデルでは,言語的混乱の度合いが高いことがわかった。
言語混乱は,数発のプロンプト,多言語SFT,選好調整によって部分的に緩和できることがわかった。
論文 参考訳(メタデータ) (2024-06-28T17:03:51Z) - Improving Multi-lingual Alignment Through Soft Contrastive Learning [9.454626745893798]
本稿では,事前学習した単言語埋め込みモデルによって測定された文の類似性に基づいて,多言語埋め込みを整合させる新しい手法を提案する。
翻訳文ペアが与えられた場合、言語間埋め込み間の類似性は、単言語教師モデルで測定された文の類似性に従うように、多言語モデルを訓練する。
論文 参考訳(メタデータ) (2024-05-25T09:46:07Z) - Multilingual Representation Distillation with Contrastive Learning [20.715534360712425]
コントラスト学習を多言語表現蒸留に統合し,並列文の品質評価に利用する。
我々は,多言語類似性探索とコーパスフィルタリングタスクによるアプローチの有効性を検証した。
論文 参考訳(メタデータ) (2022-10-10T22:27:04Z) - Discovering Representation Sprachbund For Multilingual Pre-Training [139.05668687865688]
多言語事前学習モデルから言語表現を生成し、言語分析を行う。
すべての対象言語を複数のグループにクラスタリングし、表現のスプラックバンドとして各グループに名前を付ける。
言語間ベンチマークで実験を行い、強いベースラインと比較して大幅な改善が達成された。
論文 参考訳(メタデータ) (2021-09-01T09:32:06Z) - AM2iCo: Evaluating Word Meaning in Context across Low-ResourceLanguages
with Adversarial Examples [51.048234591165155]
本稿では, AM2iCo, Adversarial and Multilingual Meaning in Contextを提案する。
言語間文脈における単語の意味の同一性を理解するために、最先端(SotA)表現モデルを忠実に評価することを目的としている。
その結果、現在のSotAプリトレーニングエンコーダは人間のパフォーマンスにかなり遅れていることが明らかとなった。
論文 参考訳(メタデータ) (2021-04-17T20:23:45Z) - XL-WiC: A Multilingual Benchmark for Evaluating Semantic
Contextualization [98.61159823343036]
単語の意味を正確にモデル化する能力を評価するために,Word-in-Context データセット (WiC) を提案する。
我々は、XL-WiCという大規模なマルチ言語ベンチマークを提案し、12の新しい言語でゴールドスタンダードを特徴付けました。
実験結果から、ターゲット言語にタグ付けされたインスタンスが存在しない場合でも、英語データのみにトレーニングされたモデルは、競争力のあるパフォーマンスが得られることが示された。
論文 参考訳(メタデータ) (2020-10-13T15:32:00Z) - Detecting Fine-Grained Cross-Lingual Semantic Divergences without
Supervision by Learning to Rank [28.910206570036593]
この研究は、細粒度のセマンティックな違いの予測とアノテーションを改善する。
本稿では,多言語BERTモデルの学習方法として,様々な粒度の合成発散例をランク付けする手法を提案する。
ランク付けの学習は、強い文レベルの類似性モデルよりも正確に、きめ細かい文レベルの発散を検出するのに役立つ。
論文 参考訳(メタデータ) (2020-10-07T21:26:20Z) - XTREME: A Massively Multilingual Multi-task Benchmark for Evaluating
Cross-lingual Generalization [128.37244072182506]
言語間TRansfer Evaluation of Multilinguals XTREMEは、40言語および9タスクにわたる多言語表現の言語間一般化能力を評価するためのベンチマークである。
我々は、英語でテストされたモデルは、多くのタスクにおいて人間のパフォーマンスに達するが、言語間変換されたモデルの性能にはまだ大きなギャップがあることを示した。
論文 参考訳(メタデータ) (2020-03-24T19:09:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。