論文の概要: Challenges and Recommendations for LLMs-as-a-Judge in Multilingual Settings and Low-Resource Languages
- arxiv url: http://arxiv.org/abs/2607.02235v1
- Date: Thu, 02 Jul 2026 14:34:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.872051
- Title: Challenges and Recommendations for LLMs-as-a-Judge in Multilingual Settings and Low-Resource Languages
- Title(参考訳): 多言語・低リソース言語におけるLCMの課題と提言
- Abstract要約: LLMは低リソース言語では習熟度が限られており、これらの設定では適切な人間による検証は行われないことが多い。
これらの論文の詳細な分析は、矛盾した評価結果、多言語環境でのLCM判断を過信する傾向、研究ごとの1つの判断モデルに広く依存していることを示している。
- 参考スコア(独自算出の注目度): 11.321889087103465
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-as-a-Judge has become the dominant evaluation paradigm for many natural language generation tasks, due to shortcomings of conventional metrics and high correlations with human judgment, albeit mostly in English. There are now attempts to extend LLM-as-a-Judge to multilingual settings including low-resource languages. However, LLMs have limited proficiency in low-resource languages, and there is often no adequate human validation in these settings. To highlight the scope of the problem and current practices, we explore the use of LLM-as-a-Judge evaluators in ACL Anthology papers focusing on multilingual settings and low-resource languages across a diverse set of tasks. Out of 650 papers mentioning LLM-as-a-judge, only 33 of them focus on low-resource or multilingual settings. Our in-depth analysis of these papers indicates inconsistent evaluation outcomes, a tendency to overtrust LLM judgments in multilingual settings, and the widespread reliance on a single judge model per study. To help the NLP community further, we conclude with recommendations about how to use LLM-as-a-Judge in multilingual and low-resource settings.
- Abstract(参考訳): LLM-as-a-Judgeは多くの自然言語生成タスクにおいて主要な評価パラダイムとなっている。
LLM-as-a-Judgeを低リソース言語を含む多言語設定に拡張する試みがある。
しかし、LLMは低リソース言語では習熟度が限られており、これらの設定では適切な人間による検証は行われないことが多い。
ACLアンソロジーにおけるLLM-as-a-Judge評価器の活用について,多言語設定と低リソース言語に着目し,多様なタスクにまたがって検討した。
LLM-as-a-judgeについて言及している650の論文のうち、低リソースまたは多言語設定に焦点を当てているのは33件のみである。
これらの論文の詳細な分析は、矛盾した評価結果、多言語環境でのLCM判断を過信する傾向、研究ごとの1つの判断モデルに広く依存していることを示している。
NLPコミュニティをさらに支援するために,マルチリンガルおよび低リソース設定におけるLCM-as-a-Judgeの使用方法に関する勧告をまとめて締めくくる。
関連論文リスト
- Large Language Models for Mental Health: A Multilingual Evaluation [17.886031066436292]
各種言語における8つのメンタルヘルスデータセットに基づいて,プロプライエタリでオープンソースのLarge Language Models (LLMs)を評価した。
我々は,従来のNLPベースラインとゼロショット,少数ショット,微調整設定におけるLCM性能を比較した。
LLMの性能に影響を及ぼすために,言語家族やタイポロジーにまたがる翻訳品質を評価した。
論文 参考訳(メタデータ) (2026-02-02T18:34:53Z) - It's All About In-Context Learning! Teaching Extremely Low-Resource Languages to LLMs [16.130133009174124]
極端に低リソースな言語、特に稀なスクリプトで書かれた言語は、大きな言語モデル(LLM)によってほとんどサポートされていない。
本稿では,LLMがテキスト内学習(ICL)によって純粋にそのような言語を習得できるかどうかを,補助的アライメント信号を用いて解析し,パラメータ効率のよい微調整(PEFT)と比較した。
我々は3つの最先端多言語 LLM にまたがる20の非表現言語を評価する。
論文 参考訳(メタデータ) (2025-08-26T14:51:10Z) - PolyMath: Evaluating Mathematical Reasoning in Multilingual Contexts [85.78821098963607]
PolyMathは18の言語と4つの難易度をカバーする多言語数学的推論ベンチマークである。
我々のベンチマークは、包括性、言語多様性、高品質な翻訳の難しさを保証する。
論文 参考訳(メタデータ) (2025-04-25T15:39:04Z) - Exploring the Multilingual NLG Evaluation Abilities of LLM-Based Evaluators [38.681443695708786]
本研究は,近年の10個のLLMの多言語評価性能を包括的に分析する。
参照応答をプロンプトから除外すると、様々な言語のパフォーマンスが向上することがわかった。
LLMに基づく評価器の多くは、低リソース言語よりも、高リソース言語における人間の判断と高い相関関係を示す。
論文 参考訳(メタデータ) (2025-03-06T12:04:29Z) - Think Carefully and Check Again! Meta-Generation Unlocking LLMs for Low-Resource Cross-Lingual Summarization [108.6908427615402]
CLS(Cross-lingual summarization)は、異なるターゲット言語でソーステキストの要約を生成することを目的としている。
現在、インストラクションチューニング付き大規模言語モデル (LLM) は様々な英語タスクで優れている。
近年の研究では、LCSタスクにおけるLCMの性能は、わずかな設定でも満足できないことが示されている。
論文 参考訳(メタデータ) (2024-10-26T00:39:44Z) - Getting More from Less: Large Language Models are Good Spontaneous Multilingual Learners [67.85635044939836]
大きな言語モデル(LLM)は印象的な言語機能を示している。
本研究では,LLMの自然多言語アライメント改善について検討する。
質問翻訳データ(すなわち注釈付き回答なし)に基づいて学習したLLMは、英語と幅広い言語との整合を促進できることがわかった。
論文 参考訳(メタデータ) (2024-05-22T16:46:19Z) - Language Ranker: A Metric for Quantifying LLM Performance Across High and Low-Resource Languages [48.40607157158246]
大規模言語モデル(LLM)は、英語、ドイツ語、フランス語のような高リソース言語で、低リソース言語の能力は依然として不十分である。
内部表現を用いたLLM性能に基づいて,言語をベンチマークし,ランク付けするための固有測度であるLanguage Rankerを提案する。
分析の結果,高リソース言語は英語との類似度が高く,性能が優れ,低リソース言語は類似度が低いことがわかった。
論文 参考訳(メタデータ) (2024-04-17T16:53:16Z) - LLMs Are Few-Shot In-Context Low-Resource Language Learners [59.74451570590808]
In-context Learning (ICL) は、大規模言語モデル(LLM)に、表現不足の言語で多様なタスクを実行する権限を与える。
ICLとその言語間変動(X-ICL)を25の低リソース言語と7の比較的高リソース言語で検討した。
本研究は,LLMの低リソース理解品質向上における文脈内情報の重要性を論じる。
論文 参考訳(メタデータ) (2024-03-25T07:55:29Z) - Zero-Shot Cross-Lingual Reranking with Large Language Models for
Low-Resource Languages [51.301942056881146]
アフリカ語における言語間情報検索システムにおいて,大規模言語モデル (LLM) がリランカーとしてどのように機能するかを検討する。
私たちの実装は、英語と4つのアフリカの言語(ハウサ語、ソマリ語、スワヒリ語、ヨルバ語)を対象としています。
我々は、英語のクェリとアフリカの言葉の文節による言語横断的な格付けについて検討する。
論文 参考訳(メタデータ) (2023-12-26T18:38:54Z) - Democratizing LLMs for Low-Resource Languages by Leveraging their English Dominant Abilities with Linguistically-Diverse Prompts [75.33019401706188]
大規模言語モデル(LLM)は、少数の例を単純に観察することで、効果的にタスクを実行することが知られている。
我々は,LLMが任意の言語から英語に翻訳するよう促すために,多種多様な高ソース言語から合成例を組み立てることを提案する。
我々の教師なしプロンプト法は、英語と13のIndic言語と21のアフリカ低リソース言語間の翻訳において、異なる大きさのLLMにおける教師付き少ショット学習と同等に機能する。
論文 参考訳(メタデータ) (2023-06-20T08:27:47Z) - Don't Trust ChatGPT when Your Question is not in English: A Study of
Multilingual Abilities and Types of LLMs [16.770697902481107]
大規模言語モデル(LLM)は、例外的な自然言語理解能力を示している。
本論文では,多言語環境下でのLLMの性能格差を体系的に評価する方法を提案する。
その結果,GPTは多言語設定において高い翻訳的振る舞いを示すことがわかった。
論文 参考訳(メタデータ) (2023-05-24T02:05:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。