論文の概要: Extending Item Response Theory for Efficient and Meaningful Multilingual Evaluation
- arxiv url: http://arxiv.org/abs/2606.15643v1
- Date: Sun, 14 Jun 2026 07:16:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:33.775316
- Title: Extending Item Response Theory for Efficient and Meaningful Multilingual Evaluation
- Title(参考訳): 効率的かつ意味のある多言語評価のための項目応答理論の拡張
- Abstract要約: マルチ言語ベンチマークは、言語全体にわたる大規模言語モデル(LLM)の評価の中心である。
徹底的な評価は言語数とともに線形にスケールし、自動翻訳はスケールで見落とされるエラーを導入し、いくつかの項目は一般的な知識と文化固有の知識を詳述する。
我々はこれら3つを統一的な統計フレームワークであるMultilingual-IRTで解決し、言語ごとの難易度差による項目応答理論を拡張した。
- 参考スコア(独自算出の注目度): 19.965981631741894
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Multilingual benchmarks are central to evaluating large language models (LLMs) across languages, but they suffer from three issues: exhaustive evaluation scales linearly with the number of languages, automatic translation introduces errors that are easily missed at scale, and some items conflate general and culture-specific knowledge. We address all three with a unified statistical framework, Multilingual-IRT, which extends Item Response Theory with per-language difficulty deviations, split discriminability separating content from language effects, and per-language ability residuals. Fitting Multilingual-IRT on 25 LLMs across 29 languages of MMLU-Pro-X, we show that its fitted parameters support three practical applications: predicting unobserved (item, LLM, language) instances with 11-16% lower binary cross-entropy than the strongest accuracy-based baseline, surfacing candidate translation errors distributed across all 28 non-English languages, whereas accuracy-based baselines concentrate detections in a few languages, and recovering culture-specific items that accuracy-based baselines miss.
- Abstract(参考訳): 言語間の大きな言語モデル(LLM)を評価する上では,多言語ベンチマークが中心となっているが,これらには3つの問題がある。
我々はこれら3つすべてに統一された統計フレームワークであるMultilingual-IRTで対処し、項目応答理論を言語ごとの難易度、言語効果からコンテンツを切り離す識別可能性、言語ごとの能力残余で拡張する。
MMLU-Pro-Xの29言語にわたる25のLLMにMultilingual-IRTを適用すると、そのパラメータが3つの実用的応用をサポートすることが示される: 観測されていない(item, LLM, Language)インスタンスの予測は、最強の精度ベースのベースラインよりも11-16%低いバイナリクロスエントロピー、28の非英語言語すべてに分散する候補翻訳エラーの予測、精度ベースのベースラインがいくつかの言語で検出に集中するのに対して、精度ベースのベースラインは、精度ベースのベースラインを逸脱する文化特化項目の回復である。
関連論文リスト
- Lower-Resource, Higher Scores: Language Bias in LLM Evaluators [27.959960538188753]
意味論的に同一の命令応答対を23言語で実験する。
その結果、多言語評価器は異なる評価言語に大きく異なるスコアを割り当てていることがわかった。
論文 参考訳(メタデータ) (2026-07-16T01:53:09Z) - The GaoYao Benchmark: A Comprehensive Framework for Evaluating Multilingual and Multicultural Abilities of Large Language Models [51.61416200800499]
GaoYaoは182.3kサンプル、26言語、51か国/地域からなる総合ベンチマークである。
まず、GaoYao氏は評価タスクを3つの文化階層に分類する統一的なフレームワークを提案する。
第二に、専門家を活用して、主観的なベンチマークを19言語に厳格にローカライズすることで、ネイティブ品質の拡大を実現しています。
第3に,20以上のフラッグシップおよびコンパクトLCMの詳細な診断を行う。
論文 参考訳(メタデータ) (2026-04-22T06:19:46Z) - Calibrating Beyond English: Language Diversity for Better Quantized Multilingual LLM [10.689556615369272]
非英語および多言語キャリブレーションセットは、英語のみのベースラインに比べてパープレキシティを著しく改善する。
キャリブレーションセットを評価言語に調整すると、個々の言語で最大の改善が得られます。
論文 参考訳(メタデータ) (2026-01-26T09:36:03Z) - M3TQA: Massively Multilingual Multitask Table Question Answering [39.99483693397598]
m3TQA-Instructは97の言語にまたがる大規模なベンチマークである。
我々は、中国語と英語で50の現実世界のテーブルをキュレートしてm3TQAを構築し、DeepSeekとGPT-4oをベースとした堅牢な6ステップの翻訳パイプラインを適用した。
このベンチマークには、微妙なテーブル推論能力を評価するために設計された4つのタスクに2,916の専門的なアノテートされた質問応答ペアが含まれている。
論文 参考訳(メタデータ) (2025-08-22T09:57:40Z) - Learning the Topic, Not the Language: How LLMs Classify Online Immigration Discourse Across Languages [0.0]
大規模言語モデル(LLM)は、スケーラブルで正確な分析を可能にすることによって、社会科学の研究を変革している。
我々は、移民関連ツイートを分類するために、モノリンガル、バイリンガル、マルチリンガルデータセット上の軽量LLaMA 3.2-3Bモデルを微調整する。
最小限の言語固有の微調整が言語間話題の検出を可能にするか、ターゲット言語を追加することで事前学習バイアスが修正されるかを評価する。
論文 参考訳(メタデータ) (2025-08-08T16:23:24Z) - PolyMath: Evaluating Mathematical Reasoning in Multilingual Contexts [85.78821098963607]
PolyMathは18の言語と4つの難易度をカバーする多言語数学的推論ベンチマークである。
我々のベンチマークは、包括性、言語多様性、高品質な翻訳の難しさを保証する。
論文 参考訳(メタデータ) (2025-04-25T15:39:04Z) - MELA: Multilingual Evaluation of Linguistic Acceptability [7.524375463656369]
言語アクセプタビリティの多言語評価 -- MELA -- 10言語を対象とする46Kのサンプルを用いて、言語アクセプタビリティに関する最も大きなベンチマークを提示する。
多言語解釈可能性の追求において, 微調整XLM-Rを用いた探索実験を行った。
言語間移動実験は、受容可能性判定における伝達が非自明であることを示す。
論文 参考訳(メタデータ) (2023-11-15T15:25:28Z) - Breaking Language Barriers in Multilingual Mathematical Reasoning: Insights and Observations [59.056367787688146]
本稿では, マルチリンガル数学推論 (xMR) LLM の探索と学習の先駆者である。
我々は10の異なる言語を含む最初の多言語数学推論命令データセットMGSM8KInstructを構築した。
翻訳を利用して、10個の異なる言語を含む最初の多言語数学推論命令データセットMGSM8KInstructを構築した。
論文 参考訳(メタデータ) (2023-10-31T08:09:20Z) - Polyglot or Not? Measuring Multilingual Encyclopedic Knowledge in
Foundation Models [0.0]
我々は,幅広い言語文脈において,百科事典的知識を想起する基礎モデルの能力を評価する。
我々は,303万件のファクト・アソシエーションと反ファクト・アソシエーションを組み合わせた20言語データセットを作成した。
多言語テストでは5つのモデルを評価し、英語のみのテストでは24のモデルの多様なセットをベンチマークする。
論文 参考訳(メタデータ) (2023-05-23T04:31:39Z) - AM2iCo: Evaluating Word Meaning in Context across Low-ResourceLanguages
with Adversarial Examples [51.048234591165155]
本稿では, AM2iCo, Adversarial and Multilingual Meaning in Contextを提案する。
言語間文脈における単語の意味の同一性を理解するために、最先端(SotA)表現モデルを忠実に評価することを目的としている。
その結果、現在のSotAプリトレーニングエンコーダは人間のパフォーマンスにかなり遅れていることが明らかとなった。
論文 参考訳(メタデータ) (2021-04-17T20:23:45Z) - Inducing Language-Agnostic Multilingual Representations [61.97381112847459]
言語間の表現は、世界中のほとんどの言語でNLP技術が利用可能になる可能性がある。
i) 対象言語のベクトル空間をピボットソース言語に再配置すること、(ii) 言語固有の手段と分散を取り除くこと、(ii) 副産物としての埋め込みの識別性を向上すること、(iii) 形態的制約や文の並べ替えを除去することによって言語間の入力類似性を高めること、の3つのアプローチを検討する。
論文 参考訳(メタデータ) (2020-08-20T17:58:56Z) - Learning to Learn Morphological Inflection for Resource-Poor Languages [105.11499402984482]
本稿では,メタラーニング問題として資源不足言語に対する形態的インフレクション(補題を表象形にマッピングする)の課題を提案する。
それぞれの言語を個別のタスクとして扱うことで、高速ソース言語からのデータを使ってモデルパラメータの集合を学習する。
3つのファミリーから29のターゲット言語を対象とする2つのモデルアーキテクチャの実験により、提案手法がすべてのベースラインを上回ります。
論文 参考訳(メタデータ) (2020-04-28T05:13:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。