論文の概要: Building a European Multilingual Evaluation Dataset: The MMLU Localisation Project within the EMT Network
- arxiv url: http://arxiv.org/abs/2607.18432v1
- Date: Mon, 20 Jul 2026 18:33:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.215122
- Title: Building a European Multilingual Evaluation Dataset: The MMLU Localisation Project within the EMT Network
- Title(参考訳): 欧州の多言語評価データセットの構築:EMTネットワークにおけるMMLUローカライゼーションプロジェクト
- Abstract要約: 本稿では,欧州通訳総局(DGT)と欧州通訳総局(EMT)の連携について報告する。
このプロジェクトは、修士課程の学生に翻訳、リビジョン、プロジェクト管理、多言語調整の専門訓練を提供する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: This paper reports on a collaboration between the Directorate-General for Translation (DGT) and the European Master's in Translation (EMT) to localise the MMLU dataset into 11 European languages. Beyond creating a more inclusive benchmark for LLM evaluation, the project offers master's students authentic, project-based professional training in translation, revision, project management, and multilingual coordination, while highlighting key methodological, administrative, and workflow challenges.
- Abstract(参考訳): 本稿では、MMLUデータセットを11のヨーロッパ言語にローカライズするために、DGT(Directorate-General for Translation)とEMT(European Master's in Translation)の協力関係について報告する。
LLM評価のためのより包括的なベンチマークを作成する以外に、プロジェクトはマスターの学生に、翻訳、リビジョン、プロジェクト管理、多言語調整におけるプロジェクトベースのプロフェッショナルトレーニングを提供し、主要な方法論、管理、ワークフローの課題を強調している。
関連論文リスト
- EMCee: Improving Multilingual Capability of LLMs via Bridging Knowledge and Reasoning with Extracted Synthetic Multilingual Context [6.612630497074871]
大規模言語モデル(LLM)は、広範囲のタスクで目覚ましい進歩を遂げました。
英語中心のトレーニングデータに大きく依存すると、非英語言語ではパフォーマンスが大幅に低下する。
本稿では,クエリ関連知識を明示的に抽出し,活用することにより,LLMの多言語機能を向上させるフレームワークであるEMCeeを提案する。
論文 参考訳(メタデータ) (2025-03-07T06:05:34Z) - Retrieval-Augmented Machine Translation with Unstructured Knowledge [63.97706326080482]
Retrieval-augmented Generation (RAG)は、大規模言語モデル(LLM)を強化するために追加情報を導入する
機械翻訳(MT)では、従来の研究は通常、ペア化されたMTコーパスや知識グラフからコンテキスト内例を検索する。
本稿では,非構造化文書を用いた検索強化MTについて検討する。
論文 参考訳(メタデータ) (2024-12-05T17:00:32Z) - P-MMEval: A Parallel Multilingual Multitask Benchmark for Consistent Evaluation of LLMs [84.24644520272835]
本稿では,P-MMEvalを提案する。P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P -M
P-MMEvalは、さまざまなデータセットにわたって一貫した言語カバレッジを提供し、並列サンプルを提供する。
我々は、モデルとタスク間の性能を比較するために、代表的多言語モデル系列に関する広範な実験を行う。
論文 参考訳(メタデータ) (2024-11-14T01:29:36Z) - Towards Multilingual LLM Evaluation for European Languages [3.3917876450975317]
ヨーロッパ言語に適した多言語評価手法を提案する。
ヨーロッパ21言語にまたがる40のLLMの能力を評価するために,広く使用されている5つのベンチマークの翻訳版を採用した。
論文 参考訳(メタデータ) (2024-10-11T15:53:24Z) - Teuken-7B-Base & Teuken-7B-Instruct: Towards European LLMs [29.881727079038857]
本稿では,多言語LLMであるTeuken 7B-baseとTeuken 7B-instructについて述べる。
私たちのモデルは、欧州連合の24の公用語すべてをサポートすることで、ヨーロッパの言語多様性を受け入れます。
論文 参考訳(メタデータ) (2024-09-30T16:05:38Z) - EuroLLM: Multilingual Language Models for Europe [76.89545643715368]
オープンウェイトな多言語LLMの開発を目的としたEuroLLMプロジェクトを紹介した。
これまでの進捗状況を概説し、データ収集とフィルタリングプロセスについて詳述する。
マルチリンガル・ジェネラル・ベンチマークと機械翻訳の性能について報告する。
論文 参考訳(メタデータ) (2024-09-24T16:51:36Z) - Teaching Machines to Code: Smart Contract Translation with LLMs [4.780973517287942]
本稿では、2つの異なる大規模言語モデル(LLM)を統一されたフレームワーク内でシナジーを利用する先駆的なアプローチを提案する。
このフレームワークは、コーディング原則を把握し、コードから馴染みのない言語への変換にこの理解を適用するように設計されています。
本研究では,人間の学習過程を模倣するLLMの能力について検討し,Solidityで記述されたスマートコントラクトをMoveに変換する手法の詳細な評価を行った。
論文 参考訳(メタデータ) (2024-03-13T18:55:20Z) - No Language is an Island: Unifying Chinese and English in Financial Large Language Models, Instruction Data, and Benchmarks [75.29561463156635]
ICE-PIXIUは、翻訳された英語とオリジナルの英語のデータセットとともに、中国語のタスクのスペクトルを統合する。
多様なモデル変種への無制限アクセス、多言語および多モーダル命令データのコンパイル、エキスパートアノテーションによる評価ベンチマークを提供する。
論文 参考訳(メタデータ) (2024-03-10T16:22:20Z) - Tower: An Open Multilingual Large Language Model for Translation-Related
Tasks [27.237316809769975]
本稿では,翻訳に含まれる複数のタスクに対して,大規模言語モデル(LLM)を調整するためのレシピを提案する。
我々の最終モデルは、翻訳に関連するいくつかのタスクにおいて、オープンな代替案を超越し、汎用的な閉LLMと競合する。
論文 参考訳(メタデータ) (2024-02-27T18:09:36Z) - D\'olares or Dollars? Unraveling the Bilingual Prowess of Financial LLMs
Between Spanish and English [67.48541936784501]
Tois'on de Oro は、英語とのスペイン語共同で、命令データセット、微調整 LLM 、および金融 LLM の評価ベンチマークを確立する最初のフレームワークである。
7つのタスクをカバーする15のデータセットから144万以上のスペイン語と英語のサンプルを含む、厳格にキュレートされたバイリンガル命令データセットを構築した。
FLARE-ESは9つのタスクをカバーする21のデータセットを持つ最初の総合的バイリンガル評価ベンチマークである。
論文 参考訳(メタデータ) (2024-02-12T04:50:31Z) - Extrapolating Large Language Models to Non-English by Aligning Languages [109.09051737966178]
既存の大きな言語モデルは、異なる言語間で異なる能力を示す。
本稿では,言語間のセマンティックアライメントを構築することで,英語以外の言語に事前学習したLLMを強化する。
論文 参考訳(メタデータ) (2023-08-09T13:32:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。