論文の概要: Pass or Fail? Evaluating LLMs on Two Greek Examination Benchmarks
- arxiv url: http://arxiv.org/abs/2609.34800v1
- Date: Mon, 28 Sep 2026 10:03:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 02:44:35.637543
- Title: Pass or Fail? Evaluating LLMs on Two Greek Examination Benchmarks
- Title(参考訳): 合格か失敗か-ギリシャの2つの審査基準に基づくLCMの評価
- Abstract要約: Prot-ExとPan-Exは、ギリシャのモデルおよび実験学校の入学試験とパンヘレニック試験の質問からなるベンチマークである。
これらのベンチマークは、テキストのみの大規模言語モデル(LLM)の性能を評価するために使用される。
以上の結果から,KriKri-8Bは,言語的に要求される人文科学タスクにおいて,より大きなLLMに対抗して,その基盤モデルを大幅に上回っていることが示唆された。
- 参考スコア(独自算出の注目度): 0.07646713951724012
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The rapid advancement of Large Language Models (LLMs) imposes a thorough evaluation of their linguistic and analytical capabilities as well as constraints, particularly for a language with limited benchmark coverage such as Greek. To address the limited availability of comprehensive benchmarks in this domain, we introduce Prot-Ex and Pan-Ex, two benchmarks consisting of questions from entrance exams for Greek Model and Experimental schools as well as the Panhellenic exams (the Greek national university entrance examinations). These benchmarks are employed to assess the performance of text-only LLMs-including the Greek-adapted KriKri-8B-Instruct, Llama-3.1-8B, Gemma-4-26B, and Qwen-3-32B-across diverse academic disciplines (Modern Greek, Mathematics, Physics, etc.) and task formats (closed, structured, and open-ended), including textualized visual context (i.e., image descriptions). Our findings indicate the localized KriKri-8B significantly outperforms its base model, successfully rivalling much larger LLMs in linguistically demanding humanities tasks. By leveraging an LLM-as-a-Judge methodology, we expose the inadequacy of traditional lexical metrics for evaluating complex reasoning. Crucially, we uncover a few-shot prompting paradox: while synthetic examples improve accuracy in closed-ended questions, they severely overload the context window of 8B models in structured tasks, causing significant performance degradation. Ultimately, this study suggests targeted linguistic adaptation offsets lower parameter counts in specialized domains, despite the fragility of smaller models to prompt verbosity.
- Abstract(参考訳): LLM(Large Language Models)の急速な進歩は、特にギリシャ語のような限られたベンチマークカバレッジを持つ言語に対して、言語的および分析的能力と制約の徹底的な評価を課している。
この領域における総合的なベンチマークの可用性の限界に対処するため、ギリシャモデルおよび実験学校の入学試験とパンヘレニック試験(ギリシャ国立大学入学試験)の2つのベンチマークであるProt-ExとPan-Exを紹介する。
これらのベンチマークは、ギリシア適応のKriKri-8B-Instruct、Llama-3.1-8B、Gemma-4-26B、Qwen-3-32B-across various academic disciplines (Modern Greek, Mathematics, Physics, etc.)およびタスク形式(クローズド、構造化、オープンエンド)を含むテキストのみのLLMの性能を評価するために使用される。
以上の結果から,KriKri-8Bは,言語的に要求される人文科学タスクにおいて,より大きなLLMに対抗して,その基盤モデルを大幅に上回っていることが示唆された。
LLM-as-a-Judge法を利用して、複雑な推論を評価するために従来の語彙メトリクスが不十分であることを明らかにする。
合成例ではクローズドエンドな質問の精度が向上する一方、構造化タスクにおいて8Bモデルのコンテキストウィンドウを過大にオーバーロードし、性能が著しく低下する。
究極的には、目的言語適応は、冗長性を促進するために小さなモデルが脆弱であるにもかかわらず、特定の領域で低いパラメータ数をオフセットすることを示唆する。
関連論文リスト
- Challenges in annotations by humans and LLMs: A case study of evaluative language [0.0]
学習における言語学者、訓練された言語学者、および大規模言語モデル(LLM)によって生成されたアノテーションを比較した。
我々は, 評価理論とその態度サブシステムに注目し, 影響, 判断, 評価のカテゴリー(クラス)を含む。
訓練された言語学者が行ったアノテーションと比較すると,モデルが最善であるのに対して,訓練中の言語学者は高い合意点に達していない。
論文 参考訳(メタデータ) (2026-07-30T12:28:54Z) - PersLitEval: Fine-grained Benchmark and Evaluation of LLMs on Persian Literature Questions [48.69228180369574]
PersLitEvalは8つのきめ細かいカテゴリにわたる4,514のペルシア文学の多重選択質問のベンチマークである。
課題の難易度を3段階に分けて,カテゴリーレベルの相違が顕著であることを示す。
エラー解析では、意味的理解のギャップ、形式的言語的知識のギャップ、カウント/列挙エラーの3つの障害モードを識別する。
論文 参考訳(メタデータ) (2026-05-26T13:34:19Z) - IndicEval: A Bilingual Indian Educational Evaluation Framework for Large Language Models [0.0]
本稿では,大規模言語モデル(LLM)の性能を評価するため,スケーラブルなベンチマークプラットフォームであるIndicEvalを紹介する。
IndicEvalは、実検定基準で評価し、推論、ドメイン知識、バイリンガル適応性の現実的な測定を可能にする。
Gemini 2.0 Flash、GPT-4、Claude、LLaMA 3-70Bで実施された実験では、3つの大きな発見が示された。
論文 参考訳(メタデータ) (2026-02-18T13:55:57Z) - GreekMMLU: A Native-Sourced Multitask Benchmark for Evaluating Language Models in Greek [27.324768282418102]
GreekMMLUはギリシャ語で大規模言語理解のためのネイティブソースのベンチマークである。
我々は16,857個のサンプルと4,948個のサンプルをプライベートなリーダーボードにリリースし、堅牢で汚染に強い評価を可能にした。
論文 参考訳(メタデータ) (2026-02-05T00:12:18Z) - A Controllable Examination for Long-Context Language Models [62.845852724511964]
本研究では,長文言語モデルを評価するベンチマークである$textbfLongBioBenchを紹介する。
その結果,ほとんどのモデルでは,検索結果に対する意味的理解や基礎的推論が不足していることが判明した。
我々のさらなる分析は、文脈的非コヒーレンスなど、既存の合成ベンチマークで採用されているいくつかの設計選択を示している。
論文 参考訳(メタデータ) (2025-06-03T14:23:06Z) - Assessing Dialect Fairness and Robustness of Large Language Models in Reasoning Tasks [68.33068005789116]
本稿では、標準英語とAAVEで1.2K以上の並列クエリペアを含むベンチマークであるReDialを紹介する。
我々は、GPT、Claude、Llama、Mistral、Phiモデルファミリーなど、広く使われているモデルを評価した。
我々の研究は、方言クエリにおけるLLMバイアスを分析するための体系的で客観的な枠組みを確立する。
論文 参考訳(メタデータ) (2024-10-14T18:44:23Z) - The Power of Question Translation Training in Multilingual Reasoning: Broadened Scope and Deepened Insights [108.40766216456413]
大規模言語モデルの英語と非英語のパフォーマンスのギャップを埋めるための質問アライメントフレームワークを提案する。
実験結果から、さまざまな推論シナリオ、モデルファミリー、サイズにわたって、多言語のパフォーマンスを向上できることが示された。
我々は、表現空間、生成された応答とデータスケールを分析し、質問翻訳訓練がLLM内の言語アライメントをどのように強化するかを明らかにする。
論文 参考訳(メタデータ) (2024-05-02T14:49:50Z) - Pragmatic Competence Evaluation of Large Language Models for the Korean Language [0.6757476692230009]
本研究では,Large Language Models (LLMs) が,特に韓国語における実践的視点から,文脈依存表現をいかによく理解しているかを評価する。
自動評価にはMultiple-Choice Questions(MCQ)と、専門家によるOEQ(Open-Ended Questions)の両方を用いる。
論文 参考訳(メタデータ) (2024-03-19T12:21:20Z) - LLaMA Beyond English: An Empirical Study on Language Capability Transfer [49.298360366468934]
我々は、言語生成の能力と指示を英語以外の言語に効果的に伝達する方法に焦点をあてる。
本稿では,語彙拡張や事前学習,トランスファーに対する指導指導などの重要な要因が与える影響について分析する。
C-Eval、MMLU、AGI-Eval、GAokao-Benchの4つの広く使われている標準テストベンチマークを採用しています。
論文 参考訳(メタデータ) (2024-01-02T06:29:02Z) - SOUL: Towards Sentiment and Opinion Understanding of Language [96.74878032417054]
我々は、言語感覚とオピニオン理解(SOUL)と呼ばれる新しいタスクを提案する。
SOULは2つのサブタスクを通して感情理解を評価することを目的としている:レビュー(RC)と正当化生成(JG)。
論文 参考訳(メタデータ) (2023-10-27T06:48:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。