論文の概要: sk-bench: A Native-First Benchmark for Evaluating Large Language Models in Slovak
- arxiv url: http://arxiv.org/abs/2610.09152v1
- Date: Tue, 06 Oct 2026 21:51:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.627557
- Title: sk-bench: A Native-First Benchmark for Evaluating Large Language Models in Slovak
- Title(参考訳): sk-bench: スロバキアにおける大規模言語モデル評価のためのネイティブファーストベンチマーク
- Abstract要約: sk-benchは、30のデータセットを持つネイティブファーストのスロバキアのベンチマークである。
生成LLM評価のための11のリソースが導入されたか、最初にパッケージ化された。
- 参考スコア(独自算出の注目度): 2.3487810957566793
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Multilingual LLM benchmarks omit Slovak, a morphologically rich West Slavic language of five million speakers, or cover it only by machine translation. We present sk-bench, a native-first Slovak benchmark with 30 datasets (33 scored task variants) across ten skill categories. Eleven resources are introduced or first packaged for generative-LLM evaluation, including IFEval-SK with Slovak-adapted instruction checkers and native Chiby/SKJ1 resources for Slovak grammar and morphology. We evaluate 55 open- and closed-weights models under one harness. The best open model trails proprietary APIs by 12.6 points. Model rankings are similar for native and translated closed-form data ($ρ\geq0.98$), though translation separates the strongest models less well. By contrast, human-authored and LLM-generated QA questions rank models differently ($ρ=0.72$). For Qwen3-14B, continued Slovak pretraining lowers the overall score by 13.9 points. A small instruction set restores three quarters of that loss. Test-time reasoning improves scores by 8.5 to 12.5 points for models of 9B and above. Together, these findings suggest four design lessons for other under-resourced languages: use native data where translation fails, plan instruction repair after language adaptation, enable test-time reasoning before scaling up, and avoid overinvesting in target-language prompts. We release the data and code at https://github.com/slovak-nlp/sk-bench
- Abstract(参考訳): 多言語LLMベンチマークでは、モルフォロジーに富んだ西スラヴ語(500万人の話者)であるスロバキア語を省略するか、機械翻訳でのみカバーする。
sk-benchはネイティブファーストのスロバキアのベンチマークで、30のデータセット(33のタスク変種)が10のスキルカテゴリにまたがっている。
スロバキア適応型インストラクションチェッカーを用いたIFEval-SKや、スロバキア文法と形態学のためのネイティブなChiby/SKJ1リソースを含む、生成LLM評価のための11のリソースが導入されたか、最初にパッケージ化された。
55個のオープンウェイトモデルとクローズドウェイトモデルを1つのハーネスで評価した。
最高のオープンモデルは、プロプライエタリなAPIを12.6ポイント追従する。
モデルランキングは、ネイティブで翻訳されたクローズドフォームデータ(ρ\geq0.98$)と似ているが、翻訳は最強のモデルをあまり区別しない。
対照的に、LLMが生成したQA質問は、異なるモデル(ρ=0.72$)をランク付けする。
Qwen3-14Bではスロバキアのプレトレーニングが続き、総合得点は13.9ポイント下がった。
小さな命令セットがその損失の4分の3を復元する。
テストタイム推論は、9B以上のモデルのスコアを8.5から12.5ポイント改善する。
これらの結果は,翻訳が失敗した場合のネイティブデータの使用,言語適応後の計画命令の修正,スケールアップ前のテスト時間推論の実現,ターゲット言語プロンプトの過剰侵入の回避という,他のアンダーリソース言語に対する4つの設計上の教訓を示唆している。
https://github.com/slovak-nlp/sk-bench.comでデータとコードを公開しています。
関連論文リスト
- Pushing on Multilingual Reasoning Models with Language-Mixed Chain-of-Thought [23.847410628315544]
英語とターゲット言語を切り替える推論スキーマである**Language-Mixed CoT**を紹介する。
我々は6つのファミリー(Qwen2.5、Llama-3.1、Gemma-3など)でNinveモデル(4B-35B)を訓練する。
我々のベストモデル**KO-REAson-35B*は、平均スコア(64.0 pm 25)で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-10-05T14:39:41Z) - A Multi-Language Object-Oriented Programming Benchmark for Large Language Models [61.267115598083315]
35の既存ベンチマークの調査では、3つの大きな不均衡が明らかになった。
85.7%は単一のプログラミング言語に重点を置いている。
94.3%は関数レベルまたはステートメントレベルのタスクのみを対象としている。
80%以上は平均10件未満のテストケースを含む。
論文 参考訳(メタデータ) (2025-09-30T11:30:08Z) - Optimized Text Embedding Models and Benchmarks for Amharic Passage Retrieval [49.1574468325115]
トレーニング済みのAmharic BERTとRoBERTaのバックボーンをベースとした,Amharic固有の高密度検索モデルを提案する。
提案したRoBERTa-Base-Amharic-Embedモデル(110Mパラメータ)は,MRR@10の相対的な改善を17.6%達成する。
RoBERTa-Medium-Amharic-Embed (42M)のようなよりコンパクトな派生型は13倍以上小さいまま競争力を維持している。
論文 参考訳(メタデータ) (2025-05-25T23:06:20Z) - IrokoBench: A New Benchmark for African Languages in the Age of Large Language Models [18.083861654053585]
IrokoBenchは17の原型的に異なる低リソースのアフリカ言語のための人間翻訳ベンチマークデータセットである。
IrokoBenchを使って、10のオープンおよび6つのプロプライエタリ言語モデルでゼロショット、少数ショット、および翻訳テストの設定(テストセットを英語に翻訳する)を評価します。
オープンモデルとプロプライエタリモデルの間には大きなパフォーマンスギャップがあり、最高パフォーマンスのオープンモデルであるGemma 2 27Bは、最高のパフォーマンスのプロプライエタリモデルであるGPT-4oのパフォーマンスの63%に過ぎません。
論文 参考訳(メタデータ) (2024-06-05T15:23:08Z) - Machine Translation for Ge'ez Language [0.0]
Ge'ezのような低リソース言語の機械翻訳は、語彙外単語、ドメインミスマッチ、ラベル付きトレーニングデータの欠如といった課題に直面している。
言語関連性に基づく多言語ニューラルマシン翻訳(MNMT)モデルを開発した。
また,最新のLCMであるGPT-3.5を用いて,ファジィマッチングを用いた数ショット翻訳実験を行った。
論文 参考訳(メタデータ) (2023-11-24T14:55:23Z) - SMaLL-100: Introducing Shallow Multilingual Machine Translation Model
for Low-Resource Languages [102.50127671423752]
本稿では,100言語をカバーするM2M-100(12B)機械翻訳モデルの蒸留版であるSMaLL-100を紹介する。
我々はSMALL-100を全ての言語対を均一にサンプリングすることで訓練し、低リソース言語の性能を維持することに重点を置いている。
我々のモデルはM2M-100(1.2B)に匹敵する結果を得るが、推論では3.6倍小さく、4.3倍高速である。
論文 参考訳(メタデータ) (2022-10-20T22:32:29Z) - Few-shot Learning with Multilingual Language Models [66.49496434282564]
多様な言語群をカバーするバランスの取れたコーパス上で,多言語の自動回帰言語モデルを訓練する。
私たちの最大のモデルは、20以上の代表言語で数ショットの学習において、新しい最先端の技術を定めています。
本稿では,モデルがどこで成功し,失敗するかを詳細に分析し,特に言語間の文脈内学習を可能にすることを示す。
論文 参考訳(メタデータ) (2021-12-20T16:52:35Z) - AmericasNLI: Evaluating Zero-shot Natural Language Understanding of
Pretrained Multilingual Models in Truly Low-resource Languages [75.08199398141744]
我々は、XNLI(Conneau et al)の拡張である AmericasNLI を提示する。
は、アメリカ大陸の10の原住民の言語である。
XLM-Rで実験を行い、複数のゼロショットおよび翻訳ベースのアプローチをテストします。
XLM-Rのゼロショット性能は全10言語で低調であり、平均性能は38.62%である。
論文 参考訳(メタデータ) (2021-04-18T05:32:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。