論文の概要: NOLLI: A Difficulty-Calibrated Puzzle Benchmark for Diagnosing the English-Korean Performance Gap
- arxiv url: http://arxiv.org/abs/2608.04397v1
- Date: Wed, 05 Aug 2026 02:58:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.698855
- Title: NOLLI: A Difficulty-Calibrated Puzzle Benchmark for Diagnosing the English-Korean Performance Gap
- Title(参考訳): NOLLI: 英語と韓国のパフォーマンスのギャップを診断する難易度校正されたパズルベンチマーク
- Authors: Dasol Choi, Joonyong Park, Daegon Yu, Soo Yong Kim, Youngsook Song, Seunghyeok Hong,
- Abstract要約: NOLLIは韓国のパフォーマンスギャップの発生箇所を診断するためのベンチマークである。
15のパズルタイプ(25のタスク、7500のアイテム)で構成され、各インスタンスはシード生成可能で、ユニークなソリューションを持つことが検証される。
朝鮮文化や正書法に根ざした朝鮮語のみの業務と、一致した直訳、漢語ジャム(サブ・シラビック文字)の文字適応を兼ね備えている。
- 参考スコア(独自算出の注目度): 6.166565297478229
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce NOLLI, a procedurally generated English-Korean puzzle benchmark designed to diagnose where Korean performance gaps arise. It comprises 15 puzzle types (25 tasks; 7,500 items), with every instance seed-regenerable, verified to have a unique solution, and scored deterministically. Rather than equating harder with bigger, we calibrate difficulty behaviorally, tuning each generator until a fixed reference model lands in target accuracy bands. Its three-level design combines matched direct translations, script adaptations over Hangul jamo (sub-syllabic letters), and Korean-only tasks grounded in Korean culture or orthography. We evaluate 15 frontier, open-weight, and Korean-developed models; among the 12 above a 3% overall-accuracy floor, matched English-Korean accuracy is statistically equivalent within a +/- 10 pp margin (TOST), suggesting little cost from presentation language alone. Writing-system-intensive tasks show sharper gaps: Korean Cipher falls behind English by up to 68.7 pp, whereas Cryptarithmetic over the same jamo shows no systematic penalty, and Jamo Composition accuracy predicts Korean Cipher accuracy. These contrasts are diagnostic rather than causal, consistent with difficulty in multi-step sub-syllabic execution. Korean-only tasks separate rule-application deficits, which vary in sign, from a Kinship deficit positive in all 12. Finally, a salient size measure fails to grow from Easy to Hard in 7 of 15 types, making structural size an unreliable proxy for empirical difficulty.
- Abstract(参考訳): NOLLIは,韓国のパフォーマンスギャップの発生箇所を診断するために設計された,手続き的に生成された英語と韓国のパズルベンチマークである。
15のパズルタイプ(25のタスク、7500のアイテム)で構成され、すべてのインスタンスがシード生成可能で、ユニークな解があることが検証され、決定論的に得点される。
より大きく等しくするよりは、固定参照モデルが目標精度帯に着くまで各ジェネレータを調整し、動作の調整を行う。
3段階のデザインは、朝鮮文化や正書法に根ざした直訳、ハングル・ジャム(サブ・シラビック文字)への脚本の適応、朝鮮語のみのタスクが組み合わされている。
3%以上の全精度フロアでは,英語と韓国語の精度は,a+/-10ppの範囲内で統計的に等価であり,プレゼンテーション言語単独ではほとんどコストがかからない。
韓国の暗号は68.7 ppまで遅れているのに対し、同じジャム上のクリプタロメティックは体系的なペナルティを示さず、ジャモ組成の精度は韓国の暗号の精度を予測する。
これらのコントラストは因果ではなく診断であり、多段階の副音節実行の難しさと一致している。
韓国のみのタスクはルール適用の欠陥を区別するが、これは目印が異なり、Kinshipの欠陥は全12カ国で正である。
最終的に、健全なサイズ尺度は、15種類の7タイプで簡単からハードに成長しないため、構造的サイズは経験的困難に対する信頼性の低いプロキシとなる。
関連論文リスト
- Extending Item Response Theory for Efficient and Meaningful Multilingual Evaluation [19.965981631741894]
マルチ言語ベンチマークは、言語全体にわたる大規模言語モデル(LLM)の評価の中心である。
徹底的な評価は言語数とともに線形にスケールし、自動翻訳はスケールで見落とされるエラーを導入し、いくつかの項目は一般的な知識と文化固有の知識を詳述する。
我々はこれら3つを統一的な統計フレームワークであるMultilingual-IRTで解決し、言語ごとの難易度差による項目応答理論を拡張した。
論文 参考訳(メタデータ) (2026-06-14T07:16:03Z) - K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts [43.3460021951349]
我々は,K-BrowseCompを紹介した。K-BrowseComp,K-BrowseComp,K-BrowseComp,K-BrowseComp,K-BrowseComp,K-BrowseComp,K-BrowseComp,K-BrowseC omp,K-BrowseComp。
300プロブレムのK-BrowseComp-Verifiedサブセットは、韓国のネイティブスピーカーによって手作業で構築され、検証される。
このサブセットでは、GPT-5.5、DeepSeek-V4-Pro、GLM-5.1を含むフロンティアのLLMが30.00--45.67%にしか達せず、BrowseCompから大幅に落ち込んだ。
論文 参考訳(メタデータ) (2026-06-01T15:50:03Z) - The GaoYao Benchmark: A Comprehensive Framework for Evaluating Multilingual and Multicultural Abilities of Large Language Models [51.61416200800499]
GaoYaoは182.3kサンプル、26言語、51か国/地域からなる総合ベンチマークである。
まず、GaoYao氏は評価タスクを3つの文化階層に分類する統一的なフレームワークを提案する。
第二に、専門家を活用して、主観的なベンチマークを19言語に厳格にローカライズすることで、ネイティブ品質の拡大を実現しています。
第3に,20以上のフラッグシップおよびコンパクトLCMの詳細な診断を行う。
論文 参考訳(メタデータ) (2026-04-22T06:19:46Z) - KoBALT: Korean Benchmark For Advanced Linguistic Tasks [0.6971903955510721]
KoBALT (Korean Benchmark for Advanced Linguistic Tasks) は700の質問からなる言語的に動機付けられたベンチマークである。
韓国語における大規模言語モデル(LLM)の評価を推し進めるために設計された。
韓国の標準コーパスとn-gramの重複が最小限に抑えられた専門家による言語的動機付けの質問スイートを導入している。
論文 参考訳(メタデータ) (2025-05-22T02:03:07Z) - Understand, Solve and Translate: Bridging the Multilingual Mathematical Reasoning Gap [0.0]
大規模言語モデル(LLM)は複雑な推論タスクにおいて例外的な性能を示す。
高リソース言語では強い推論能力があるが、他の言語では大きなパフォーマンスギャップが持続する。
提案するUST(Understand, Solve, and Translate)は,推論と解生成のためのアンカーとして英語を戦略的に利用する手法である。
論文 参考訳(メタデータ) (2025-01-05T05:57:22Z) - Multilingual Contrastive Decoding via Language-Agnostic Layers Skipping [60.458273797431836]
対照的なレイヤ(DoLa)によるデコーディングは、大規模言語モデルの生成品質を改善するために設計されている。
このアプローチは英語以外のタスクではうまくいきません。
モデルの前方通過における言語遷移に関する従来の解釈可能性の研究から着想を得て,改良されたコントラスト復号アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-07-15T15:14:01Z) - On the Off-Target Problem of Zero-Shot Multilingual Neural Machine
Translation [104.85258654917297]
識別対象言語信号の符号化に失敗すると、オフターゲットとなり、語彙距離が近くなることが判明した。
多言語語彙構築のための言語認識語彙共有(LAVS)を提案する。
我々は11言語で多言語機械翻訳ベンチマーク実験を行った。
論文 参考訳(メタデータ) (2023-05-18T12:43:31Z) - Making Large Language Models Better Reasoners with Step-Aware Verifier [49.16750018427259]
DIVERSE(Diverse Verifier on Reasoning Step)は、言語モデルの推論能力をさらに強化する新しいアプローチである。
最新の言語モデルであるcode-davinci 上で DIVERSE を評価し,8つの推論ベンチマークのうち6つで新たな最先端結果が得られることを示す。
論文 参考訳(メタデータ) (2022-06-06T03:38:36Z) - Few-shot Learning with Multilingual Language Models [66.49496434282564]
多様な言語群をカバーするバランスの取れたコーパス上で,多言語の自動回帰言語モデルを訓練する。
私たちの最大のモデルは、20以上の代表言語で数ショットの学習において、新しい最先端の技術を定めています。
本稿では,モデルがどこで成功し,失敗するかを詳細に分析し,特に言語間の文脈内学習を可能にすることを示す。
論文 参考訳(メタデータ) (2021-12-20T16:52:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。