論文の概要: KoNeoBench: A Curated Evaluation Dataset for LLM Understanding of Korean Neologisms
- arxiv url: http://arxiv.org/abs/2609.19916v1
- Date: Thu, 17 Sep 2026 08:58:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:54.177343
- Title: KoNeoBench: A Curated Evaluation Dataset for LLM Understanding of Korean Neologisms
- Title(参考訳): KoNeoBench: 韓国のネオロジズムをLLMで理解するための評価データセット
- Abstract要約: KoNeoBenchは韓国のネオロジズムの理解を評価するためのベンチマークである。
KoNeoBenchは、2020年以降、オンラインニュースで証明された韓国のネオロジズム1,785件に構築されている。
- 参考スコア(独自算出の注目度): 7.666581619613738
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are typically evaluated on static benchmarks, even though natural language constantly evolves through newly emerging words and meanings. Existing Korean benchmarks are centered on established vocabulary and therefore provide limited coverage of such recent lexical change, and their English-oriented design makes it difficult to assess the typological properties of Korean, in which content words combine productively with functional morphemes. In this paper, we introduce KoNeoBench, a benchmark for evaluating LLMs' understanding of Korean neologisms. KoNeoBench is built on 1,785 Korean neologisms attested in online news since 2020 and curated through expert lexicographic review. Each entry provides usage examples, word-formation analyses, and dictionary-style definitions. Based on this resource, we define four tasks and report results on recent models, together with a human baseline. Our experiments show that current LLMs exhibit clear limitations in recovering source components, distinguishing semantic categories, and generating accurate definitions. These results reveal specific aspects of recent Korean lexical change that remain challenging for current LLMs. KoNeoBench is available at https://github.com/bcmilab/ko-neobench/ .
- Abstract(参考訳): 大規模言語モデル(LLM)は、新しい単語や意味を通じて自然言語が常に進化しながらも、静的なベンチマークで評価されるのが一般的である。
既存の韓国のベンチマークは、確立された語彙に重点を置いているため、近年の語彙変化のカバー範囲が限られており、その英語指向のデザインは、内容語と機能的形態素を生産的に組み合わせた韓国の語型特性を評価するのを困難にしている。
本稿では,韓国のネオロジズムに対するLLMの理解を評価するためのベンチマークであるKoNeoBenchを紹介する。
KoNeoBenchは、2020年以降のオンラインニュースで証明された韓国のネオロジズム1,785件に基づいて構築され、専門家のレキシコグラフィーによるレビューを通じてキュレートされている。
各エントリは、使用例、単語変換分析、辞書スタイルの定義を提供する。
このリソースに基づいて、4つのタスクを定義し、人間のベースラインとともに最近のモデルについて結果を報告する。
実験の結果,現在のLCMでは,ソースコンポーネントの復元,セマンティックなカテゴリの識別,正確な定義の生成に限界があることが判明した。
これらの結果から,近年の韓国の語彙変化の具体的な側面が明らかとなった。
KoNeoBenchはhttps://github.com/bcmilab/ko-neobench/で入手できる。
関連論文リスト
- MameLoshnLM: Yiddish Language Model and Evaluation Benchmark [62.936233688546984]
We present MameLoshnLM, a first open-source 8B- parameter language model built for Yiddish。
イディッシュ語のリッチテキストの伝統にもかかわらず、そのデジタル的存在と信頼性の高い評価資源の不足は、イディッシュ語のモデリングの進歩を妨げている。
この結果は,Yiddish NLPの基礎と,歴史的にリッチだがデジタルに表現されていない言語における言語モデル開発のための実践的テンプレートの両方を提供する。
論文 参考訳(メタデータ) (2026-08-06T10:24:08Z) - HeQ: a Large and Diverse Hebrew Reading Comprehension Benchmark [54.73504952691398]
我々は,抽出質問としてヘブライ語機械読解データセットの提供に着手した。
ヘブライ語の形態学的に豊かな性質はこの努力に挑戦している。
我々は,新しいガイドラインのセット,制御されたクラウドソーシングプロトコル,評価基準の改訂を考案した。
論文 参考訳(メタデータ) (2025-08-03T15:53:01Z) - Making Sense of Korean Sentences: A Comprehensive Evaluation of LLMs through KoSEnd Dataset [6.097274206862952]
この研究は、複雑な文終末で知られる韓国語に焦点を当てた。
韓国文終末データセットを導入し, 3000の文を含む15の文終末形式の自然性について注釈を付けた。
韓国語文終末の理解度を評価するため,11のLLMを評価し,パラメータ数と予測整合性に基づいて分析した。
論文 参考訳(メタデータ) (2025-07-04T08:21:24Z) - Holmes: A Benchmark to Assess the Linguistic Competence of Language Models [59.627729608055006]
言語モデル(LM)の言語能力を評価するための新しいベンチマークであるHolmesを紹介する。
我々は、計算に基づく探索を用いて、異なる言語現象に関するLMの内部表現を調べる。
その結果,近年,他の認知能力からLMの言語能力を引き離す声が上がっている。
論文 参考訳(メタデータ) (2024-04-29T17:58:36Z) - CIF-Bench: A Chinese Instruction-Following Benchmark for Evaluating the Generalizability of Large Language Models [53.9835961434552]
本研究では,中国語に対する大規模言語モデル(LLM)の一般化性を評価するために,中国語命令追跡ベンチマーク(CIF-Bench)を導入する。
CIF-Benchは150のタスクと15,000の入力出力ペアで構成され、複雑な推論と中国の文化的ニュアンスをテストするためにネイティブスピーカーによって開発された。
データ汚染を軽減するため、データセットの半分しか公開せず、残りは非公開であり、スコア分散を最小限に抑えるために多種多様な命令を導入する。
論文 参考訳(メタデータ) (2024-02-20T16:02:12Z) - NEO-BENCH: Evaluating Robustness of Large Language Models with Neologisms [19.863120275409393]
我々は、いくつかの一般的な収集手法を用いて、近年のイングランドのネオロジズムの多様な資源を創出する。
我々は新語を含む文と新語を置き換えたほぼ同一の文とを既存の代用語と比較することにより,時間的ドリフトを分析する。
モデル性能は1つの新語が文中に導入されるとき、機械翻訳においてほぼ半減する。
論文 参考訳(メタデータ) (2024-02-19T16:19:15Z) - KLUE: Korean Language Understanding Evaluation [43.94952771238633]
韓国語理解評価(KLUE)ベンチマークを紹介する。
KLUEは、韓国の8つの自然言語理解(NLU)タスクのコレクションである。
著作権を尊重しながら、さまざまなソースコーパスから、すべてのタスクをゼロから構築します。
論文 参考訳(メタデータ) (2021-05-20T11:40:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。