論文の概要: YOMI-Bench: A Benchmark for Evaluating Kanji Reading and Phonological Understanding of LLMs for Japanese
- arxiv url: http://arxiv.org/abs/2607.00664v1
- Date: Wed, 01 Jul 2026 09:13:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.823211
- Title: YOMI-Bench: A Benchmark for Evaluating Kanji Reading and Phonological Understanding of LLMs for Japanese
- Title(参考訳): YOMI-Bench:日本語における漢字読解と音韻理解のためのベンチマーク
- Abstract要約: 日本語では、一つの漢字文字が複数の読み出しが可能な場合が多く、表層テキストだけでは正しい読み出しを推測することは困難である。
提案するYOMI-Benchは,日本語の漢字読解能力を評価するための4つのタスクから構成される。
- 参考スコア(独自算出の注目度): 24.032881992865697
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We propose YOMI-Bench, a benchmark for evaluating kanji reading and phonological understanding of large language models (LLMs) for Japanese. In Japanese, a single kanji character often has multiple possible readings, making it difficult to infer the correct reading from surface-level text alone. Due to these linguistic characteristics, it is empirically known that LLMs exhibit low performance in kanji reading for Japanese. The proposed YOMI-Bench consists of four tasks specifically designed to evaluate kanji reading performance in Japanese. In our evaluation using YOMI-Bench, we assessed one multilingual open LLM, four Japanese-specific open LLMs, and five commercial LLMs. As a result, we found that even Japanese-specific models show low performance, and that commercial models also perform poorly on generation tasks that require consideration of kanji readings.
- Abstract(参考訳): 日本語大言語モデル(LLM)の漢字読解と音韻的理解のベンチマークであるYOMI-Benchを提案する。
日本語では、一つの漢字文字が複数の読み出しが可能な場合が多く、表層テキストだけでは正しい読み出しを推測することが困難である。
これらの言語的特徴から,LLMは日本語の漢字読解能力が低いことが実証的に知られている。
提案するYOMI-Benchは,日本語の漢字読解能力を評価するための4つのタスクから構成される。
YOMI-Bench を用いた評価では,多言語オープン LLM と日本語固有のオープン LLM を4つ,商用 LLM を5つ評価した。
その結果、日本語固有のモデルでさえ性能が低く、また漢字の読みを考慮すべき生成タスクにおいても商業モデルは性能が良くないことが判明した。
関連論文リスト
- MultiNRC: A Challenging and Native Multilingual Reasoning Evaluation Benchmark for LLMs [56.87573414161703]
大規模言語モデル(LLM)を評価するベンチマークであるMultiNRC(MultiNRC)を導入する。
MultiNRCは4つの中核的推論カテゴリをカバーしている: 言語固有の言語推論、単語プレイとライドル、文化的/トラディション推論、文化的関連性のある数学推論である。
文化的・貿易的推論や文化的関連性を考慮した数学的推論については、英語に習熟した母語話者のマニュアル翻訳による多言語質問の英訳も提供する。
論文 参考訳(メタデータ) (2025-07-23T12:56:31Z) - Automatically Suggesting Diverse Example Sentences for L2 Japanese Learners Using Pre-Trained Language Models [29.400532173806834]
本研究では,L2日本語学習者を対象とした例文作成にPLM(Pre-trained Language Models)を用いることを検討した。
日本語,母語話者,GPT-4の学習者からなるラッカーのパネルを用いて,難易度,多様性,自然度などの複数の側面を考慮した文質の評価を行った。
論文 参考訳(メタデータ) (2025-06-04T05:13:05Z) - EXECUTE: A Multilingual Benchmark for LLM Token Understanding [54.70665106141121]
複数の言語にまたがるテストでは、他の言語の課題が英語のように常に文字レベルにあるとは限らないことが分かる。
また、中国語、日本語、韓国語のサブ文字タスクについても検討し、LLMの文字成分に対する理解を評価する。
論文 参考訳(メタデータ) (2025-05-23T11:56:48Z) - PolyMath: Evaluating Mathematical Reasoning in Multilingual Contexts [85.78821098963607]
PolyMathは18の言語と4つの難易度をカバーする多言語数学的推論ベンチマークである。
我々のベンチマークは、包括性、言語多様性、高品質な翻訳の難しさを保証する。
論文 参考訳(メタデータ) (2025-04-25T15:39:04Z) - Why We Build Local Large Language Models: An Observational Analysis from 35 Japanese and Multilingual LLMs [26.737806062804506]
日本語,英語,多言語LLMを19種類の評価ベンチマークで評価した。
英語のテキストによる学習は,日本語の学習者のスコアを向上できることがわかった。
日本語のコード生成、算術的推論、常識、読解作業の能力を高めるために、特に日本語のテキストを訓練することは不要である。
論文 参考訳(メタデータ) (2024-12-19T02:39:26Z) - JMMMU: A Japanese Massive Multi-discipline Multimodal Understanding Benchmark for Culture-aware Evaluation [63.83457341009046]
JMMMU(JMMMU、日本語MMMU)は、日本の文化状況に基づいて、専門家レベルのタスクでLMMを評価するために設計された、日本初の大規模ベンチマークである。
CAサブセットを用いて、日本語で評価すると、多くのLMMのパフォーマンス低下が観察される。
両サブセットを組み合わせることで,一部のLMMはCAサブセットでは良好に機能するが,CSサブセットでは機能しないことが明らかとなり,文化的理解の深みに欠ける日本語の理解が浅かった。
論文 参考訳(メタデータ) (2024-10-22T17:59:56Z) - MLaKE: Multilingual Knowledge Editing Benchmark for Large Language Models [65.10456412127405]
MLaKEは5言語にわたる知識編集手法の適応性のベンチマークである。
MLaKEは、ウィキペディアから言語にまたがるファクトチェーンを集約し、フリーフォームとマルチチョイスの両方で質問を生成する。
MLaKEにおける既存手法の多言語知識編集の一般化能力を評価する。
論文 参考訳(メタデータ) (2024-04-07T15:23:28Z) - CMMLU: Measuring massive multitask language understanding in Chinese [133.70911295934746]
本稿では, 自然科学, 社会科学, 工学, 人文科学など, さまざまな分野をカバーする総合的な中国のベンチマークを紹介する。
CMMLUは、中国語の文脈における大きな言語モデルの知識と推論能力の評価におけるギャップを埋める。
論文 参考訳(メタデータ) (2023-06-15T15:49:51Z) - Exploration of Language Dependency for Japanese Self-Supervised Speech
Representation Models [18.22157315310462]
自己教師付き学習(SSL)はモノリンガルだけでなく、言語横断的な設定でも劇的に成功している。
本稿では,単言語モデルとの比較において,言語間モデルの有効性について検討する。
日本語で収集されたラベルのないデータは、何万時間もの英語および/または多言語データで事前訓練された言語間モデルに匹敵する性能を達成するために、どの程度のラベル付きデータが必要であるかを検討する。
論文 参考訳(メタデータ) (2023-05-09T06:28:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。