論文の概要: Evaluating the Robustness of Japanese LLMs to IME-Related and Typographical Errors
- arxiv url: http://arxiv.org/abs/2610.01241v1
- Date: Thu, 01 Oct 2026 07:40:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.971729
- Title: Evaluating the Robustness of Japanese LLMs to IME-Related and Typographical Errors
- Title(参考訳): 日本語LLMの時間的・タイポグラフィ的誤りに対するロバスト性の評価
- Abstract要約: 本稿では,文字変換,文字置換,ホモフォン変換,日本語IME変換,フル幅変換の5種類を紹介する。
これらの摂動は、日本の3つのベンチマークデータセット(JMMLU、JCommonsenseQA、JamC-QA)に適用される。
その結果, 文字変換と文字置換はベンチマーク間で常に精度を低下させるが, IME変換, Full-Width Conversion, およびHomophone Conversionは比較的限定的であることがわかった。
- 参考スコア(独自算出の注目度): 0.21485350418225238
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) have achieved strong performance across various natural language processing tasks. However, their robustness to typographical errors remains underexplored, particularly in Japanese, where text input involves multiple writing systems and IME-based conversion. In this study, we evaluate the robustness of Japanese LLMs against realistic Japanese-specific typos. We introduce five typo categories: Character Transposition, Character Replacement, Homophone Conversion, Japanese IME Conversion, and Full-Width Conversion. These perturbations are applied to three Japanese benchmark datasets (JMMLU, JCommonsenseQA, and JamC-QA), and eleven Japanese and multilingual LLMs are evaluated. The results show that Character Transposition and Character Replacement typos consistently reduce accuracy across benchmarks, whereas IME Conversion, Full-Width Conversion, and Homophone Conversion have relatively limited impact. These findings reveal that current Japanese LLMs remain vulnerable to realistic Japanese typing errors, particularly those that substantially distort the original input, highlighting the importance of robustness evaluation in practical input environments.
- Abstract(参考訳): 大規模言語モデル(LLM)は、様々な自然言語処理タスクで高いパフォーマンスを実現している。
しかし、タイポグラフィ的誤りに対する頑健さは、特に日本語では、テキスト入力には複数の書記システムとIMEベースの変換が含まれる。
本研究では, 現実的な日本語型に対する日本語LLMのロバスト性を評価する。
本稿では,文字変換,文字置換,ホモフォン変換,日本語IME変換,フル幅変換の5種類を紹介する。
これらの摂動を3つの日本語ベンチマークデータセット(JMMLU,JCommonsenseQA,JamC-QA)に適用し,11個の日本語および多言語LLMを評価した。
その結果, 文字変換と文字置換はベンチマーク間で常に精度を低下させるが, IME変換, Full-Width Conversion, およびHomophone Conversionは比較的限定的であることがわかった。
これらの結果から,現在の日本語LLMは,実際の入力環境における強靭性評価の重要性を浮き彫りにしており,特に原入力を著しく歪めているものに対して脆弱であることが明らかとなった。
関連論文リスト
- A Study on the Impact of Natural Language Differences in Prompts on Automatic Code Generation Using LLMs [37.09127555664535]
本研究の目的は、入力の自然言語がLLMベースのコード生成性能にどのように影響するかを定量化することである。
コード生成における言語バイアスを定量化するために、各問題は英語、日本語、中国語で表される。
本研究では,翻訳前後の精度を比較し,翻訳の有効性を緩和戦略として評価する。
論文 参考訳(メタデータ) (2026-09-16T08:32:09Z) - Evaluating Multilingual Sentence Embeddings for Translation Error Detection:An English--Greek Contrastive Study [0.0]
本研究は,多言語埋め込みモデルが正しい英語-ギリシャ語翻訳を区別できるかどうかを考察する。
10コアに1,850のサンプルと5つの探索エラーカテゴリが含まれている。
埋め込みモデルは、テンソル・アンド・アスペクトや代名詞・基準誤差よりも明確な事実・語彙的変化を確実に検出した。
論文 参考訳(メタデータ) (2026-08-28T18:32:54Z) - Beyond Literal Mapping: Benchmarking and Improving Non-Literal Translation Evaluation [57.11989521509119]
本稿では,特殊なサブエージェントを起動するリフレクティブコアエージェントを中心に,エージェント翻訳評価フレームワークを提案する。
実験の結果、RATEの有効性が示され、現在の測定値と比較して少なくとも3.2メタスコアの改善が達成された。
論文 参考訳(メタデータ) (2026-01-12T09:03:42Z) - Lost in Literalism: How Supervised Training Shapes Translationese in LLMs [51.04435855143767]
大規模言語モデル(LLM)は機械翻訳において顕著な成功を収めた。
しかし、過度にリテラルと不自然な翻訳を特徴とする翻訳は、依然として永続的な課題である。
我々は、黄金の基準を磨き、不自然なトレーニングインスタンスをフィルタリングするなど、これらのバイアスを軽減する方法を導入する。
論文 参考訳(メタデータ) (2025-03-06T12:14:45Z) - MQM-APE: Toward High-Quality Error Annotation Predictors with Automatic Post-Editing in LLM Translation Evaluators [53.91199933655421]
大規模言語モデル(LLM)は、機械翻訳(MT)の品質評価の裁判官として大きな可能性を秘めている。
非インパクト的なエラーをフィルタリングするアイデアに基づいて、ユニバーサルでトレーニング不要なフレームワークである$textbfMQM-APEを紹介します。
実験の結果,GEMBA-MQMに対する誤差の信頼性と品質の両方が一貫して改善されていることがわかった。
論文 参考訳(メタデータ) (2024-09-22T06:43:40Z) - Full-text Error Correction for Chinese Speech Recognition with Large Language Model [11.287933170894311]
大言語モデル(LLM)は自動音声認識(ASR)における誤り訂正の可能性を示している
本稿では,より長い音声記録からASRシステムによって生成された全文における誤り訂正のためのLLMの有効性について検討する。
論文 参考訳(メタデータ) (2024-09-12T06:50:45Z) - Machine Translation Meta Evaluation through Translation Accuracy
Challenge Sets [92.38654521870444]
ACESは146の言語ペアにまたがる対照的な課題セットです。
このデータセットは、メトリクスが68の翻訳精度の誤差を識別できるかどうかを調べることを目的としている。
我々は、WMT2022および2023のメトリクス共有タスクに提出された50のメトリクスに対して、ACESをベンチマークすることで、大規模な研究を行う。
論文 参考訳(メタデータ) (2024-01-29T17:17:42Z) - CSCD-NS: a Chinese Spelling Check Dataset for Native Speakers [62.61866477815883]
CSCD-NSは中国初のネイティブ話者向けスペルチェックデータセットである。
CSCD-NSはスケールが10倍大きく、誤差分布が異なる。
本稿では,入力過程をシミュレーションする新しい手法を提案する。
論文 参考訳(メタデータ) (2022-11-16T09:25:42Z) - DEMETR: Diagnosing Evaluation Metrics for Translation [21.25704103403547]
我々は、英語31K例の診断データセットであるDEMETRをリリースする。
学習指標はDEMETRの文字列ベースの指標よりもかなり優れていることがわかった。
論文 参考訳(メタデータ) (2022-10-25T03:25:44Z) - Curious Case of Language Generation Evaluation Metrics: A Cautionary
Tale [52.663117551150954]
イメージキャプションや機械翻訳などのタスクを評価するデファクトメトリクスとして、いくつかの一般的な指標が残っている。
これは、使いやすさが原因でもあり、また、研究者がそれらを見て解釈する方法を知りたがっているためでもある。
本稿では,モデルの自動評価方法について,コミュニティにより慎重に検討するよう促す。
論文 参考訳(メタデータ) (2020-10-26T13:57:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。