論文の概要: Do Evaluation Metrics Detect Errors in Classical Chinese to English Translations?
- arxiv url: http://arxiv.org/abs/2608.08283v1
- Date: Sat, 08 Aug 2026 18:28:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.758688
- Title: Do Evaluation Metrics Detect Errors in Classical Chinese to English Translations?
- Title(参考訳): 評価基準は古典中国語から英語への翻訳における誤りを検出するか?
- Authors: Osvaldo Quinjica, Eric Bennett, Xinchen Yang, Andrew Schonebaum, Marine Carpuat,
- Abstract要約: 学術利用において有効な誤りタイプを捕捉する最小ペアに基づく診断フレームワークを提案する。
すべてのメトリクスが盲点を示すのが分かりますが、MetricX24は全体として最も優れています。
- 参考スコア(独自算出の注目度): 13.334308240256364
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Although large language models can translate some historical languages surprisingly well, their usefulness in digital humanities workflows is limited by the lack of reliable evaluation. We investigate whether existing automatic evaluation metrics developed for modern languages are reliable in this setting, using translation from Classical Chinese to English as a test case. We introduce a diagnostic framework based on minimal pairs capturing error types salient in scholarly use, probing both reference-based and reference-free metrics for error sensitivity and tolerance to valid variation. We find that all metrics exhibit blind spots, however MetricX24 performs best overall. Our findings highlight the need for more robust and interpretable metrics for historically and culturally distinct translation settings.
- Abstract(参考訳): 大規模な言語モデルでは、いくつかの歴史的言語を驚くほどうまく翻訳することができるが、デジタル・ヒューマニティ・ワークフローにおけるそれらの有用性は信頼性の欠如によって制限されている。
本稿では,古典中国語から英語への翻訳をテストケースとして用いて,現代言語向けに開発された既存の自動評価指標が信頼性が高いかを検討する。
学術的利用において有効な誤りタイプを捕捉する最小のペアに基づく診断フレームワークを導入し、エラー感度と有効変動に対する耐性の基準ベースと基準フリーの指標の両方を探索する。
すべてのメトリクスが盲点を示すのが分かりますが、MetricX24は全体として最も優れています。
この結果は、歴史的、文化的に異なる翻訳設定のための、より堅牢で解釈可能なメトリクスの必要性を浮き彫りにした。
関連論文リスト
- XQ-MEval: A Dataset with Cross-lingual Parallel Quality for Benchmarking Translation Metrics [64.77152900881724]
9つの翻訳方向をカバーする半自動構築データセットであるXQ-MEvalを提案する。
MQMで定義されたエラーを金の翻訳に自動的に注入し、信頼性のためにネイティブスピーカーによってフィルタリングし、エラーをマージして、制御可能な品質で擬似翻訳を生成する。
XQ-MEvalを用いて, 平均的判断と人的判断の矛盾を明らかにする。
論文 参考訳(メタデータ) (2026-04-16T12:27:10Z) - Testing the Limits of Machine Translation from One Book [0.0]
現在の最先端モデルは、コンテキスト内学習を活用して、以前は目に見えない言語コンテキストに変換する能力を示している。
話者数が多いにも関わらず、最小限のデジタルリソースを持つ言語であるKanuriに焦点を当てる。
論文 参考訳(メタデータ) (2025-08-08T19:27:44Z) - A Benchmark for Evaluating Machine Translation Metrics on Dialects
Without Standard Orthography [40.04973667048665]
非標準方言の指標がいかに堅牢かを評価する。
我々は、英語から2つのスイスドイツ語方言への自動機械翻訳のための、人間の翻訳と人間の判断のデータセットを収集する。
論文 参考訳(メタデータ) (2023-11-28T15:12:11Z) - xCOMET: Transparent Machine Translation Evaluation through Fine-grained
Error Detection [21.116517555282314]
xCOMETは、機械翻訳評価アプローチのギャップを埋めるために設計されたオープンソースの学習メトリクスである。
文レベルの評価とエラースパン検出機能を統合し、あらゆるタイプの評価で最先端のパフォーマンスを示す。
また,ストレステストによるロバストネス解析を行い,xCOMETは局所的な臨界誤差や幻覚を同定できることを示す。
論文 参考訳(メタデータ) (2023-10-16T15:03:14Z) - On the Blind Spots of Model-Based Evaluation Metrics for Text Generation [79.01422521024834]
テキスト生成評価指標のロバスト性分析に有用であるが,しばしば無視される手法を探索する。
我々は、幅広い潜在的な誤差を設計、合成し、それらが測定値の余計な低下をもたらすかどうかを確認する。
私たちの実験では、既存のメトリクスの興味深い不感、バイアス、あるいは抜け穴が明らかになりました。
論文 参考訳(メタデータ) (2022-12-20T06:24:25Z) - DEMETR: Diagnosing Evaluation Metrics for Translation [21.25704103403547]
我々は、英語31K例の診断データセットであるDEMETRをリリースする。
学習指標はDEMETRの文字列ベースの指標よりもかなり優れていることがわかった。
論文 参考訳(メタデータ) (2022-10-25T03:25:44Z) - Curious Case of Language Generation Evaluation Metrics: A Cautionary
Tale [52.663117551150954]
イメージキャプションや機械翻訳などのタスクを評価するデファクトメトリクスとして、いくつかの一般的な指標が残っている。
これは、使いやすさが原因でもあり、また、研究者がそれらを見て解釈する方法を知りたがっているためでもある。
本稿では,モデルの自動評価方法について,コミュニティにより慎重に検討するよう促す。
論文 参考訳(メタデータ) (2020-10-26T13:57:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。