論文の概要: Span-Level Machine Translation Meta-Evaluation
- arxiv url: http://arxiv.org/abs/2603.19921v1
- Date: Fri, 20 Mar 2026 13:08:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 19:48:39.144386
- Title: Span-Level Machine Translation Meta-Evaluation
- Title(参考訳): スパンレベル機械翻訳メタ評価
- Authors: Stefano Perrella, Eric Morales Agostinho, Hugo Zaragoza,
- Abstract要約: 近年,機械翻訳(MT)と自動MT評価が劇的に改善している。
エラー検出を行う自動評価器の評価能力を確実に評価する方法は、まだ不明である。
本研究では,スパンレベル精度,リコール,Fスコアの異なる実装について検討する。
- 参考スコア(独自算出の注目度): 1.4760888896095816
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Machine Translation (MT) and automatic MT evaluation have improved dramatically in recent years, enabling numerous novel applications. Automatic evaluation techniques have evolved from producing scalar quality scores to precisely locating translation errors and assigning them error categories and severity levels. However, it remains unclear how to reliably measure the evaluation capabilities of auto-evaluators that do error detection, as no established technique exists in the literature. This work investigates different implementations of span-level precision, recall, and F-score, showing that seemingly similar approaches can yield substantially different rankings, and that certain widely-used techniques are unsuitable for evaluating MT error detection. We propose "match with partial overlap and partial credit" (MPP) with micro-averaging as a robust meta-evaluation strategy and release code for its use publicly. Finally, we use MPP to assess the state of the art in MT error detection.
- Abstract(参考訳): 近年,機械翻訳(MT)と自動MT評価が飛躍的に向上し,多くの新しい応用が可能となった。
自動評価技術は、スカラー品質スコアの生成から、翻訳エラーの正確な位置付け、エラーカテゴリと重大度レベルの割り当てまで進化してきた。
しかし、文献に確立された技術が存在しないため、誤り検出を行う自動評価器の評価能力を確実に評価する方法は定かではない。
本研究は、スパンレベルの精度、リコール、Fスコアの異なる実装について検討し、類似したアプローチにより、かなり異なるランク付けが得られること、また、特定の広く使われている手法がMTエラー検出に適さないこと、を示す。
本稿では,メタ評価戦略として「部分的オーバーラップと部分的クレジットによるマッチング (MPP) 」を提案する。
最後に,MPPを用いてMT誤り検出の最先端性を評価する。
関連論文リスト
- Beyond Literal Mapping: Benchmarking and Improving Non-Literal Translation Evaluation [57.11989521509119]
本稿では,特殊なサブエージェントを起動するリフレクティブコアエージェントを中心に,エージェント翻訳評価フレームワークを提案する。
実験の結果、RATEの有効性が示され、現在の測定値と比較して少なくとも3.2メタスコアの改善が達成された。
論文 参考訳(メタデータ) (2026-01-12T09:03:42Z) - HiMATE: A Hierarchical Multi-Agent Framework for Machine Translation Evaluation [39.7293877954587]
HiMATEは機械翻訳評価のための階層型マルチエージェントフレームワークである。
MQMエラー型に基づく階層型マルチエージェントシステムを構築し,サブタイプエラーの詳細な評価を可能にする。
経験的に、HiMATEは、人間によるアライメント評価の実行において、さまざまなデータセット間の競争ベースラインよりも優れています。
論文 参考訳(メタデータ) (2025-05-22T06:24:08Z) - The Devil is in the Errors: Leveraging Large Language Models for
Fine-grained Machine Translation Evaluation [93.01964988474755]
AutoMQMは,大規模な言語モデルに対して,翻訳におけるエラーの識別と分類を求めるプロンプト技術である。
テキスト内学習と微調整によるラベル付きデータの影響について検討する。
次に, PaLM-2モデルを用いてAutoMQMを評価し, スコアのプロンプトよりも性能が向上することがわかった。
論文 参考訳(メタデータ) (2023-08-14T17:17:21Z) - Error Analysis Prompting Enables Human-Like Translation Evaluation in Large Language Models [57.80514758695275]
機械翻訳(MT)の品質を評価するために,大規模言語モデル(LLM)を用いることで,システムレベルでの最先端のパフォーマンスを実現する。
我々はtextbftexttError Analysis Prompting (EAPrompt) と呼ばれる新しいプロンプト手法を提案する。
本手法は,多次元品質指標 (MQM) とtextitproduces を用いて,システムレベルとセグメントレベルの両方で説明可能かつ信頼性の高いMT評価を行う。
論文 参考訳(メタデータ) (2023-03-24T05:05:03Z) - Extrinsic Evaluation of Machine Translation Metrics [78.75776477562087]
文レベルでの翻訳と翻訳の良さを区別する上で,自動尺度が信頼性が高いかどうかは不明である。
我々は,3つの下流言語タスクにおいて,最も広く使用されているMTメトリクス(chrF,COMET,BERTScoreなど)のセグメントレベル性能を評価する。
実験の結果,各指標は下流結果の外部評価と負の相関を示すことがわかった。
論文 参考訳(メタデータ) (2022-12-20T14:39:58Z) - Scientific Credibility of Machine Translation Research: A
Meta-Evaluation of 769 Papers [21.802259336894068]
本稿では,機械翻訳(MT)の大規模メタ評価について述べる。
われわれは2010年から2020年にかけて769件の研究論文でMT評価を行った。
論文 参考訳(メタデータ) (2021-06-29T09:30:17Z) - Tangled up in BLEU: Reevaluating the Evaluation of Automatic Machine
Translation Evaluation Metrics [64.88815792555451]
評価法は, 評価に用いる翻訳に非常に敏感であることを示す。
本研究では,人的判断に対する自動評価基準の下で,性能改善をしきい値にする方法を開発した。
論文 参考訳(メタデータ) (2020-06-11T09:12:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。