論文の概要: Contrastive ESA: Human Evaluation of Multiple Translations at Once
- arxiv url: http://arxiv.org/abs/2607.26640v1
- Date: Wed, 29 Jul 2026 09:01:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.588047
- Title: Contrastive ESA: Human Evaluation of Multiple Translations at Once
- Title(参考訳): 対照的なESA: 一度に複数の翻訳の人間による評価
- Authors: Vilém Zouhar, Roman Grundkiewicz, Sara Rajaee, Parker Riley, Martin Popel, Rachel Bawden, Philipp Koehn, Marine Carpuat, Tom Kocmi,
- Abstract要約: Contrastive Error Spanを紹介します。
(cESA) ソース入力(テキスト、ビデオ、オーディオ、画像)の複数翻訳を行うプロトコル。
cESAでは、アノテータは同じ文書の複数の翻訳を見て、メジャーとマイナーのエラースパンをマークし、絶対スケールでスコアを0%から100%に割り当てる。
我々は,12モデルの日本語翻訳を人体で大規模に評価したcESAを検証し,標準点評価と比較して注釈時間と雑音の低減を実証した。
- 参考スコア(独自算出の注目度): 45.918020796451536
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Current human evaluation of machine translation typically assesses single outputs in isolation, a paradigm that suffers from high annotator noise and cost. We introduce Contrastive Error Span Annotation (cESA), a protocol that presents multiple translations of the source input (text, video, audio, image). In cESA, the annotator sees multiple translations of the same document, marks major and minor error spans, and then assigns a score from 0% to 100% on absolute scale. By allowing annotators to access the shared context across multiple outputs, cESA facilitates more consistent and efficient judgments. We validate cESA using a large-scale human evaluation of English->Japanese translations of 12 models, demonstrating reductions in annotation time and noise compared to standard pointwise evaluation. Unlike existing contrastive ranking methods, cESA yields absolute quality judgments that enable simple, interpretable non-parametric model rankings without the need for post-hoc corrections.
- Abstract(参考訳): 機械翻訳の現在の人間による評価は、通常、高いアノテータノイズとコストに悩まされるパラダイムである単一出力を分離して評価する。
本稿では,テキスト,ビデオ,音声,画像の複数翻訳を行うプロトコルであるContrastive Error Span Annotation(cESA)を紹介する。
cESAでは、アノテータは同じ文書の複数の翻訳を見て、メジャーとマイナーのエラースパンをマークし、絶対スケールでスコアを0%から100%に割り当てる。
アノテーションが複数の出力にまたがって共有コンテキストにアクセスできるようにすることで、cESAはより一貫性と効率的な判断を容易にする。
我々は,12モデルの日本語翻訳を人体で大規模に評価し,標準点評価と比較して注釈時間と雑音の低減を実証した。
既存の対照的なランキング法とは異なり、cESAは、ポストホック補正を必要とせずに、単純で解釈可能な非パラメトリックモデルランキングを可能にする絶対的な品質判断を与える。
関連論文リスト
- The Translation Tax Is Not a Scalar: A Counterfactual Audit of English-Source Cue Inheritance in Chinese Multilingual Benchmarks [1.4839450468199458]
翻訳税は、しばしばスカラーとして扱われる:翻訳されたベンチマークは、英語ソースの手がかりを保存することによってスコアをインフレさせると仮定される。
バックトランスレーションのギャップは小さく、フレキシブルであり、キュースコアのキャリブレーションはアイテムレベルの利得を予測しない。
我々は、セルごとのエビデンス、自然化プロトコル、人間QC、翻訳された多言語ベンチマーク論文の報告チェックリストをリリースする。
論文 参考訳(メタデータ) (2026-05-08T01:18:46Z) - Mitigating Translationese Bias in Multilingual LLM-as-a-Judge via Disentangled Information Bottleneck [37.780081880731096]
大規模言語モデル(LLM)は多言語評価の標準となっているが、厳密な体系的翻訳バイアスを示す。
このバイアスは (i) 英語との潜在多様体アライメントと (ii) 言語間予測可能性との急激な相関に起因している。
このバイアスを軽減するために、我々は、最小限に十分な判断クリティカルな表現を学習する堅牢な微調整フレームワークであるDIBJudgeを提案する。
論文 参考訳(メタデータ) (2026-03-11T02:55:29Z) - CLAIR-A: Leveraging Large Language Models to Judge Audio Captions [73.51087998971418]
機械生成オーディオキャプションの評価は、様々な要因を検討する必要がある複雑なタスクである。
本稿では,大規模言語モデルのゼロショット機能を活用するシンプルで柔軟なCLAIR-Aを提案する。
我々の評価では、CLAIR-Aは従来のメトリクスと比較して品質の人的判断を良く予測する。
論文 参考訳(メタデータ) (2024-09-19T17:59:52Z) - Error Span Annotation: A Balanced Approach for Human Evaluation of Machine Translation [48.080874541824436]
Error Spanを紹介します。
ESA - DAの継続的な評価と高レベルの評価を組み合わせる人間評価プロトコル。
MQM のマーキングのエラー重大度。
ESAは、高価なMQM専門家の必要なしに、同じ品質レベルでMQMよりも高速で安価なアノテーションを提供する。
論文 参考訳(メタデータ) (2024-06-17T14:20:47Z) - Using Natural Language Explanations to Rescale Human Judgments [81.66697572357477]
大規模言語モデル(LLM)を用いて順序付けアノテーションと説明を再スケールする手法を提案する。
我々は、アノテータのLikert評価とそれに対応する説明をLLMに入力し、スコア付けルーリックに固定された数値スコアを生成する。
提案手法は,合意に影響を及ぼさずに生の判断を再スケールし,そのスコアを同一のスコア付けルーリックに接する人間の判断に近づける。
論文 参考訳(メタデータ) (2023-05-24T06:19:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。