論文の概要: The Blindness of Document-Level Translation Evaluation
- arxiv url: http://arxiv.org/abs/2609.05949v1
- Date: Sat, 05 Sep 2026 07:33:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 12:12:39.198122
- Title: The Blindness of Document-Level Translation Evaluation
- Title(参考訳): 文書レベル翻訳評価の盲点
- Abstract要約: 文書レベルの機械翻訳評価は、アノテータに全文書を提示することでセグメントレベルのプロトコルを拡張する。
この仮定を、各文書が異なるシステムから引き出されたセグメントを結合する対実条件で検証する。
18,420人を超える専門家のEnglis-to-Koreanアノテーションと14の自動メトリクス、スコア、システムランキング、エラーアノテーションは、一貫性のない文書と一貫性のない文書の間に統計的に等価である。
- 参考スコア(独自算出の注目度): 22.116587548254042
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Document-level machine translation (MT) evaluation extends segment-level protocols by presenting full documents to annotators, on the assumption that such presentation elicits document-level judgments. We test this assumption with a counterfactual condition (MIX) in which each document combines segments drawn from different systems, preserving document-level presentation while breaking cross-segment consistency. Across 18,420 expert Englis-to-Korean annotations and 14 automatic metrics, scores, system rankings, and error annotations are statistically equivalent between coherent and incoherent documents. Perception does not explain this: shown matched passages, raters identify the coherent one as the work of a single translator in 87.3% of trials. Document presentation does change how annotators work, but that change does not reach the recorded output. What is blind is the protocol, not the annotator. The concern is not that scores fall short, but that the resources invested in document-level systems, metrics, and annotation may not be measuring what they are intended to measure.
- Abstract(参考訳): 文書レベルの機械翻訳 (MT) の評価は、文書レベルの判断を引き出すという仮定に基づいて、アノテータに全文書を提示することでセグメントレベルのプロトコルを拡張する。
この仮定は、各文書が異なるシステムから引き出されたセグメントを結合し、横断的な一貫性を破りながら文書レベルの表示を保ちながら、逆実数条件(MIX)で検証する。
18,420人を超える専門家のEnglis-to-Koreanアノテーションと14の自動メトリクス、スコア、システムランキング、エラーアノテーションは、一貫性のない文書と一貫性のない文書の間に統計的に等価である。
一致した通路を示すラッカーは、87.3%の試験において、コヒーレントなパスを単一の翻訳者の作業とみなす。
ドキュメントの表示はアノテーションの動作方法を変えるが、その変更は記録された出力に到達しない。
盲目なのはプロトコルであり、アノテーションではない。
懸念は、スコアが短くなるのではなく、ドキュメントレベルのシステム、メトリクス、アノテーションに投資するリソースが、測定対象を測ることではないかもしれないということです。
関連論文リスト
- MPDocBench-Parse: Benchmarking Practical Multi-page Document Parsing [74.84107522458798]
MPDocBench-Parseは、現実世界のアプリケーションにおけるマルチページ文書解析のためのベンチマークである。
433の注釈付き文書に3,246ページあり、英語と中国語の15種類の文書を網羅しており、レイアウトは様々である。
論文 参考訳(メタデータ) (2026-05-21T07:36:41Z) - Extending Automatic Machine Translation Evaluation to Book-Length Documents [69.84659107448768]
SEGALEは、既存の自動メトリクスを長期文書翻訳に拡張する評価スキームである。
提案手法では,文書レベルの評価が従来不可能であった。
実験の結果,提案手法は既存の長文文書評価方式よりも大幅に優れていた。
論文 参考訳(メタデータ) (2025-09-21T21:46:58Z) - The Medium Is Not the Message: Deconfounding Document Embeddings via Linear Concept Erasure [98.71456610527598]
埋め込みベースの類似度メトリクスは、テキストのソースや言語のような刺激的な属性に影響される可能性がある。
本稿では,エンコーダ表現から観測された共同創設者に関する情報を除去するデバイアスアルゴリズムにより,これらのバイアスを最小の計算コストで大幅に低減することを示す。
論文 参考訳(メタデータ) (2025-07-01T23:17:12Z) - OmniDocBench: Benchmarking Diverse PDF Document Parsing with Comprehensive Annotations [22.336858733121158]
OmniDocBenchは9つのドキュメントソースにまたがる高品質なアノテーションを特徴とする新しいベンチマークです。
パイプラインベースの手法とエンドツーエンドのビジョン言語モデルの両方を徹底的に評価する。
論文 参考訳(メタデータ) (2024-12-10T16:05:56Z) - Fine-Grained and Multi-Dimensional Metrics for Document-Level Machine Translation [15.987448306012167]
大規模言語モデル(LLM)は機械翻訳(MT)を含む様々なNLPタスクに優れている。
本研究は,文書レベル翻訳(docMT)における命令調整型LLMの本質的能力について検討する。
論文 参考訳(メタデータ) (2024-10-28T11:49:58Z) - SLIDE: Reference-free Evaluation for Machine Translation using a Sliding Document Window [24.524282909076767]
本稿では,文ブロックで動作するSLIDE(SLIding Document Evaluator)というメトリクスを提案する。
SLIDEは文レベルベースラインよりもペアワイズシステムの精度がかなり高いことがわかった。
このことは、ソースの曖昧さを曖昧にするために、ソースコンテキストが人間の参照と同じ情報を提供する可能性があることを示唆している。
論文 参考訳(メタデータ) (2023-09-16T01:30:58Z) - End-to-End Page-Level Assessment of Handwritten Text Recognition [69.55992406968495]
HTRシステムは、文書のエンドツーエンドのページレベルの書き起こしに直面している。
標準メトリクスは、現れる可能性のある不整合を考慮していない。
本稿では、転写精度とROの良さを別々に検討する2つの評価法を提案する。
論文 参考訳(メタデータ) (2023-01-14T15:43:07Z) - BlonD: An Automatic Evaluation Metric for Document-level
MachineTranslation [47.691277066346665]
文書レベルの機械翻訳評価のための自動メトリクスBlonDを提案する。
BlonDは、チェックポイントフレーズやタグのリコールと距離を計算することで、談話のコヒーレンスを考慮に入れている。
論文 参考訳(メタデータ) (2021-03-22T14:14:58Z) - Multilevel Text Alignment with Cross-Document Attention [59.76351805607481]
既存のアライメントメソッドは、1つの事前定義されたレベルで動作します。
本稿では,文書を文書間注目要素で表現するための階層的アテンションエンコーダを予め確立した新しい学習手法を提案する。
論文 参考訳(メタデータ) (2020-10-03T02:52:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。