論文の概要: APEX-VW: A Document-Level English-Spanish Post-Editing Dataset in the Healthcare Domain
- arxiv url: http://arxiv.org/abs/2608.08059v1
- Date: Sat, 08 Aug 2026 10:54:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.629202
- Title: APEX-VW: A Document-Level English-Spanish Post-Editing Dataset in the Healthcare Domain
- Title(参考訳): APEX-VW: 医療領域における英語とスペイン語の編集後データセット
- Abstract要約: 機械翻訳(MT)出力のポスト編集(PE)は、しばしば多くのセグメントで同じ語彙的・用語的修正を繰り返す。
本稿では、最近のNHSバーチャルワード文書とプロ翻訳をTrados Studioで構築した、英語とスペイン語の新たなオープンデータセットであるAPEX-VW Corpusを提案する。
WMT APE corpora、eSCAPE、MLQE-PE、LangMarkといった以前のリソースとは異なり、データセットはドキュメントの順序とCAT-toolコンテキストを保存する。
- 参考スコア(独自算出の注目度): 7.333648670424977
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Post-Editing (PE) of Machine Translation (MT) output often involves repeating the same lexical and terminological corrections across many segments, especially in specialised and highly repetitive documents. Despite substantial work on Automatic Post-Editing (APE), most available corpora operate at the sentence level, others are synthetic, and overall not designed to study how corrections propagate in realistic Computer-Assisted Translation (CAT) workflows. This paper presents the APEX-VW (Automatic Post-Editing eXperiments on Virtual Wards) Corpus, a new open English-Spanish (EN-ES) dataset built from recent NHS virtual-ward documents and professional PE in Trados Studio, with controlled MT, terminology, and quality assurance settings. The corpus contains seven document-coherent source texts totalling 42k words, translated with four MT systems representing different paradigms and then post-edited by professional translators. Unlike prior resources such as WMT APE corpora, eSCAPE, MLQE-PE, or LangMark, the dataset preserves document order and CAT-tool context, making it suitable for research on terminology normalisation, correction propagation, and human-in-the-loop translation support. The paper describes the corpus design, data preparation, PE setup, and initial corpus statistics, and positions the resource as a benchmark for document-level APE and propagation-aware assistive tools.
- Abstract(参考訳): 機械翻訳(MT)出力のポスト編集(PE)は、しばしば多くのセグメント、特に特殊化され、非常に反復的な文書において、同じ語彙的および用語的修正を繰り返す。
オートマチック・ポスト編集(APE)に関するかなりの研究にもかかわらず、ほとんどのコーパスは文レベルで動作しており、その他のコーパスは合成であり、実際のコンピュータ支援翻訳(CAT)のワークフローにおいてどのように修正が伝播するかを研究するために設計されていない。
本稿では,最新のNHS仮想ワード文書とTrados StudioのプロフェッショナルPEから構築されたオープン・イングリッシュ・スパニッシュ(EN-ES)データセットであるAPEX-VWコーパスについて述べる。
コーパスには、合計42kワードの文書コヒーレントな7つのテキストが含まれ、異なるパラダイムを表す4つのMTシステムで翻訳され、その後プロの翻訳者によって後編集される。
WMT APE corpora、eSCAPE、MLQE-PE、LangMarkといった以前のリソースとは異なり、データセットは文書の順序とCAT-toolコンテキストを保存し、用語の正規化、修正の伝播、そして人間のループ翻訳サポートの研究に適している。
本稿では、コーパス設計、データ準備、PE設定、初期コーパス統計について記述し、文書レベルのAPEおよび伝播対応支援ツールのベンチマークとして位置づける。
関連論文リスト
- BabelDOC: Better Layout-Preserving PDF Translation via Intermediate Representation [9.979324579114392]
既存の文書翻訳パイプラインは言語処理とレイアウト保存の緊張に直面している。
本稿では、レイアウト保存PDF翻訳のためのIRベースのフレームワークであるBabelDOCを紹介する。
BabelDOCは、セマンティックコンテンツから視覚的なレイアウトメタデータを分離し、文書レベルの翻訳操作を可能にする。
論文 参考訳(メタデータ) (2026-05-11T16:56:44Z) - LexMatcher: Dictionary-centric Data Collection for LLM-based Machine Translation [67.24113079928668]
本稿では、バイリンガル辞書に見られる感覚のカバレッジによって駆動されるデータキュレーション手法であるLexMatcherを提案する。
我々の手法は、WMT2022テストセットの確立されたベースラインよりも優れています。
論文 参考訳(メタデータ) (2024-06-03T15:30:36Z) - Identifying Context-Dependent Translations for Evaluation Set Production [11.543673351369183]
文脈対応機械翻訳への移行に対する大きな障害は、優れた評価指標とテストセットがないことである。
我々は,5つの現象を翻訳するために文脈を必要とする文を含む並列文書のサブセットを識別するツールであるCTXPROを開発した。
パイプラインへの入力は、文脈的な文ペアを選択する手作り、言語ごと、言語的にインフォームドされたルールのセットである。
論文 参考訳(メタデータ) (2023-11-04T04:29:08Z) - Understanding Translationese in Cross-Lingual Summarization [106.69566000567598]
言語間要約(MS)は、異なる対象言語で簡潔な要約を生成することを目的としている。
大規模なCLSデータを集めるために、既存のデータセットは通常、それらの生成に翻訳を伴います。
本稿では、まず、CLSデータセット構築の異なるアプローチが、異なるレベルの翻訳に結びつくことを確認する。
論文 参考訳(メタデータ) (2022-12-14T13:41:49Z) - A Bilingual Parallel Corpus with Discourse Annotations [82.07304301996562]
本稿では,Jiang et al. (2022)で最初に導入された大きな並列コーパスであるBWBと,注釈付きテストセットについて述べる。
BWBコーパスは、専門家によって英語に翻訳された中国の小説で構成されており、注釈付きテストセットは、様々な談話現象をモデル化する機械翻訳システムの能力を調査するために設計されている。
論文 参考訳(メタデータ) (2022-10-26T12:33:53Z) - FDMT: A Benchmark Dataset for Fine-grained Domain Adaptation in Machine
Translation [53.87731008029645]
機械翻訳(FDMT)における実世界のきめ細かいドメイン適応タスクを提案する。
FDMTデータセットは、自動運転車、AI教育、リアルタイムネットワーク、スマートフォンの4つのサブドメインで構成されている。
この新しい設定で定量的な実験と深い分析を行い、きめ細かいドメイン適応タスクをベンチマークします。
論文 参考訳(メタデータ) (2020-12-31T17:15:09Z) - MLQE-PE: A Multilingual Quality Estimation and Post-Editing Dataset [49.602565530704005]
データセットには11の言語ペアが含まれており、人間のラベルは1つの言語ペアに1万の翻訳が可能である。
また、後編集された文章や、文章が抽出された記事のタイトルや、テキストの翻訳に使用されるニューラルMTモデルも含んでいる。
論文 参考訳(メタデータ) (2020-10-09T10:12:02Z) - A High-Quality Multilingual Dataset for Structured Documentation
Translation [101.41835967142521]
本稿では,文書領域を対象とした高品質な多言語データセットを提案する。
エンタープライズソフトウェアプラットフォームのオンラインドキュメントからXML構造化の並列テキストセグメントを収集します。
論文 参考訳(メタデータ) (2020-06-24T02:08:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。