論文の概要: CzechDocs: A Multiway Parallel Dataset of Formatted Documents for Minority Languages in Czechia
- arxiv url: http://arxiv.org/abs/2606.20212v1
- Date: Thu, 18 Jun 2026 13:23:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-19 18:23:39.877199
- Title: CzechDocs: A Multiway Parallel Dataset of Formatted Documents for Minority Languages in Czechia
- Title(参考訳): CzechDocs: チェコの少数言語のためのフォーマットドキュメンテーションのマルチウェイ並列データセット
- Authors: Josef Jon, Ondřej Bojar,
- Abstract要約: CzechDocsは、フォーマットされたドキュメントのマルチウェイ並列データセットである。
チェコ語や少数言語、主にウクライナ語や英語で使われており、ベトナム語、ロシア語、その他の言語は少ない。
- 参考スコア(独自算出の注目度): 2.964978357715084
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present CzechDocs, a multiway parallel dataset of formatted documents (HTML, DOCX, and PDF) covering Czech and minority languages used in Czechia-primarily Ukrainian and English, with smaller portions of Vietnamese, Russian and other languages. The dataset is designed to support the evaluation of machine translation systems that aim to preserve document formatting during translation. We provide a comparison of the most common approaches to format-preserving machine translation on a validation subset of the dataset. This validation split, together with the evaluation toolkit, is publicly released for further research. A held-out test split will be reserved for a future shared task focused on document-level translation with formatting preservation.
- Abstract(参考訳): チェコ語、ウクライナ語、英語で使用されるチェコ語、少数言語を対象とし、ベトナム語、ロシア語、その他の言語のごく一部を対象とするマルチウェイ並列なフォーマットドキュメンテーション(HTML、DOCX、PDF)を提示する。
このデータセットは、翻訳中に文書フォーマットを保存することを目的とした機械翻訳システムの評価をサポートするように設計されている。
本稿では、データセットの検証サブセット上でのフォーマット保存機械翻訳に対する最も一般的なアプローチの比較を行う。
この検証分割と評価ツールキットは、さらなる研究のために公開されている。
保持されたテスト分割は、フォーマット保存を伴うドキュメントレベルの翻訳に焦点を当てた将来の共有タスクのために予約される。
関連論文リスト
- ForMaT: Dataset for Visually-Grounded Multilingual PDF Translation [0.27998963147546146]
ForMaT (Format-Preserving Multilingual Translation) は15言語対で3,956 PDF の並列コーパスである。
我々はK-メドイドを用いて45以上の幾何学的特徴をサンプリングし、ネストテーブルや公式のような複雑な要素をキャプチャし、視覚的に多様なPDF文書にのみフォーカスする。
論文 参考訳(メタデータ) (2026-05-15T09:50:37Z) - BabelDOC: Better Layout-Preserving PDF Translation via Intermediate Representation [9.979324579114392]
既存の文書翻訳パイプラインは言語処理とレイアウト保存の緊張に直面している。
本稿では、レイアウト保存PDF翻訳のためのIRベースのフレームワークであるBabelDOCを紹介する。
BabelDOCは、セマンティックコンテンツから視覚的なレイアウトメタデータを分離し、文書レベルの翻訳操作を可能にする。
論文 参考訳(メタデータ) (2026-05-11T16:56:44Z) - Large Language Models for the Summarization of Czech Documents: From History to the Present [2.124799222903955]
テキスト要約は、より長いテキストを、元の意味とキー情報を保存しながら、より短く一貫性のある要約に自動的に凝縮するタスクである。
これは主にチェコ固有の言語学的複雑さと高品質な注釈付きデータセットの欠如によるものである。
このギャップに対処するために、大規模言語モデル(LLM)、特にMistralとmT5の機能を活用します。
また、まずチェコ語のテキストを英語に翻訳し、それらを英語モデルで要約し、その後、要約をチェコ語に翻訳する翻訳ベースのアプローチを提案する。
論文 参考訳(メタデータ) (2025-11-24T07:40:31Z) - Large Language Models for Summarizing Czech Historical Documents and Beyond [1.4680035572775534]
要約は、重要な意味と重要な情報を保持しながら、より大きなテキストを簡潔なバージョンに短縮するタスクである。
我々はMistralやmT5といった大規模言語モデルを用いて、現代のチェコの要約データセットであるSumeCzechの最先端結果を実現している。
本稿では,チェコの歴史的文書をベースラインで要約するための,Posel od vCerchovaという新しいデータセットを紹介する。
論文 参考訳(メタデータ) (2025-08-14T06:07:49Z) - Decomposed Prompting for Machine Translation Between Related Languages
using Large Language Models [55.35106713257871]
DecoMTは、単語チャンク翻訳のシーケンスに翻訳プロセスを分解する、数発のプロンプトの新しいアプローチである。
DecoMTはBLOOMモデルよりも優れていることを示す。
論文 参考訳(メタデータ) (2023-05-22T14:52:47Z) - Understanding Translationese in Cross-Lingual Summarization [106.69566000567598]
言語間要約(MS)は、異なる対象言語で簡潔な要約を生成することを目的としている。
大規模なCLSデータを集めるために、既存のデータセットは通常、それらの生成に翻訳を伴います。
本稿では、まず、CLSデータセット構築の異なるアプローチが、異なるレベルの翻訳に結びつくことを確認する。
論文 参考訳(メタデータ) (2022-12-14T13:41:49Z) - FRMT: A Benchmark for Few-Shot Region-Aware Machine Translation [64.9546787488337]
本稿では、Few-shot Region-aware Machine Translationのための新しいデータセットと評価ベンチマークFRMTを提案する。
このデータセットは、英語からポルトガル語と中国語の2つの地域変種へのプロの翻訳で構成されている。
論文 参考訳(メタデータ) (2022-10-01T05:02:04Z) - On Cross-Lingual Retrieval with Multilingual Text Encoders [51.60862829942932]
言語間文書・文検索タスクにおける最先端多言語エンコーダの適合性について検討する。
教師なしのアドホック文と文書レベルのCLIR実験でそれらの性能をベンチマークする。
我々は、ゼロショット言語とドメイン転送CLIR実験のシリーズにおける英語関連データに基づいて、教師付き方式で微調整された多言語エンコーダの評価を行った。
論文 参考訳(メタデータ) (2021-12-21T08:10:27Z) - Zero-Shot Cross-lingual Semantic Parsing [56.95036511882921]
7つのテスト言語に対する並列データを持たないゼロショット問題として,言語間セマンティックパーシングについて検討した。
英文論理形式ペアデータのみを用いて解析知識を付加言語に転送するマルチタスクエンコーダデコーダモデルを提案する。
このシステムは、ゼロショット解析を潜時空間アライメント問題としてフレーム化し、事前訓練されたモデルを改善し、最小のクロスリンガル転送ペナルティで論理形式を生成することができる。
論文 参考訳(メタデータ) (2021-04-15T16:08:43Z) - A Parallel Evaluation Data Set of Software Documentation with Document
Structure Annotation [0.0]
データセットは英語とヒンディー語、インドネシア語、マレー語、タイ語からなる。
我々は、データセットの起源と生成、特異性、特徴、および機械翻訳結果に関する洞察を提供する。
論文 参考訳(メタデータ) (2020-08-11T06:50:23Z) - A High-Quality Multilingual Dataset for Structured Documentation
Translation [101.41835967142521]
本稿では,文書領域を対象とした高品質な多言語データセットを提案する。
エンタープライズソフトウェアプラットフォームのオンラインドキュメントからXML構造化の並列テキストセグメントを収集します。
論文 参考訳(メタデータ) (2020-06-24T02:08:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。