論文の概要: TransClean: A Benchmark for Detecting and Extracting Clean Translations from Large Language Model Outputs
- arxiv url: http://arxiv.org/abs/2609.11399v1
- Date: Thu, 10 Sep 2026 11:32:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 23:53:35.315288
- Title: TransClean: A Benchmark for Detecting and Extracting Clean Translations from Large Language Model Outputs
- Title(参考訳): TransClean: 大規模言語モデル出力からのクリーン翻訳の検出と抽出のためのベンチマーク
- Abstract要約: 大規模言語モデル (LLM) は機械翻訳にますます使われているが、その出力には翻訳そのもの以外の追加のテキストが含まれていることが多い。
我々は,22言語対 (LP) にまたがる12のLLMから790,000以上の翻訳出力を分析し,12の繰り返し雑音パターンを同定した。
観測されたパターンに基づいて、9,900対のノイズとクリーンな翻訳出力の制御されたベンチマークであるTransCleanを構築する。
- 参考スコア(独自算出の注目度): 4.506808028203914
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are increasingly used for machine translation, yet their outputs often contain additional text beyond the translation itself, such as language labels, explanations or bilingual repetitions, which we term translation noise. Despite its prevalence, this problem lacks dedicated benchmarks and systematic study. We analyze over 790,000 translation outputs from 12 LLMs across 22 language pairs (LPs) and identify 12 recurring noise patterns, which we group into formatting and content noise. Building on the observed patterns, we construct TransClean, a controlled benchmark of 9,900 pairs of noisy and clean translation outputs, comprising 8,800 synthetically generated instances and 1,100 manually curated authentic instances. We evaluate two extraction approaches on the TransClean benchmark: 1) a span-based extraction method leveraging translation quality estimation models for span detection, and 2) an LLM-based extraction method that prompts an LLM to isolate the translation. Our benchmark and analysis provide the first systematic framework to evaluate and improve the cleanliness of LLM translation outputs.
- Abstract(参考訳): 大きな言語モデル (LLM) は機械翻訳にますます使われているが、その出力には言語ラベルや説明、バイリンガルの繰り返しなど、翻訳そのもの以外の追加のテキストが含まれていることが多い。
その流行にもかかわらず、この問題には専用のベンチマークと体系的な研究が欠けている。
我々は,22言語対 (LP) にまたがる12のLLMから790,000以上の翻訳出力を分析し,12の繰り返しノイズパターンを同定し,フォーマットとコンテンツノイズに分類する。
観測されたパターンに基づいて,8,800個の合成生成インスタンスと1,100個の手作業による認証インスタンスからなる,9,900対のノイズとクリーンな翻訳出力の制御ベンチマークであるTransCleanを構築した。
我々はTransCleanベンチマークで2つの抽出手法を評価する。
1)スパン検出のための翻訳品質推定モデルを利用したスパン抽出法
2) LLMに基づく抽出法で, LLMに翻訳を分離させる。
我々のベンチマークと分析は、LLM翻訳出力のクリーンさを評価し改善する最初の体系的なフレームワークを提供する。
関連論文リスト
- Translation as a Scalable Proxy for Multilingual Evaluation [41.29816736489213]
翻訳品質だけで、モデルのより広い多言語機能を示すことができるだろうか?
翻訳性能がダウンストリームタスクの成功を示す良い指標であることに気付きました。
論文 参考訳(メタデータ) (2026-01-16T21:01:40Z) - Lost in Literalism: How Supervised Training Shapes Translationese in LLMs [51.04435855143767]
大規模言語モデル(LLM)は機械翻訳において顕著な成功を収めた。
しかし、過度にリテラルと不自然な翻訳を特徴とする翻訳は、依然として永続的な課題である。
我々は、黄金の基準を磨き、不自然なトレーニングインスタンスをフィルタリングするなど、これらのバイアスを軽減する方法を導入する。
論文 参考訳(メタデータ) (2025-03-06T12:14:45Z) - HellaSwag-Pro: A Large-Scale Bilingual Benchmark for Evaluating the Robustness of LLMs in Commonsense Reasoning [56.221060995324436]
大規模言語モデル(LLM)は、常識推論において顕著な能力を示している。
これらのモデルは、本当に常識的知識を理解しているのか、あるいは単に表現パターンを記憶しているだけなのか?
11,200のケースからなる大規模バイリンガルベンチマークであるHellaSwag-Proを紹介する。
論文 参考訳(メタデータ) (2025-02-17T03:24:02Z) - Retrieval-Augmented Machine Translation with Unstructured Knowledge [63.97706326080482]
Retrieval-augmented Generation (RAG)は、大規模言語モデル(LLM)を強化するために追加情報を導入する
機械翻訳(MT)では、従来の研究は通常、ペア化されたMTコーパスや知識グラフからコンテキスト内例を検索する。
本稿では,非構造化文書を用いた検索強化MTについて検討する。
論文 参考訳(メタデータ) (2024-12-05T17:00:32Z) - Language Models and Cycle Consistency for Self-Reflective Machine Translation [1.79487674052027]
我々は、ソース言語Aからターゲット言語Bへの複数の翻訳候補を生成し、その後、これらの候補を元の言語Aに翻訳する。
トークンレベルの精度や精度などの指標を用いて、原文と裏文の周期一貫性を評価することにより、言語Bの翻訳品質を暗黙的に推定する。
各原文に対して、翻訳候補を、原文と最適なサイクル整合性で同定し、最終回答とする。
論文 参考訳(メタデータ) (2024-11-05T04:01:41Z) - What do Large Language Models Need for Machine Translation Evaluation? [12.42394213466485]
大規模言語モデル(LLM)は、微調整された多言語事前訓練言語モデルに匹敵する結果が得られる。
本稿では,LLMの機械翻訳品質を評価するために,ソース,参照,翻訳エラー,ガイドラインなどの翻訳情報が必要であるかを検討する。
論文 参考訳(メタデータ) (2024-10-04T09:50:45Z) - TasTe: Teaching Large Language Models to Translate through Self-Reflection [82.83958470745381]
大規模言語モデル(LLM)は、様々な自然言語処理タスクにおいて顕著な性能を示した。
本稿では,自己回帰を通した翻訳を行うTasTeフレームワークを提案する。
WMT22ベンチマークにおける4つの言語方向の評価結果から,既存の手法と比較して,提案手法の有効性が示された。
論文 参考訳(メタデータ) (2024-06-12T17:21:21Z) - Building Accurate Translation-Tailored LLMs with Language Aware Instruction Tuning [57.323716555996114]
オフターゲット翻訳は、特に低リソース言語では未解決の問題である。
最近の研究は、翻訳命令の機能を強調するために高度なプロンプト戦略を設計するか、LLMの文脈内学習能力を活用している。
本研究では,LLMの命令追従能力(特に翻訳方向)を向上させるために,2段階の微調整アルゴリズムを設計する。
論文 参考訳(メタデータ) (2024-03-21T13:47:40Z) - Multilingual Machine Translation with Large Language Models: Empirical Results and Analysis [103.89753784762445]
大規模言語モデル(LLM)は多言語機械翻訳(MMT)の処理において顕著な可能性を示した。
本稿では, MMT における LLM の利点と課題を体系的に検討する。
また,ChatGPTとGPT-4を含む8つのLLMを徹底的に評価した。
論文 参考訳(メタデータ) (2023-04-10T15:51:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。