論文の概要: HardMTBench: Stress-Testing Chinese-English Translation on Knowledge-Intensive Domains
- arxiv url: http://arxiv.org/abs/2605.28315v1
- Date: Wed, 27 May 2026 11:16:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:55.996602
- Title: HardMTBench: Stress-Testing Chinese-English Translation on Knowledge-Intensive Domains
- Title(参考訳): HardMTBench: 知識集約ドメインのストレステスト中国語翻訳
- Authors: Zheng Li, Mao Zheng, Mingyang Song, Tianxiang Fei,
- Abstract要約: 汎用機械翻訳ベンチマークは、中国語と英語のペアで飽和状態に達した。
本稿では、中国語と英語の双方向翻訳のための難易度診断ベンチマークであるHardMTBenchを紹介する。
- 参考スコア(独自算出の注目度): 19.936101141860036
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: General-purpose machine translation benchmarks such as FLORES-200 have reached a saturation regime on Chinese-English pairs, where modern large language models cluster within a narrow band of high scores. Across 22 systems, FLORES-200 zh-en GEMBA scores fall in a 7.87-point range with a standard deviation of 2.29, which compresses the separation between systems on knowledge-intensive domains such as finance, healthcare, law, and science and technology. We introduce HardMTBench, a difficulty-aware diagnostic benchmark for bidirectional Chinese-English domain translation. HardMTBench covers 12 domains and contains 10,000 hand-curated source sentences with reference translations, packaged as 20,000 directional test items. A three-stage construction pipeline builds a domain-balanced candidate pool of 84{,}566 pairs, applies an LLM-based multi-signal judge over knowledge density, translation difficulty, terminology load and reference correctness, and assembles the final test set under a hardness fusion rule with per-domain quotas. Across 22 systems spanning general LLMs, commercial engines and specialised MT models, HardMTBench widens the cross-system GEMBA range by roughly a factor of two over FLORES-200, induces visible rank reorderings, and exposes domain-specific terminology and knowledge weaknesses that quality-only metrics tend to flatten. All data and code are open-sourced at https://github.com/jasonNLP/HardMTBench.
- Abstract(参考訳): FLORES-200のような汎用機械翻訳ベンチマークは、中国語と英語のペアにおいて飽和状態に達し、現代の大規模言語モデルは、高いスコアの狭い帯域内にクラスタ化されている。
22のシステムにおいて、FLORES-200 zh-en GEMBAのスコアは7.87ポイントの範囲にあり、標準偏差は2.29であり、金融、医療、法律、科学技術といった知識集約領域におけるシステム間の分離を圧縮している。
本稿では、中国語と英語の双方向翻訳のための難易度診断ベンチマークであるHardMTBenchを紹介する。
HardMTBenchは12のドメインをカバーし、20,000の方向テストアイテムとしてパッケージされた参照翻訳付き手書きのソース文1万を格納している。
3段構成パイプラインは、84{,}566対のドメインバランス候補プールを構築し、知識密度、翻訳難易度、用語の負荷、参照正しさについてLLMベースの多信号判定を適用し、ドメインあたりのクォータによる硬度融合ルールの下で最終テストセットを組み立てる。
一般のLLM、商用エンジン、特殊MTモデルにまたがる22のシステムにおいて、HardMTBenchは、システム間GEMBAの範囲をFLORES-200の約2倍に拡大し、目に見えるランク付けを誘導し、品質のみのメトリクスがフラットになるようなドメイン固有の用語と知識の弱点を明らかにする。
すべてのデータとコードはhttps://github.com/jasonNLP/HardMTBench.comで公開されている。
関連論文リスト
- PIIBench: A Unified Multi-Source Benchmark Corpus for Personally Identifiable Information Detection [0.0]
PIIBenchは、自然言語テキストにおけるPII(Personally Identible Information)検出のための統一されたベンチマークコーパスである。
我々は、合成PIIコーパス、多言語名前付きエンティティ認識(NER)ベンチマーク、ファイナンシャルドメイン注釈テキストにまたがる10の公開データセットを統合する。
アノテーション付き配列2,369,883のコーパスと,48種類の標準PIIエンティティタイプに335万のエンティティが記述されている。
論文 参考訳(メタデータ) (2026-04-17T07:32:46Z) - Omnilingual MT: Machine Translation for 1,600 Languages [58.66170104105936]
我々は,1600以上の言語をサポートする最初の機械翻訳システムであるOmnilingual Machine Translation (OMT)を提案する。
このスケールは、大規模な公開多言語コーパスと新たに作成されたデータセットを統合する包括的なデータ戦略によって実現されている。
OMTモデルは言語間移動を改善し、1,600の評価において、MTのパズルの「理解」部分を解くのに近づいている。
論文 参考訳(メタデータ) (2026-03-17T09:43:42Z) - Marco-Bench-MIF: On Multilingual Instruction-Following Capability of Large Language Models [37.37334110940692]
Marco-Bench-MIF は IFEval のローカライズ版で,ローカライズレベルが異なる30言語を対象としている。
我々のベンチマークは、言語制約(例えば、中国語の資本化要件の変更)と文化基準に対処する。
本分析では,キーワードの整合性保持や言語間のコンポジション制約の順守など,多言語学習における課題を明らかにする。
論文 参考訳(メタデータ) (2025-07-16T03:49:41Z) - THOR-MoE: Hierarchical Task-Guided and Context-Responsive Routing for Neural Machine Translation [80.25152370613186]
階層型タスク誘導型およびコンテキスト応答型ルーティングポリシでMoEを武装するTHOR-MoEを提案する。
THOR-MoEは、既存のTop-$citeshazeer 2017やTop-$$citehuang-etal-2024-harderルーティングスキームと互換性のあるプラグインモジュールとして動作する。
例えば、バニラTop-$$citehuang-etal-2024-harderルーティングと比較して、コンテキスト認識の方法は22%未満の活性パラメータで平均0.75 BLEUの改善を達成することができる。
論文 参考訳(メタデータ) (2025-05-20T10:27:19Z) - Large Language Model for Multi-Domain Translation: Benchmarking and Domain CoT Fine-tuning [55.107329995417786]
大規模言語モデル(LLM)は、目覚ましい一般的な理解と生成能力を示している。
我々は、25のドイツ語$Leftrightarrow$ Englishと22の中国語$Leftrightarrow$ Englishテストセットを特徴とするマルチドメイン翻訳のベンチマークを確立する。
本稿では,LLMの内在的マルチドメインインテリジェンスを活用し,翻訳性能を向上させるためのドメインチェーン・オブ・シント(CoT)ファインチューニング手法を提案する。
論文 参考訳(メタデータ) (2024-10-03T16:15:04Z) - ChatGPT MT: Competitive for High- (but not Low-) Resource Languages [62.178282377729566]
大規模言語モデル(LLM)は、機械翻訳(MT)を含む様々な言語タスクの実行を暗黙的に学習する。
MTコスト分析とともに,204言語を拡張した最初の実験的な証拠を提示する。
分析の結果,ChatGPTの相対的翻訳能力を決定する上で,言語リソースレベルが最も重要な特徴であることが判明した。
論文 参考訳(メタデータ) (2023-09-14T04:36:00Z) - Confidence Based Bidirectional Global Context Aware Training Framework
for Neural Machine Translation [74.99653288574892]
我々は、ニューラルネットワーク翻訳(NMT)のための信頼に基づく双方向グローバルコンテキスト認識(CBBGCA)トレーニングフレームワークを提案する。
提案したCBBGCAトレーニングフレームワークは,3つの大規模翻訳データセットにおいて,NMTモデルを+1.02,+1.30,+0.57 BLEUスコアで大幅に改善する。
論文 参考訳(メタデータ) (2022-02-28T10:24:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。