論文の概要: TransBERT: A Framework for Synthetic Translation in Domain-Specific Language Modeling
- arxiv url: http://arxiv.org/abs/2609.26347v2
- Date: Wed, 23 Sep 2026 17:49:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.677471
- Title: TransBERT: A Framework for Synthetic Translation in Domain-Specific Language Modeling
- Title(参考訳): TransBERT: ドメイン特化言語モデリングにおける合成翻訳フレームワーク
- Abstract要約: 本稿では,独占的に翻訳されたテキストを用いた言語モデルの事前学習のための新しいフレームワークであるTransBERTを提案する。
我々は、フランス語のライフサイエンス分野に焦点を当てたスケーラブルな翻訳ツールキットであるTransCorpusをリリースした。
- 参考スコア(独自算出の注目度): 36.96892645450847
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The scarcity of non-English language data in specialized domains significantly limits the development of effective Natural Language Processing (NLP) tools. We present TransBERT, a novel framework for pre-training language models using exclusively synthetically translated text, and introduce TransCorpus, a scalable translation toolkit. Focusing on the life sciences domain in French, our approach demonstrates that state-of-the-art performance on various downstream tasks can be achieved solely by leveraging synthetically translated data. We release the TransCorpus toolkit, the TransCorpus-bio-fr corpus (36.4GB of French life sciences text), TransBERT-bio-fr, its associated pre-trained language model and reproducible code for both pre-training and fine-tuning. Our results highlight the viability of synthetic translation in a high-resource translation direction for building high-quality NLP resources in low-resource language/domain pairs.
- Abstract(参考訳): 専門分野における非英語データの不足は、効果的な自然言語処理(NLP)ツールの開発を著しく制限している。
本稿では,言語モデルを事前学習するフレームワークであるTransBERTを紹介し,拡張性のある翻訳ツールキットであるTransCorpusを紹介する。
フランス語のライフサイエンス領域に着目して, 様々な下流タスクにおける最先端のパフォーマンスは, 合成されたデータを活用するだけで達成できることを実証する。
我々はTransCorpusツールキット、TransCorpus-bio-frコーパス(36.4GBのフランス生命科学テキスト)、TransBERT-bio-fr、関連する事前学習言語モデル、再現可能なコードをリリースした。
その結果,低リソース言語/ドメインペアで高品質なNLPリソースを構築するための,高リソース翻訳における合成翻訳の実現可能性を強調した。
関連論文リスト
- Improving Indigenous Language Machine Translation with Synthetic Data and Language-Specific Preprocessing [5.781452568978427]
我々は,高容量多言語翻訳モデルを用いて合成文対を生成することで,アメリカ大陸の言語に対する並列データセットを拡張した。
グアラニ・スペイン語とケチュア・スペイン語の翻訳実験は、合成データ拡張による一貫したchrF++の改善を示している。
Aymaraの診断実験は、高度に凝集的な言語に対する一般的な前処理の限界を強調している。
論文 参考訳(メタデータ) (2026-01-06T16:06:42Z) - Trans-Zero: Self-Play Incentivizes Large Language Models for Multilingual Translation Without Parallel Data [64.4458540273004]
言語モデル(LLM)の単言語データと本質的な多言語知識のみを活用するセルフプレイフレームワークを提案する。
実験により、このアプローチは大規模並列データに基づいて訓練されたモデルの性能と一致するだけでなく、非英語翻訳の方向でも優れていることが示された。
論文 参考訳(メタデータ) (2025-04-20T16:20:30Z) - Translation and Fusion Improves Zero-shot Cross-lingual Information Extraction [18.926993352330797]
本稿では,低リソース言語データの英語翻訳をモデルに微調整したフレームワークであるTransFusionを提案する。
GoLLIE-TFは、IEタスクのための言語間命令チューニング LLM であり、ハイソース言語と低リソース言語のパフォーマンスギャップを埋めるように設計されている。
論文 参考訳(メタデータ) (2023-05-23T01:23:22Z) - The NiuTrans End-to-End Speech Translation System for IWSLT 2021 Offline
Task [23.008938777422767]
本稿では,IWSLT 2021オフラインタスクに対して,NuTransのエンドツーエンド音声翻訳システムを提案する。
我々はTransformerベースのモデルアーキテクチャを使用し、Conformer、相対位置符号化、スタックされた音響およびテキスト符号化により拡張する。
我々は MuST-C En-De テストセット上で 33.84 BLEU 点を達成する。
論文 参考訳(メタデータ) (2021-07-06T07:45:23Z) - Improving Sign Language Translation with Monolingual Data by Sign
Back-Translation [105.83166521438463]
本稿では,手話テキストを手話訓練に組み込んだ手話逆翻訳(SignBT)手法を提案する。
テキストからグロスへの翻訳モデルを用いて、まずモノリンガルテキストをそのグロスシーケンスに逆変換する。
そして、推定グロス・トゥ・サインバンクから特徴レベルで部品をスプライシングしてペアサインシーケンスを生成する。
論文 参考訳(メタデータ) (2021-05-26T08:49:30Z) - Continual Mixed-Language Pre-Training for Extremely Low-Resource Neural
Machine Translation [53.22775597051498]
我々は,mbart を未熟な言語に効果的に適用するための,継続的な事前学習フレームワークを提案する。
その結果,mBARTベースラインの微調整性能を一貫して改善できることが示された。
私たちのアプローチは、両方の言語が元のmBARTの事前トレーニングで見られる翻訳ペアのパフォーマンスを高めます。
論文 参考訳(メタデータ) (2021-05-09T14:49:07Z) - Exploiting News Article Structure for Automatic Corpus Generation of
Entailment Datasets [1.859931123372708]
本稿では,低リソース言語を対象としたベンチマークデータセットの自動生成手法を提案する。
第2に,フィリピンの資源不足を緩和するため,ELECTRA技術に基づく事前学習型トランスフォーマを新たに作成する。
第3に,低データ領域で動作する場合の真の性能に光を当てるために,転送学習手法の分析を行う。
論文 参考訳(メタデータ) (2020-10-22T10:09:10Z) - Exploring the Limits of Transfer Learning with a Unified Text-to-Text
Transformer [64.22926988297685]
下流タスクで微調整される前に、まずデータリッチタスクでモデルが事前訓練されるトランスファーラーニングは、自然言語処理(NLP)において強力な手法として登場した。
本稿では,すべてのテキストベースの言語問題をテキスト・トゥ・テキスト・フォーマットに変換する統一フレームワークにより,NLPのためのトランスファー学習手法を導入する状況について検討する。
論文 参考訳(メタデータ) (2019-10-23T17:37:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。