論文の概要: Systematic Analysis of Large Language Models and Transformer-Based Machine Translation for English-Tamil and Tamil-English Across Diverse Datasets
- arxiv url: http://arxiv.org/abs/2607.24515v2
- Date: Tue, 28 Jul 2026 17:28:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 14:13:57.680993
- Title: Systematic Analysis of Large Language Models and Transformer-Based Machine Translation for English-Tamil and Tamil-English Across Diverse Datasets
- Title(参考訳): 英語・タミル語・タミル語多言語データセットのための大規模言語モデルの体系的解析とトランスフォーマーに基づく機械翻訳
- Abstract要約: 本研究は、英語・タミル語・タミル語翻訳における多言語翻訳モデルの性能を総合的に評価する。
本研究では, BLEUとchrFの測定値を用いて, NMTシステム, NLLB, mBARTの評価を行い, 品質レベルや領域の異なるデータに対して, これらのシステムがどのように機能するかを検討した。
- 参考スコア(独自算出の注目度): 0.19116784879310025
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The challenge of Machine Translation for low resource languages such as Tamil is primarily caused by the restricted amount of parallel data for these languages, as well as their substantial amount of domain variation and morphological complexity. This research presents the comprehensive evaluation of the performance of several multilingual translation models on English-Tamil and Tamil-English translations across multiple datasets: NTREX, EnTamV2, WikiMatrix and PMIndia. This study evaluates supervised NMT systems, NLLB and mBART, using both the BLEU and chrF metric, and examines how these systems perform on data of different quality levels and domains. This performs an attention-based analysis to increase model interpretability by visualising the alignments of tokens in an English source text and their Tamil translations and vice-versa to provide insight into how they make translations. This study also demonstrates that using in-context prompting can provide an excellent way to perform a few-shot translation of English to Tamil and Tamil-English using a Tamil capable TamilLaMA model, and compare this to supervised approaches qualitatively. These findings show that the quality of the datasets and their alignment with the domain will greatly affect the performance of the model, that attention-based mechanisms can aid in explain ability, and that few-shot large language models can still produce structurally coherent translations of Tamil.
- Abstract(参考訳): タミル語のような低リソース言語に対する機械翻訳の課題は、主にこれらの言語に対する並列データの制限された量と、その相当量のドメイン変動と形態的複雑さによって引き起こされる。
本研究は,NTREX, EnTamV2, WikiMatrix, PMIndiaの複数のデータセットを対象とした多言語翻訳モデルの性能評価を行った。
本研究では, BLEUとchrFの測定値を用いて, NMTシステム, NLLB, mBARTの評価を行い, 品質レベルや領域の異なるデータに対して, これらのシステムがどのように機能するかを検討した。
これは、英語のソーステキストにおけるトークンのアライメントとそのタミル語翻訳と副詞を視覚化することで、モデル解釈可能性を高めるために注意に基づく分析を行う。
また,本研究では,タミル語とタミル語に翻訳した英語をタミル語とタミル語に翻訳する方法として,タミル語を有能なタミルラマモデルを用いて提案し,これを定性的に教師付きアプローチと比較した。
これらの結果は、データセットの品質とドメインとの整合性がモデルの性能に大きな影響を与えること、注意に基づくメカニズムが能力の説明に役立つこと、そして、少数ショットの大規模言語モデルが依然としてタミル語の構造的一貫性のある翻訳を生成することを示している。
関連論文リスト
- Evaluating Machine Translation Models for English-Hindi Language Pairs: A Comparative Analysis [0.0]
本研究の目的は、汎用言語ドメインと専門言語ドメインの両方を扱う際に、異なる機械翻訳アプローチの有効性についての洞察を提供することである。
結果は、様々なメトリクスのパフォーマンスレベルを示し、現在の翻訳システムを改善するための強みと領域を強調している。
論文 参考訳(メタデータ) (2025-05-26T07:15:06Z) - Trans-Zero: Self-Play Incentivizes Large Language Models for Multilingual Translation Without Parallel Data [64.4458540273004]
言語モデル(LLM)の単言語データと本質的な多言語知識のみを活用するセルフプレイフレームワークを提案する。
実験により、このアプローチは大規模並列データに基づいて訓練されたモデルの性能と一致するだけでなく、非英語翻訳の方向でも優れていることが示された。
論文 参考訳(メタデータ) (2025-04-20T16:20:30Z) - Contextual Cues in Machine Translation: Investigating the Potential of Multi-Source Input Strategies in LLMs and NMT Systems [2.512491726995032]
我々は,大規模言語モデルであるGPT-4oと,従来の多言語ニューラルマシン翻訳(NMT)システムとの比較を行った。
中間言語翻訳を文脈的手がかりとして、ポルトガル語への英語と中国語の翻訳を強化する効果を評価する。
その結果、文脈情報はドメイン固有のデータセットの翻訳品質を著しく改善し、言語学的に離れた言語ペアにとって潜在的に有益であることが示唆された。
論文 参考訳(メタデータ) (2025-03-10T11:23:44Z) - P-MMEval: A Parallel Multilingual Multitask Benchmark for Consistent Evaluation of LLMs [84.24644520272835]
本稿では,P-MMEvalを提案する。P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P -M
P-MMEvalは、さまざまなデータセットにわたって一貫した言語カバレッジを提供し、並列サンプルを提供する。
我々は、モデルとタスク間の性能を比較するために、代表的多言語モデル系列に関する広範な実験を行う。
論文 参考訳(メタデータ) (2024-11-14T01:29:36Z) - Unified Model Learning for Various Neural Machine Translation [63.320005222549646]
既存の機械翻訳(NMT)研究は主にデータセット固有のモデルの開発に焦点を当てている。
我々は,NMT(UMLNMT)のための統一モデル学習モデル(Unified Model Learning for NMT)を提案する。
OurNMTは、データセット固有のモデルよりも大幅に改善され、モデルデプロイメントコストが大幅に削減される。
論文 参考訳(メタデータ) (2023-05-04T12:21:52Z) - DivEMT: Neural Machine Translation Post-Editing Effort Across
Typologically Diverse Languages [5.367993194110256]
DivEMTは、ニューラルネットワーク翻訳(NMT)に関する、タイプ的かつ多様なターゲット言語に対する初めての公開後研究である。
我々は、Google Translateとオープンソースの多言語モデルmBART50の2つの最先端NTTシステムの翻訳生産性への影響を評価する。
論文 参考訳(メタデータ) (2022-05-24T17:22:52Z) - Building Machine Translation Systems for the Next Thousand Languages [102.24310122155073]
1500以上の言語を対象としたクリーンでWebマイニングされたデータセットの構築、低サービス言語のための実践的なMTモデルの開発、これらの言語に対する評価指標の限界の検証という3つの研究領域における結果について述べる。
我々の研究は、現在調査中の言語のためのMTシステムの構築に取り組んでいる実践者にとって有用な洞察を提供し、データスパース設定における多言語モデルの弱点を補完する研究の方向性を強調したいと考えています。
論文 参考訳(メタデータ) (2022-05-09T00:24:13Z) - Multilingual Neural Machine Translation:Can Linguistic Hierarchies Help? [29.01386302441015]
MNMT(Multilingual Neural Machine Translation)は、複数の言語間の翻訳をサポートする単一のNMTモデルを訓練する。
MNMTモデルの性能は、様々な言語から知識を伝達することで、負の転送によって翻訳性能が低下するので、訓練で使用される言語の種類に大きく依存する。
本稿では,MNMTにおける階層的知識蒸留(HKD)手法を提案する。
論文 参考訳(メタデータ) (2021-10-15T02:31:48Z) - Exploring Pair-Wise NMT for Indian Languages [35.17470908190963]
これらのモデルの性能は, フィルタした逆翻訳プロセスを通じて, バックトランスレーションを用いることで大幅に向上できることを示す。
本稿では,本手法がベースラインよりも多言語モデルの性能を著しく向上できることを示す。
論文 参考訳(メタデータ) (2020-12-10T16:22:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。