Fugu-MT 論文翻訳(概要): Improving End-to-End Text Image Translation From the Auxiliary Text Translation Task

論文の概要: Improving End-to-End Text Image Translation From the Auxiliary Text Translation Task

arxiv url: http://arxiv.org/abs/2210.03887v1
Date: Sat, 8 Oct 2022 02:35:45 GMT
ステータス: 翻訳完了
システム内更新日: 2022-10-11 16:27:16.329965
Title: Improving End-to-End Text Image Translation From the Auxiliary Text Translation Task
Title（参考訳）: 補助テキスト翻訳タスクによるエンドツーエンドテキスト画像翻訳の改善
Authors: Cong Ma, Yaping Zhang, Mei Tu, Xu Han, Linghui Wu, Yang Zhao, Yu Zhou
Abstract要約: 本稿では,テキスト翻訳を補助タスクとするエンドツーエンドモデルを訓練する,新しいテキスト翻訳拡張テキスト画像翻訳を提案する。モデルパラメータとマルチタスクのトレーニングを共有することで,大規模テキスト並列コーパスを最大限に活用することができる。
参考スコア（独自算出の注目度）: 26.046624228278528
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Abstract: End-to-end text image translation (TIT), which aims at translating the source language embedded in images to the target language, has attracted intensive attention in recent research. However, data sparsity limits the performance of end-to-end text image translation. Multi-task learning is a non-trivial way to alleviate this problem via exploring knowledge from complementary related tasks. In this paper, we propose a novel text translation enhanced text image translation, which trains the end-to-end model with text translation as an auxiliary task. By sharing model parameters and multi-task training, our model is able to take full advantage of easily-available large-scale text parallel corpus. Extensive experimental results show our proposed method outperforms existing end-to-end methods, and the joint multi-task learning with both text translation and recognition tasks achieves better results, proving translation and recognition auxiliary tasks are complementary.
Abstract（参考訳）: 近年,画像に埋め込まれたソース言語を対象言語に翻訳することを目的としたエンドツーエンドのテキスト画像翻訳 (TIT) が注目されている。しかし、データ空間は、エンドツーエンドのテキスト画像翻訳の性能を制限する。マルチタスク学習(multi-task learning)は、補完的なタスクから知識を探索することでこの問題を緩和する非自明な方法である。本稿では,テキスト翻訳を補助タスクとしてエンドツーエンドモデルを訓練する,新しいテキスト翻訳強化テキスト画像翻訳を提案する。モデルパラメータとマルチタスクのトレーニングを共有することで,大規模テキスト並列コーパスを最大限に活用することができる。実験の結果,提案手法は既存のエンドツーエンドの手法よりも優れており,テキスト翻訳と認識タスクを併用したマルチタスク学習の方が優れた結果が得られることがわかった。

関連論文リスト

AnyTrans: Translate AnyText in the Image with Large Scale Models [88.5887934499388]
本稿では、画像中のタスク翻訳AnyText(TATI)のためのオール・エンコンパス・フレームワークであるAnyTransを紹介する。我々のフレームワークは、翻訳中にテキスト要素と視覚要素の両方から文脈的手がかりを取り入れている。 6つの言語対の多言語テキスト画像翻訳データからなるMTIT6というテストデータセットを精巧にコンパイルした。
論文参考訳（メタデータ） (2024-06-17T11:37:48Z)
FINEMATCH: Aspect-based Fine-grained Image and Text Mismatch Detection and Correction [66.98008357232428]
我々は新しいアスペクトベースのきめ細かいテキストと画像マッチングベンチマークであるFineMatchを提案する。 FineMatchはテキストと画像のミスマッチの検出と修正に焦点を当てている。 FineMatchで訓練されたモデルは、きめ細かいテキストや画像のミスマッチを検出する能力の向上を示す。
論文参考訳（メタデータ） (2024-04-23T03:42:14Z)
TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding [91.30065932213758]
大規模マルチモーダルモデル(LMM)は、その顕著な推論能力を活用することを目的とした研究の急増を引き起こした。テキストリッチな画像理解のための新しいChain-of-ThoughtフレームワークであるTextCoTを提案する。私たちのメソッドは追加のトレーニングが不要で、即時プラグアンドプレイ機能を提供します。
論文参考訳（メタデータ） (2024-04-15T13:54:35Z)
Rethinking and Improving Multi-task Learning for End-to-end Speech Translation [51.713683037303035]
異なる時間とモジュールを考慮したタスク間の整合性について検討する。テキストエンコーダは、主にクロスモーダル変換を容易にするが、音声におけるノイズの存在は、テキストと音声表現の一貫性を妨げる。長さと表現の差を軽減し,モーダルギャップを橋渡しする,STタスクのための改良型マルチタスク学習(IMTL)手法を提案する。
論文参考訳（メタデータ） (2023-11-07T08:48:46Z)
An Adversarial Multi-Task Learning Method for Chinese Text Correction with Semantic Detection [0.0]
中国語文文脈における文字認識のモデル化と検出能力を高めるために, 逆多タスク学習法を提案する。モンテカルロ木探索戦略とポリシーネットワークを導入し,意味検出による効率の良い中国語テキスト修正作業を実現する。
論文参考訳（メタデータ） (2023-06-28T15:46:00Z)
TextFormer: A Query-based End-to-End Text Spotter with Mixed Supervision [61.186488081379]
Transformerアーキテクチャを用いた問合せベースのエンドツーエンドテキストスポッターであるTextFormerを提案する。 TextFormerは、画像エンコーダとテキストデコーダの上に構築され、マルチタスクモデリングのための共同セマンティック理解を学ぶ。分類、セグメンテーション、認識のブランチの相互訓練と最適化を可能にし、より深い特徴共有をもたらす。
論文参考訳（メタデータ） (2023-06-06T03:37:41Z)
Exploring Better Text Image Translation with Multimodal Codebook [39.12169843196739]
テキスト画像翻訳(TIT)は、画像に埋め込まれたソーステキストをターゲット翻訳に変換することを目的としている。本研究ではまず,中国語のTITデータセットOCRMT30Kに注釈を付け,その後の研究に便宜を提供する。そこで本研究では,画像と関連するテキストを関連付けることができるマルチモーダルコードブックを用いたTITモデルを提案する。本稿では,テキスト機械翻訳,画像テキストアライメント,TITタスクを含む多段階学習フレームワークを提案する。
論文参考訳（メタデータ） (2023-05-27T08:41:18Z)
Improving Speech Translation by Understanding and Learning from the Auxiliary Text Translation Task [26.703809355057224]
我々は,タスクがマルチタスク学習フレームワークにおけるメインタスクに与える影響を理解するために,詳細な分析を行う。解析により、マルチタスク学習は、異なるモダリティから同様のデコーダ表現を生成する傾向があることを確認した。これらの知見に触発されて,翻訳品質を向上させる3つの方法を提案する。
論文参考訳（メタデータ） (2021-07-12T23:53:40Z)
Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer [64.22926988297685]
下流タスクで微調整される前に、まずデータリッチタスクでモデルが事前訓練されるトランスファーラーニングは、自然言語処理(NLP)において強力な手法として登場した。本稿では,すべてのテキストベースの言語問題をテキスト・トゥ・テキスト・フォーマットに変換する統一フレームワークにより,NLPのためのトランスファー学習手法を導入する状況について検討する。
論文参考訳（メタデータ） (2019-10-23T17:37:36Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。