Fugu-MT 論文翻訳(概要): ExTTNet: A Deep Learning Algorithm for Extracting Table Texts from Invoice Images

論文の概要: ExTTNet: A Deep Learning Algorithm for Extracting Table Texts from Invoice Images

arxiv url: http://arxiv.org/abs/2402.02246v1
Date: Sat, 3 Feb 2024 19:24:45 GMT
ステータス: 翻訳完了
システム内更新日: 2024-02-06 21:00:18.016956
Title: ExTTNet: A Deep Learning Algorithm for Extracting Table Texts from Invoice Images
Title（参考訳）: ExTTNet:請求書画像から表テキストを抽出するディープラーニングアルゴリズム
Authors: Adem Akdo\u{g}an and Murat Kurt
Abstract要約: 本研究では, 請求書内の製品表を, ExTTNet という深層学習モデルを用いて自律的に取得する。光文字認識(OCR)技術を用いた請求書画像からテキストを得る。特徴抽出法を用いて既存の特徴量を増やし、精度を高める。 OCRの結果得られた各テキストがテーブル要素であるか否かに応じてラベル処理を行う。
参考スコア（独自算出の注目度）: 0.0
License: http://creativecommons.org/licenses/by/4.0/
Abstract: In this work, product tables in invoices are obtained autonomously via a deep learning model, which is named as ExTTNet. Firstly, text is obtained from invoice images using Optical Character Recognition (OCR) techniques. Tesseract OCR engine [37] is used for this process. Afterwards, the number of existing features is increased by using feature extraction methods to increase the accuracy. Labeling process is done according to whether each text obtained as a result of OCR is a table element or not. In this study, a multilayer artificial neural network model is used. The training has been carried out with an Nvidia RTX 3090 graphics card and taken $162$ minutes. As a result of the training, the F1 score is $0.92$.
Abstract（参考訳）: 本研究では, 請求書内の製品表を, ExTTNet という深層学習モデルを用いて自律的に取得する。まず、光学式文字認識(OCR)技術を用いて、請求書画像からテキストを得る。この処理にはテッセラクトOCRエンジン[37]が使用される。その後、特徴抽出法を用いて精度を向上させることにより、既存の特徴数を増加させる。 OCRの結果得られた各テキストがテーブル要素であるか否かに応じてラベル処理を行う。本研究では,多層人工ニューラルネットワークモデルを用いた。トレーニングはnvidia rtx 3090グラフィックカードで行われており、162ドルを要した。トレーニングの結果、F1スコアは0.92ドルとなった。

関連論文リスト

Efficient License Plate Recognition in Videos Using Visual Rhythm and Accumulative Line Analysis [0.36832029288386137]
ビデオベースの自動ナンバープレート認識(ALPR)は、ビデオキャプチャーから車両ナンバープレートのテキスト情報を抽出する。従来のシステムはハイエンドのコンピューティングリソースに大きく依存しており、複数のフレームを使用してライセンスプレートを認識する。車両1台あたりの正確なフレームを効率よく抽出し,この画像からナンバープレートの文字を認識できる2つの手法を提案する。
論文参考訳（メタデータ） (2025-01-08T16:17:05Z)
Decoder Pre-Training with only Text for Scene Text Recognition [54.93037783663204]
シーンテキスト認識(STR)事前学習法は,主に合成データセットに依存し,顕著な進歩を遂げている。 STR(DPTR)用テキストのみを用いたDecoder Pre-trainingという新しい手法を提案する。 DPTRはCLIPテキストエンコーダが生成したテキスト埋め込みを擬似視覚埋め込みとして扱い、デコーダの事前訓練に使用する。
論文参考訳（メタデータ） (2024-08-11T06:36:42Z)
Turning a CLIP Model into a Scene Text Spotter [73.63953542526917]
我々は,大規模コントラスト言語-画像事前学習(CLIP)モデルの可能性を活用し,シーンテキストの検出とスポッティング作業を強化する。このバックボーンは、CLIPにおける視覚的プロンプト学習とクロスアテンションを利用して、画像とテキストベースの事前知識を抽出する。 FastTCM-CR50では、画像とテキストの埋め込みのシナジーを高めるために、インスタンス言語マッチングプロセスが導入されている。
論文参考訳（メタデータ） (2023-08-21T01:25:48Z)
Extending TrOCR for Text Localization-Free OCR of Full-Page Scanned Receipt Images [0.07673339435080445]
本稿では,レセプション画像中のすべての文字を順序付きシーケンス・ツー・エンドに変換するために,ローカライズフリーな文書レベルOCRモデルを提案する。具体的には、訓練済みのインスタンスレベルモデルTrOCRをランダムにトリミングした画像チャンクで微調整する。実験では64.4F1スコアと22.8%の文字誤り率を達成した。
論文参考訳（メタデータ） (2022-12-11T15:45:26Z)
TPFNet: A Novel Text In-painting Transformer for Text Removal [3.7067444579637074]
画像からテキストを除去する新しいワンステージ(エンドツーエンド)ネットワークTPFNetを提案する。第1部は低解像度画像で動作し、第2部は高解像度のテキストフリー画像を予測する。オックスフォード、SCUT、SCUT-EnsTextのデータセットでは、我々のネットワークは、ほぼすべてのメトリクスに関する提案されたネットワークよりも優れています。
論文参考訳（メタデータ） (2022-10-26T04:16:50Z)
Language Matters: A Weakly Supervised Pre-training Approach for Scene Text Detection and Spotting [69.77701325270047]
本稿では,シーンテキストを効果的に表現できる弱教師付き事前学習手法を提案する。本ネットワークは,画像エンコーダと文字認識型テキストエンコーダから構成され,視覚的特徴とテキスト的特徴を抽出する。実験により、事前訓練されたモデルは、重みを他のテキスト検出やスポッティングネットワークに転送しながら、Fスコアを+2.5%、+4.8%改善することが示された。
論文参考訳（メタデータ） (2022-03-08T08:10:45Z)
Image preprocessing and modified adaptive thresholding for improving OCR [0.0]
本稿では,テキスト内の画素強度を最大化し,それに応じて画像のしきい値を設定する手法を提案する。得られた結果から,OCRの画像処理分野において,このアルゴリズムを効率的に適用できることが分かる。
論文参考訳（メタデータ） (2021-11-28T08:13:20Z)
Lexically Aware Semi-Supervised Learning for OCR Post-Correction [90.54336622024299]
世界中の多くの言語における既存の言語データの多くは、非デジタル化された書籍や文書に閉じ込められている。従来の研究は、あまり良くない言語を認識するためのニューラル・ポスト・コレクション法の有用性を実証してきた。そこで本研究では,生画像を利用した半教師付き学習手法を提案する。
論文参考訳（メタデータ） (2021-11-04T04:39:02Z)
TrOCR: Transformer-based Optical Character Recognition with Pre-trained Models [47.48019831416665]
本稿では,事前学習した画像変換器とテキスト変換器モデル,すなわちTrOCRを用いたエンドツーエンドのテキスト認識手法を提案する。 TrOCRは単純だが効果的であり、大規模な合成データで事前訓練し、人間のラベル付きデータセットで微調整することができる。実験により、TrOCRモデルは、印刷されたテキスト認識タスクと手書きのテキスト認識タスクの両方において、現在の最先端モデルよりも優れていることが示された。
論文参考訳（メタデータ） (2021-09-21T16:01:56Z)
TNCR: Table Net Detection and Classification Dataset [62.997667081978825]
TNCRデータセットは、スキャンされた文書画像のテーブル検出と5つのクラスに分類される。我々は、テーブル検出のための最先端のディープラーニングベースの手法を実装し、いくつかの強力なベースラインを構築した。我々は、テーブルの検出、分類、構造認識に対するより深い学習アプローチを促進するために、TNCRをオープンソースにしました。
論文参考訳（メタデータ） (2021-06-19T10:48:58Z)
Abstractive Information Extraction from Scanned Invoices (AIESI) using End-to-end Sequential Approach [0.0]
私たちは、Payee名、総数、住所など、データに興味を持っています。抽出された情報は、データの完全な洞察を得るのに役立つ。高速なドキュメント検索、データベースの効率的なインデックス付け、データ分析などに役立つ。本稿では,Word wise BiLSTMを用いて,請求書からすべての視覚的特徴とテキスト的特徴をアンサンブルし,重要な請求書パラメータを抽出する手法を提案する。
論文参考訳（メタデータ） (2020-09-12T05:14:28Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。