論文の概要: Color Independent Word Segmentation From Transcribed Bangla Passages
- arxiv url: http://arxiv.org/abs/2610.01191v1
- Date: Thu, 01 Oct 2026 07:04:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.956919
- Title: Color Independent Word Segmentation From Transcribed Bangla Passages
- Title(参考訳): 符号付きバングラパスからのカラー独立単語セグメンテーション
- Abstract要約: 本研究の目的は,手書きのBanglaテキスト画像に単語を分割することである。
この研究は、スマートフォンで撮影したどんな画像にも適用できる。
7374語では、合計7278のバウンディングボックスが生成され、リコールは90.60%、精度は91.80%、F1スコアは91.20%である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: An optical character recognition(OCR) system can scan paper and extract text, making people's jobs easier. While numerous OCR systems are accessible in the software sector, finding a dependable equivalent solution for Bangla is tough. When it comes to handwritten texts, the case is even more rare. The first fundamental step to any OCR is to segment words from text images. If this stage fails, the total OCR's performance will be poor no matter how promising the later stages perform. This research aims to segment words in a handwritten Bangla text image. This research can be implemented on any smartphone-captured image, irrespective of the color and type of paper and ink. Furthermore, as smartphone-captured images can create shadow interferences, the custom dataset built for this research is created in such a way that every possible obstacle that can be faced is included. For 7374 words, a total of 7278 bounding boxes are generated, which have recall of 90.60 %, precision of 91.80 %, and F1-score of 91.20 %. The system can be further improved with nested operations on bounding boxes containing several words or by adjusting the adaptive thresholding and dilation filter sizes to a more precise level.
- Abstract(参考訳): オプティカル文字認識(OCR)システムは、紙をスキャンしてテキストを抽出し、人々の仕事を容易にする。
多くのOCRシステムがソフトウェアセクターで利用できるが、Banglaの信頼性の高い同等のソリューションを見つけることは難しい。
手書きのテキストに関しては、このケースはさらに稀だ。
OCRの最初の基本的なステップは、テキストイメージから単語を分割することである。
このステージが失敗した場合、OCRの全体的なパフォーマンスは、後段がどんなに有望であろうと、低くなる。
本研究の目的は,手書きのBanglaテキスト画像に単語を分割することである。
この研究は、紙やインクの色や種類に関係なく、あらゆるスマートフォンで撮影できる。
さらに、スマートフォンが捉えた画像が影の干渉を発生させるため、この研究のために構築されたカスタムデータセットは、あらゆる障害に直面することができるように作成される。
7374語では、合計7278のバウンディングボックスが生成され、リコールは90.60%、精度は91.80%、F1スコアは91.20%である。
システムは、複数の単語を含むバウンディングボックス上のネスト操作や、適応しきい値と拡張フィルタサイズをより正確なレベルに調整することで、さらに改善することができる。
関連論文リスト
- Open Vocabulary Word Recognition From Transcribed Bangla Texts [0.0]
本研究の目的は,手書きバングラ語画像における深層学習を用いた単語認識である。
9841個の手書きBanglaワードイメージのカスタマイズデータセットがコンパイルされ、多様な手書きスタイルが特徴である。
アンサンブルモデルが最も印象的であり、F1スコアは92.61%である。
論文 参考訳(メタデータ) (2026-10-01T06:14:41Z) - TextGuider: Training-Free Guidance for Text Rendering via Attention Alignment [68.91073792449201]
そこで本研究では,テキストの正確かつ完全な出現を促すトレーニング不要な方法であるTextGuiderを提案する。
具体的には,多モード拡散変換器(MM-DiT)モデルにおける注意パターンを解析し,特に画像に描画することを意図したテキスト関連トークンについて検討する。
テスト時間テキストレンダリングでは,OCR精度とCLIPスコアが大幅に向上し,高い結果が得られた。
論文 参考訳(メタデータ) (2025-12-10T06:18:30Z) - Mero Nagarikta: Advanced Nepali Citizenship Data Extractor with Deep Learning-Powered Text Detection and OCR [0.0]
そこで本研究では,テキストオブジェクトの正確な検出にYOLOv8を用いるロバストシステムと,最適化されたPyTesseractに基づくOCRアルゴリズムを提案する。
モバイルアプリケーションのコンテキスト内で実装されたこのシステムは、重要なテキスト情報の自動抽出を可能にする。
ネパール文字に最適化されたPyTesseractは、柔軟性と精度に関して標準のOCRよりも優れていた。
論文 参考訳(メタデータ) (2024-10-08T06:29:08Z) - Decoder Pre-Training with only Text for Scene Text Recognition [54.93037783663204]
シーンテキスト認識(STR)事前学習法は,主に合成データセットに依存し,顕著な進歩を遂げている。
STR(DPTR)用テキストのみを用いたDecoder Pre-trainingという新しい手法を提案する。
DPTRはCLIPテキストエンコーダが生成したテキスト埋め込みを擬似視覚埋め込みとして扱い、デコーダの事前訓練に使用する。
論文 参考訳(メタデータ) (2024-08-11T06:36:42Z) - Multimodal C4: An Open, Billion-scale Corpus of Images Interleaved with
Text [130.89493542553151]
テキスト内ビジョンやFlamingoのような言語モデルは、任意のインターリーブされた画像とテキストのシーケンスを入力としてサポートする。
このインターフェースをサポートするために、インターリーブされた画像+テキストを含むウェブコーパス上でプレトレーニングが行われる。
画像がインターリーブされた人気テキスト専用C4コーパスの拡張であるMultimodal C4をリリースする。
論文 参考訳(メタデータ) (2023-04-14T06:17:46Z) - Self-supervised Character-to-Character Distillation for Text Recognition [54.12490492265583]
そこで本研究では,テキスト表現学習を容易にする汎用的な拡張を可能にする,自己教師型文字-文字-文字間蒸留法CCDを提案する。
CCDは、テキスト認識の1.38%、テキストセグメンテーションの1.7%、PSNRの0.24dB、超解像の0.0321(SSIM)で、最先端の結果を達成する。
論文 参考訳(メタデータ) (2022-11-01T05:48:18Z) - An end-to-end Optical Character Recognition approach for
ultra-low-resolution printed text images [0.0]
低解像度画像上で光文字認識(OCR)を行う新しい手法を提案する。
このアプローチは、人間の視覚システムに対する理解から着想を得て、OCRを実行するための確立されたニューラルネットワークを構築します。
平均文字レベル精度 (cla) は99.7%、単語レベル精度 (wla) は98.9%であり、60dpiテキストの約1000ページにわたる。
論文 参考訳(メタデータ) (2021-05-10T17:08:06Z) - Word Segmentation from Unconstrained Handwritten Bangla Document Images
using Distance Transform [34.89370782262938]
本稿では,制約のないBangla手書き文書画像から直接テキストを自動分割する手法について述べる。
単語画像の外部境界の位置を求めるために,一般的な距離アルゴリズムを適用した。
提案手法は,CMATERdbデータベースから取得した50個のランダム画像に対して実験を行った。
論文 参考訳(メタデータ) (2020-09-17T03:14:27Z) - Confronting the Constraints for Optical Character Segmentation from
Printed Bangla Text Image [0.0]
光文字認識システムは基本的に、印刷された画像を編集可能なテキストに変換し、ストレージとユーザビリティを向上させる。
完全に機能するためには、システムは事前処理やセグメンテーションといったいくつかの重要な方法を通る必要がある。
提案アルゴリズムは,スキャン画像やキャプチャ画像の理想ケースと非理想ケースの両方からキャラクタを分割することができる。
論文 参考訳(メタデータ) (2020-03-18T17:58:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。