論文の概要: Text region detection in historical astronomical diagrams
- arxiv url: http://arxiv.org/abs/2606.15886v1
- Date: Sun, 14 Jun 2026 16:11:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:33.923988
- Title: Text region detection in historical astronomical diagrams
- Title(参考訳): 歴史的天文学図におけるテキスト領域の検出
- Authors: Zeynep Sonat Baltacı, Raphaël Baena, Fei Meng, Somkéo Norindr, Florence Somer, Matthieu Husson, Mathieu Aubry,
- Abstract要約: 10,940の向きの多角形テキスト領域を含む948の歴史的天体図の大規模で多様なオープンアクセスデータセットを導入する。
私たちのデータセットは10世紀(8世紀から18世紀)と7つの主要な言語的伝統にまたがっている。
シンボルから複数行の段落まで、幅広いダイアグラムのスタイルとテキストのコンテンツをキャプチャする。
- 参考スコア(独自算出の注目度): 12.25788065147468
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Text detection is a crucial task in the analysis of historical documents. While datasets and benchmarks exist for text detection in manuscripts and maps, the study of text in mathematical diagrams has received little attention. To address this, we introduce a large-scale, diverse, open-access dataset of 948 historical astronomical diagrams containing 10,940 oriented polygonal text regions. Our dataset spans ten centuries (8th to 18th) and seven main linguistic traditions: Arabic and Persian (115), Chinese (332), Byzantine (233), Latin (185), Hebrew (48), and Sanskrit (35). It captures a wide range of diagram styles and textual content, from symbols to multi-line paragraphs. Each text instance is annotated with ordered polygons that precisely delineate text regions and encode the reading direction. In addition, we annotated the 2,293 regions in Latin diagrams with 20 class labels. We evaluated several strong baselines on our dataset, including TESTR, DeepSolo++, and Poly-DETR, a simple extension of DINO-DETR that we design to predict ordered polygon vertices. Poly-DETR achieves state-of-the-art performance on the MTHv2 and cBAD2019 benchmarks and provides a solid, simple baseline on our dataset. Code and dataset available online.
- Abstract(参考訳): テキスト検出は史料の分析において重要な課題である。
原稿や地図のテキスト検出のためのデータセットやベンチマークは存在するが、数学的図形のテキストの研究はほとんど注目されていない。
そこで本稿では,10,940の向きの多角形テキスト領域を含む948の歴史的天体図を大規模かつ多種多様なオープンアクセスデータセットとして紹介する。
私たちのデータセットは10世紀(8世紀から18世紀)と、アラビア語とペルシア語(115年)、中国語(332年)、ビザンティン語(233年)、ラテン語(185年)、ヘブライ語(48年)、サンスクリット語(35年)の7つの主要な言語伝統にまたがっている。
シンボルから複数行の段落まで、幅広いダイアグラムのスタイルとテキストのコンテンツをキャプチャする。
各テキストインスタンスは、テキスト領域を正確に記述し、読み出し方向をエンコードする順序付きポリゴンで注釈付けされる。
さらに、20のクラスラベルを持つラテン図の2,293の領域に注釈を付けました。
TESTR, DeepSolo++, Poly-DETR, DINO-DETRの単純な拡張として, 順序付きポリゴン頂点の予測を設計した。
Poly-DETRは、MTHv2とcBAD2019ベンチマークで最先端のパフォーマンスを達成し、私たちのデータセットにしっかりとしたシンプルなベースラインを提供します。
コードとデータセットはオンラインで入手できる。
関連論文リスト
- LIGHT: Multi-Modal Text Linking on Historical Maps [1.8399976559754367]
光は、歴史的地図上のテキストをリンクするための言語的、画像的、幾何学的特徴を統合する、新しいマルチモーダルアプローチである。
ICDAR 2024/2025 MapTextコンペティションのデータでは、既存のメソッドよりも優れています。
論文 参考訳(メタデータ) (2025-06-27T19:18:00Z) - TextAtlas5M: A Large-scale Dataset for Dense Text Image Generation [88.14715494221123]
テキスト条件付き画像生成における長文レンダリングの評価を目的とした,新しいデータセットであるTextAtlas5Mを紹介する。
私たちのデータセットは、500万の長文生成と、さまざまなデータタイプにわたる画像の収集で構成されています。
さらに、3つのデータドメインにまたがる3000の人間改良テストセットTextAtlasEvalをキュレートし、テキスト条件生成のための最も広範なベンチマークの1つを確立します。
論文 参考訳(メタデータ) (2025-02-11T18:59:19Z) - MapExplorer: New Content Generation from Low-Dimensional Visualizations [60.02149343347818]
低次元の可視化や「投影マップ」は大規模で複雑なデータセットの解釈に広く用いられている。
これらの視覚化は、既存の知識空間を理解するのに役立つだけでなく、未知の領域への探索を暗黙的にガイドする。
プロジェクションマップ内の座標をコヒーレントでコンテキストに整合したテキストコンテンツに変換する新しい知識発見タスクであるMapExplorerを紹介する。
論文 参考訳(メタデータ) (2024-12-24T20:16:13Z) - KhmerST: A Low-Resource Khmer Scene Text Detection and Recognition Benchmark [1.5409800688911346]
我々は,1,544人の専門家による注釈付き画像を含む,最初のKhmerシーンテキストデータセットを紹介した。
この多様なデータセットには、平らなテキスト、起立したテキスト、照度の低いテキスト、遠くのポリゴン、部分的に不明瞭なテキストが含まれる。
論文 参考訳(メタデータ) (2024-10-23T21:04:24Z) - Dataset and Benchmark for Urdu Natural Scenes Text Detection, Recognition and Visual Question Answering [50.52792174648067]
このイニシアチブは、テキストと視覚的理解のギャップを埋めようとしている。
そこで本研究では,1000以上の自然シーン画像からなるマルチタスクUrduシーンテキストデータセットを提案する。
テキストインスタンスの細かいアノテーションを提供し、以前のデータセットの制限に対処します。
論文 参考訳(メタデータ) (2024-05-21T06:48:26Z) - IndicSTR12: A Dataset for Indic Scene Text Recognition [33.194567434881314]
本稿では、インドにおける最大かつ最も包括的な実データセットであるIndicSTR12を提案し、12の主要言語でのSTRパフォーマンスをベンチマークする。
提案されたデータセットのサイズと複雑さは、既存のラテン系同時代のデータセットに匹敵するものである。
データセットには、様々な自然のシーンから集められた27000以上のワードイメージが含まれており、各言語に1000以上のワードイメージがある。
論文 参考訳(メタデータ) (2024-03-12T18:14:48Z) - A Benchmark for Text Expansion: Datasets, Metrics, and Baselines [87.47745669317894]
本研究はテキスト拡張(TE)の新たな課題として,平文の適切な位置に細粒度修飾子を挿入することを目的とする。
補完的な4つのアプローチを活用して、1200万の自動生成インスタンスと2Kの人間注釈付き参照を持つデータセットを構築します。
事前訓練されたテキストインフィルモデルの上にパイプラインと共同でLocate&Infillモデルを構築し、Text2Textベースラインよりも優れていることを示す。
論文 参考訳(メタデータ) (2023-09-17T07:54:38Z) - The Learnable Typewriter: A Generative Approach to Text Analysis [17.355857281085164]
テキスト行中の文字解析と認識に対する生成文書固有のアプローチを提案する。
同様のフォントや手書きのテキスト行を入力として、我々のアプローチは多数の異なる文字を学習することができる。
論文 参考訳(メタデータ) (2023-02-03T11:17:59Z) - Towards End-to-End Unified Scene Text Detection and Layout Analysis [60.68100769639923]
本稿では,シーンテキストの検出とレイアウト解析を統合化するタスクについて紹介する。
この新たな研究課題を実現するために、最初の階層的なシーンテキストデータセットが導入された。
また,シーンテキストを同時に検出し,テキストクラスタを統一的に形成する手法を提案する。
論文 参考訳(メタデータ) (2022-03-28T23:35:45Z) - SCROLLS: Standardized CompaRison Over Long Language Sequences [62.574959194373264]
SCROLLSは長いテキストに対する推論を必要とするタスクのスイートである。
SCROLLSには要約、質問応答、自然言語推論タスクが含まれる。
すべてのデータセットを統一されたテキスト・ツー・テキスト形式で利用可能にし、モデルアーキテクチャと事前学習方法の研究を容易にするために、ライブのリーダーボードをホストします。
論文 参考訳(メタデータ) (2022-01-10T18:47:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。