論文の概要: Reading Order Inference for Complex Document Layouts
- arxiv url: http://arxiv.org/abs/2607.01018v1
- Date: Wed, 01 Jul 2026 14:52:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.943184
- Title: Reading Order Inference for Complex Document Layouts
- Title(参考訳): 複雑な文書レイアウトの読み出し順序推論
- Authors: Iddo Hakim, Sharva Gogawale, Omer Ventura, Gal Grudka, Daria Vasyutinsky-Shapira, Berat Kurar-Barakat, Nachum Dershowitz,
- Abstract要約: 本稿では,非モデル化されたテキスト・アズ・ア・レポートの精度を評価する手法を提案する。
非正方形・非正方形テキストの標準Grossainariaレイアウトと比較した。
- 参考スコア(独自算出の注目度): 0.784573461502689
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reading order inference remains a critical bottleneck in the digitization of complex historical manuscripts, where pages contain multiple spatially interleaved reading streams, the canonical example being the Glossa Ordinaria layout, in which a central text is surrounded by commentaries that wrap around it in non-rectangular, non-convex regions. We present a training-free, graph-based framework: each OCR text line becomes a node in a directed candidate-transition graph, edges are scored by a weighted additive ensemble of two lightweight language-model signals (causal language model conditional likelihood and BERT next-sentence prediction, NSP; a third sentence-embedding signal was evaluated but did not improve reading order), and the global reading order is recovered as a degree-constrained directed path cover. To avoid the cascading "edge-theft" failures of greedy edge selection, we propose a max-regret inference rule that prioritizes commitments with high opportunity cost. We evaluate on synthetic Glossa Ordinaria grid layouts, on 23 ALTO page geometries (10 historical source pages plus mirrored and flipped variants), and on a 140-page multi-column English subset of OmniDocBench, comparing our method against the canonical recursive XY-cut (PaddleOCR PP-StructureV3) and two LayoutReader variants (layout-only and text+layout) on identical inputs. On wrap-around Glossa layouts our method recovers 95% of ground-truth successor edges on average vs. XY-cut's 50%; on the OmniDocBench multi-column subset it reaches 88% macro edge accuracy versus XY-cut's 75% and LayoutReader's 25%. The LayoutReader baselines transfer poorly due to a word-level vs. line-level granularity mismatch. We additionally verify mirror-invariance under horizontal and vertical page reflections: Our method changes by less than 1 percentage point, classical XY-cut by 2 points, and LayoutReader-T by up to 8 points.
- Abstract(参考訳): 読み込み順序推論は複雑な歴史写本のデジタル化において依然として重要なボトルネックであり、ページには複数の空間的にインターリーブされた読み込みストリームが含まれており、標準的な例はグロッサ・オーディナリアのレイアウトであり、中央のテキストは非正方形の非凸領域で巻く注釈によって囲まれている。
我々は,OCRテキスト行が有向な候補遷移グラフのノードとなり,エッジは2つの軽量言語モデル信号の重み付け加算アンサンブル(因果言語モデル条件条件付き確率とBERT次文予測,NSP;第3文埋め込み信号の評価を行ったが,読解順序は改善しなかった)によりスコアされ,グローバルな読解順序は,次数制約された指示経路被覆として復元される,訓練自由グラフベースのフレームワークを提案する。
難易度の高いエッジ選択のカスケード「エッジ盗難」障害を回避するために,高い機会コストでコミットメントを優先順位付けする最大信頼度推論則を提案する。
OmniDocBenchの140ページの複数カラムの英語サブセットを用いて、Grossa Ordinariaグリッドレイアウト、23のALTOページジオメトリ、23のALTOページジオメトリ、23のALTOページジオメトリ、および同一入力上の2つのLayoutReader変種(layout-onlyと text+layout)を比較した。
また、OmniDocBenchマルチカラムサブセットでは、XYカットの75%とLayoutReaderの25%に対して88%のマクロエッジ精度を実現しています。
LayoutReaderのベースラインは、ワードレベル対行レベルの粒度ミスマッチのため、低転送である。
また,水平面と垂直面の反射下でのミラー不変性の検証も行った。本手法では,1ポイント未満,古典的XYカットが2ポイント,LayoutReader-Tが8ポイントまで変化した。
関連論文リスト
- End-to-End Text Line Detection and Ordering [0.0]
Orliは、両方のサブタスクを単一のイメージ・ツー・シーケンス問題としてキャストするエンドツーエンドモデルである。
ページイメージから、Orliは読み順でテキスト行のベースラインを直接自動回帰生成する。
10の書記システムにまたがる196,691ページの異種コーパスで訓練された。
論文 参考訳(メタデータ) (2026-06-02T19:29:32Z) - Scaling Multi-Hop Training Data via Graph-Constrained Path Selection [40.133031562641044]
推論パスは文脈キーワードであるCentroidのグラフ上でオフラインに列挙され、教師は事前に検証されたパスにのみ呼び出される。
等訓練スケールでは、制約された鎖と制約のない鎖は区別不能な下流のパフォーマンスをもたらし、フルスケールでの利得は使用可能なコーパスの4.4$times$拡張から得られる。
Qwen3-32B CUAD法定契約コーパスから構築された80K のファインチューニングの Qwen3-32B は、クローズドブックの Token F1 を 21.66% から 38.58% に改善した。
論文 参考訳(メタデータ) (2026-05-29T12:39:03Z) - $β$-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment [53.42377319350806]
$-CLIPは、多言語テキスト条件のコントラスト学習フレームワークである。
$-CALは、この階層に固有のセマンティックオーバーラップに対処する。
$-CLIPは、高密度視覚言語対応のための堅牢で適応的なベースラインを確立する。
論文 参考訳(メタデータ) (2025-12-14T13:03:20Z) - Focus Anywhere for Fine-grained Multi-page Document Understanding [24.76897786595502]
本稿では,LVLMを単ページ/複数ページの文書に注目する上で,効果的パイプライン,ハイブリッドデータ,チューニング戦略であるFoxを提案する。
我々は、複数の視覚語彙を用いて、インターリーブされた文書ページの視覚的ハイブリッド知識を抽出する。
我々は、複数の視覚語彙と文書内図形理解の完全な反応を達成するために、複数の語彙間の視覚データを前景として描画する。
論文 参考訳(メタデータ) (2024-05-23T08:15:49Z) - Text Reading Order in Uncontrolled Conditions by Sparse Graph
Segmentation [71.40119152422295]
テキストの読み出し順序を識別するための軽量でスケーラブルで一般化可能なアプローチを提案する。
モデルは言語に依存しず、多言語データセットで効果的に実行される。
モバイルデバイスを含むあらゆるプラットフォームにデプロイできるほど小さい。
論文 参考訳(メタデータ) (2023-05-04T06:21:00Z) - End-to-End Page-Level Assessment of Handwritten Text Recognition [69.55992406968495]
HTRシステムは、文書のエンドツーエンドのページレベルの書き起こしに直面している。
標準メトリクスは、現れる可能性のある不整合を考慮していない。
本稿では、転写精度とROの良さを別々に検討する2つの評価法を提案する。
論文 参考訳(メタデータ) (2023-01-14T15:43:07Z) - Span Pointer Networks for Non-Autoregressive Task-Oriented Semantic
Parsing [55.97957664897004]
seq2seq、非自動回帰的、タスク指向を構築するための効果的なレシピは、3つのステップで発話とセマンティックフレームをマッピングする。
これらのモデルは通常、長さ予測によってボトルネックとなる。
本研究では,デコードタスクをテキスト生成からスパン予測へシフトさせる非自己回帰手法を提案する。
論文 参考訳(メタデータ) (2021-04-15T07:02:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。