論文の概要: Heterogeneous Element-Aware Cross-Version Differencing of Scientific Documents via Layout-Aware Alignment and Structure-Aware Reasoning
- arxiv url: http://arxiv.org/abs/2607.14117v2
- Date: Wed, 29 Jul 2026 06:21:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:38.90365
- Title: Heterogeneous Element-Aware Cross-Version Differencing of Scientific Documents via Layout-Aware Alignment and Structure-Aware Reasoning
- Title(参考訳): レイアウト・アウェア・アライメントと構造・アウェア・推論による異種元素・アウェア・クロスバーション・ディフレクション
- Abstract要約: 科学的文書の相互変換の違いは学術出版や技術文書に不可欠である。
本稿では,科学的文書の相違を考慮に入れたレイアウト対応異種要素認識フレームワークを提案する。
- 参考スコア(独自算出の注目度): 3.5587329353214145
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Cross-version differencing of scientific documents is essential in scholarly publishing and technical documentation, but remains challenging because scientific documents are page-structured artifacts containing heterogeneous elements such as text, tables, formulas, figures, and layout cues. Existing text-sequence-based methods often lose layout and structural information, while image-based methods lack semantic interpretability and are sensitive to rendering variation. To address these limitations, this paper proposes a layout-aware heterogeneous element-aware framework for scientific document differencing. The framework decomposes document versions into semantically typed elements, establishes cross-version correspondence through an alignment-first mechanism that jointly models spatial, content, and structural compatibility, and performs type-aware difference reasoning over aligned element pairs. It supports unified change detection, localization, structure-awareness analysis, and alignment/matching evaluation across text, tables, formulas, and figures. Experiments on real-world scientific PDF data from journal production proofreading workflows show that the proposed framework consistently outperforms element-specific baselines. It achieves detection F1 scores of 0.903, 0.855, 0.862, and 0.845 for text, tables, formulas, and figures, respectively, with further improvements in localization, structure awareness, and matching quality. Ablation and sensitivity analyses confirm the effectiveness of cross-version alignment, type-specific representations, structure-aware reasoning, and compatibility-weight design. These results demonstrate that heterogeneous element-aware differencing provides a robust and interpretable solution for scientific document comparison in realistic editorial production scenarios.
- Abstract(参考訳): 科学的文書の相互変換は学術的な出版や技術文書には不可欠であるが、学術文書はテキスト、表、公式、図形、レイアウトといった異質な要素を含むページ構成の人工物であるため、依然として困難である。
既存のテキストシーケンスベースの手法はレイアウトや構造情報を失うことが多いが、画像ベースの手法は意味論的解釈性に欠け、レンダリングのバリエーションに敏感である。
本稿では,これらの制約に対処するため,科学的文書の相違を考慮に入れたレイアウト対応異種要素認識フレームワークを提案する。
このフレームワークは、文書のバージョンを意味的に型付けされた要素に分解し、空間、内容、構造的互換性を共同でモデル化するアライメントファースト機構を通じてクロスバージョン対応を確立し、整列要素対に対して型認識差分推論を行う。
統合された変更検出、ローカライゼーション、構造認識分析、テキスト、テーブル、公式、図形間のアライメント/マッチング評価をサポートする。
ジャーナル生産証明ワークフローから得られた実世界の科学的PDFデータに関する実験により、提案フレームワークは要素固有のベースラインを一貫して上回っていることが示された。
テキスト, 表, 公式, 図形に対して 0.903, 0.855, 0.862, 0.845 の F1 スコアを検出でき, ローカライゼーション, 構造認識, マッチング品質がさらに向上した。
アブレーションと感度分析により、クロスバージョンアライメント、タイプ固有表現、構造認識推論、互換性重み付け設計の有効性が確認された。
これらの結果は、異種要素認識の相違が、現実的な編集のシナリオにおける科学的文書比較の堅牢かつ解釈可能なソリューションを提供することを示した。
関連論文リスト
- Technical Manual for a Toolkit for Measuring Contextual Individuation in Transformer Language Models [0.0]
トランスフォーマー言語モデルは、その埋め込み層における単語タイプに単一の文脈非依存ベクトルを割り当てるが、その単語が後の層でコンテキストによって発生すると広く信じられている。
この信念をきれいにテストするには、文脈と意図された感覚が制御されたラベル付けされた方法で変化している間に、単語の形式を固定する構造が必要である。
このマニュアルはそのような構造を中心に構築されたオープンツールキットを文書化し、それをブリッジ形式と呼ぶ。
論文 参考訳(メタデータ) (2026-09-04T16:38:39Z) - NaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents [18.60763757268658]
文書解析のための統一フレームワークであるNaviDC-OCRを提案する。
NaviDC-OCRは、幾何学的知覚をVLMに組み込む変形認識学習を導入している。
さまざまな文書解析ベンチマークで最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-08-13T07:34:21Z) - RT-DocLayout: Real-Time End-to-End Document Layout Analysis with Reading Order in the Wild [14.715243408844058]
文書レイアウト解析のための高効率なエンドツーエンドフレームワークRT-Docを提案する。
提案モデルは,レイアウト要素の分類,画素レベルのセグメンテーション,幾何学的順序順予測を統一する。
RT-Docは、フルドキュメントの再構築品質を大幅に改善し、現実世界の文書インテリジェンスシステムのスケーラブルで実用的な基盤を提供する。
論文 参考訳(メタデータ) (2026-06-22T13:48:39Z) - MPDocBench-Parse: Benchmarking Practical Multi-page Document Parsing [74.84107522458798]
MPDocBench-Parseは、現実世界のアプリケーションにおけるマルチページ文書解析のためのベンチマークである。
433の注釈付き文書に3,246ページあり、英語と中国語の15種類の文書を網羅しており、レイアウトは様々である。
論文 参考訳(メタデータ) (2026-05-21T07:36:41Z) - Document-as-Image Representations Fall Short for Scientific Retrieval [54.7382379182364]
本稿では,基礎となる学術論文から構築された新しいベンチマークであるArXivDocを紹介する。
文書長が増大するにつれて、文書・画像表現は一貫して準最適であることが示される。
テキストベースの表現は、文字ベースのクエリでも、キャプションや周囲のコンテキストを活用することで、最も効果的である。
論文 参考訳(メタデータ) (2026-04-20T17:00:17Z) - Structured Prompt Optimization for Few-Shot Text Classification via Semantic Alignment in Latent Space [3.66782592128973]
本研究は, 意味的絡み合い, ラベル構造の不明確さ, 特徴表現不足といった問題に対処する。
低リソース条件下でのセマンティック理解とタスク適応を強化するために,構造化プロンプトに基づく最適化フレームワークを提案する。
実験結果から,提案手法は意味的矛盾やラベルの曖昧さを効果的に軽減する。
論文 参考訳(メタデータ) (2026-02-27T07:31:16Z) - MoDora: Tree-Based Semi-Structured Document Analysis System [62.01015188258797]
半構造化文書は、様々な不規則なレイアウトで配置された様々なインターリーブされたデータ要素を統合する。
MoDora は半構造化文書解析のための LLM を利用したシステムである。
実験では、MoDoraは5.97%-61.07%の精度でベースラインを上回っている。
論文 参考訳(メタデータ) (2026-02-26T14:48:49Z) - PDFInspect: A Unified Feature Extraction Framework for Malicious Document Detection [0.0]
この研究は、グラフベース、構造化、メタデータ駆動分析を統合し、PDF文書ごとにリッチな特徴表現を生成する統一的なフレームワークを提案する。
提案されたアプローチはスケーラブルで、170で、現実世界のPDF脅威インテリジェンスをサポートするように設計されている。
論文 参考訳(メタデータ) (2026-01-19T09:23:40Z) - Towards Unified Multi-granularity Text Detection with Interactive Attention [56.79437272168507]
Detect Any Text"は、シーンテキストの検出、レイアウト分析、ドキュメントページの検出を結合的なエンドツーエンドモデルに統合する高度なパラダイムである。
DATにおける重要なイノベーションは、テキストインスタンスの表現学習を大幅に強化する、粒度横断型アテンションモジュールである。
テストによると、DATは様々なテキスト関連ベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-05-30T07:25:23Z) - Comprehensive Studies for Arbitrary-shape Scene Text Detection [78.50639779134944]
ボトムアップに基づくシーンテキスト検出のための統合フレームワークを提案する。
統一されたフレームワークの下では、非コアモジュールの一貫性のある設定が保証されます。
包括的調査と精巧な分析により、以前のモデルの利点と欠点を明らかにしている。
論文 参考訳(メタデータ) (2021-07-25T13:18:55Z) - Multilevel Text Alignment with Cross-Document Attention [59.76351805607481]
既存のアライメントメソッドは、1つの事前定義されたレベルで動作します。
本稿では,文書を文書間注目要素で表現するための階層的アテンションエンコーダを予め確立した新しい学習手法を提案する。
論文 参考訳(メタデータ) (2020-10-03T02:52:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。