論文の概要: Benchmarking Deep Learning Approaches for AEC Engineering Drawing Layout Detection and Information Extraction
- arxiv url: http://arxiv.org/abs/2607.18997v1
- Date: Tue, 21 Jul 2026 11:30:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.413632
- Title: Benchmarking Deep Learning Approaches for AEC Engineering Drawing Layout Detection and Information Extraction
- Title(参考訳): レイアウト検出と情報抽出を併用したAECエンジニアリングの深層学習手法のベンチマーク
- Abstract要約: 本研究では、AEC固有のレイアウトデータセットを構築し、5つのディープラーニングアーキテクチャをベンチマークする。
一般的なドキュメントデータセットで事前トレーニングされたモデルは、"ドメイン干渉"に悩まされ、パフォーマンスが低下する。
- 参考スコア(独自算出の注目度): 1.2964109036384739
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Information Extraction (IE) from Architecture, Engineering, and Construction (AEC) drawings remains hindered by manual inefficiency, while Layout Detection, a vital 'middleware' organizing graphical and textual hierarchies, is underexplored. General document layout models, optimized for text-centric content, lack validation on engineering drawings. This study constructs a custom AEC-specific layouts dataset and benchmarks five deep learning architectures. RF-DETR achieves state-of-the-art performance with an $mAP_{50}$ of 0.949, while the Vision-Language Model Qwen3-VL attains a leading F1-score of 0.911. Conversely, models pre-trained on general document datasets suffer from "domain interference", causing performance degradation. This establishes a robust technical foundation for automated IE in AEC.
- Abstract(参考訳): 建築, 工学, 建設 (AEC) の図面からの情報抽出 (IE) は手動の非効率性によって妨げられているが, グラフィカルおよびテキスト階層を整理する重要な「ミドルウェア」である Layout Detection は過小評価されている。
テキスト中心のコンテンツに最適化された一般的なドキュメントレイアウトモデルには、エンジニアリング図面の検証が欠如している。
本研究では、AEC固有のレイアウトデータセットを構築し、5つのディープラーニングアーキテクチャをベンチマークする。
RF-DETRは$mAP_{50}$0.949で最先端のパフォーマンスを達成し、Vision-Language Model Qwen3-VLは0.911でF1スコアを獲得した。
逆に、一般的なドキュメントデータセットで事前トレーニングされたモデルは、"ドメイン干渉"に悩まされ、パフォーマンスが低下する。
これにより、AECにおける自動IEのための堅牢な技術基盤が確立される。
関連論文リスト
- BBOmix: A Tabular Benchmark for Hyperparameter Optimization of Unsupervised Biological Representation Learning [1.5538313476921937]
$textbfBBOmix$は、現実世界の生物学的データの教師なし表現学習のための最初のオープンソースベンチマークである。
再構成損失と下流タスク性能の相関関係を定量化する。
論文 参考訳(メタデータ) (2026-06-03T17:48:31Z) - Exploring Easy Boosts for Lidar Semantic Scene Completion [61.665449818739155]
複雑な設計設計を必要とせずに、ライダーセマンティックシーン補完(SSC)の性能を高める「フリーランチ」戦略。
まず,市販セグメンタから意味的な擬似ラベルを付与することで,既存のアーキテクチャの性能が大幅に向上することが実証された。
論文 参考訳(メタデータ) (2026-06-02T17:59:59Z) - ArtifactLinker: Linking Scientific Artifacts for Automatic State-of-the-Art Discovery [58.48859167777581]
ArtifactLinkerは、データセットの最先端(SOTA)モデルを自動的に検出するフレームワークである。
14,053のアーティファクトと51,337の関係を持つArtifactBenchというベンチマークが提示されている。
その結果,(1)既存のアーティファクト間のグラフ構造がリンク予測の欠如に有効であること,(2)ArtifactLinkerを用いたエンドツーエンドのランキングと検証がSOTAの潜在的な結果の発見と研究の洞察に役立つこと,などが示唆された。
論文 参考訳(メタデータ) (2026-05-16T09:26:08Z) - MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale [92.09717763663873]
我々は、データエンジニアリングとトレーニング戦略設計を通じて、純粋に最先端の技術を進化させるMinerU2.5-Proを提案する。
コアとなるのは、カバレッジ、情報性、アノテーションの正確性を中心に設計されたData Engineだ。
我々は,MinerU2.5-Pro が OmniDocBench v1.6 上で 95.69 を達成することを示す。
論文 参考訳(メタデータ) (2026-04-06T15:44:18Z) - MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing [117.58619053719251]
MinerU2.5は、例外的な計算効率を維持しつつ、最先端の認識精度を実現する文書解析モデルである。
提案手法では,局所的なコンテンツ認識からグローバルなレイアウト解析を分離する,粗大な2段階解析戦略を採用している。
論文 参考訳(メタデータ) (2025-09-26T10:45:48Z) - Extracting Structured Requirements from Unstructured Building Technical Specifications for Building Information Modeling [0.0]
本研究では,建築情報モデリングと自然言語処理(NLP)の統合について検討する。
建設業界における非構造化のフランス建築技術仕様書からの要求の抽出を自動化することを目的としている。
その結果,CamemBERTとFr_core_news_lgはNERにおいて優れた性能を示し,F1スコアは90%以上,Random ForestはREにおいて最も有効であり,F1スコアは80%以上であった。
論文 参考訳(メタデータ) (2025-08-19T13:55:41Z) - Automated Parsing of Engineering Drawings for Structured Information Extraction Using a Fine-tuned Document Understanding Transformer [0.352650106994433]
本稿では,構造化情報抽出のためのハイブリッドディープラーニングフレームワークを提案する。
オブジェクト指向バウンディングボックス(OBB)モデルと変換器ベースの文書解析モデル(Donut)を統合する。
提案するフレームワークは、精度を改善し、手作業の労力を削減するとともに、精度駆動型産業におけるスケーラブルなデプロイメントをサポートする。
論文 参考訳(メタデータ) (2025-05-02T18:33:21Z) - Unveiling Document Structures with YOLOv5 Layout Detection [0.0]
本研究では,文書レイアウトの迅速同定と非構造化データの抽出を目的とした,最先端コンピュータビジョンモデルYOLOv5の利用について検討する。
主な目的は、文書レイアウトを効果的に認識し、構造化されていないデータを抽出できる自律システムを作ることである。
論文 参考訳(メタデータ) (2023-09-29T07:45:10Z) - Enhancing Visually-Rich Document Understanding via Layout Structure
Modeling [91.07963806829237]
レイアウトの知識をモデルに注入する新しい文書理解モデルであるGraphLMを提案する。
我々は、FUNSD、XFUND、CORDなど様々なベンチマークでモデルを評価し、最先端の結果を得た。
論文 参考訳(メタデータ) (2023-08-15T13:53:52Z) - A Semi-Supervised Assessor of Neural Architectures [157.76189339451565]
我々は、ニューラルネットワークの有意義な表現を見つけるためにオートエンコーダを用いる。
アーキテクチャの性能を予測するために、グラフ畳み込みニューラルネットワークを導入する。
論文 参考訳(メタデータ) (2020-05-14T09:02:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。