論文の概要: Text-Aided Multi-Modal Panoptic Symbol Spotting for CAD Floor Plan Drawings
- arxiv url: http://arxiv.org/abs/2607.12678v1
- Date: Tue, 14 Jul 2026 12:07:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.1361
- Title: Text-Aided Multi-Modal Panoptic Symbol Spotting for CAD Floor Plan Drawings
- Title(参考訳): CAD床平面描画のためのテキスト支援多モードパノプティカルシンボルスポッティング
- Abstract要約: TextCADはグラフィカルプリミティブとパノプティカルシンボルスポッティングのためのテキストアノテーションをモデル化するフレームワークである。
テキストCADはシンボルスポッティング性能と最先端の結果を効果的に向上することを示す。
- 参考スコア(独自算出の注目度): 11.891289170899425
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Computer-Aided Design (CAD) floor plan drawings contain both graphical primitives and textual annotations, which provide complementary geometric and semantic cues for intelligent design understanding. Among CAD analysis tasks, panoptic symbol spotting has become increasingly important with the growing demand for industrial digitalization and deep learning-based automation. However, most existing methods remain primarily primitive-centric and underexploit textual annotations, despite their critical semantic value. Even the few text-aware approaches often treat annotations only superficially, without properly modeling complex syntax and hierarchical semantics of CAD annotations, which leads to semantic loss and suboptimal spotting performance. To address these limitations, we propose TextCAD, a multimodal framework that jointly models graphical primitives and textual annotations for panoptic symbol spotting. Specifically, we design a Type-Attribute Correlation Encoder (TACE) to explicitly encode the compositional semantics within annotations by jointly modeling their types and attributes. We further introduce a Semantic Hierarchy Alignment framework with Multi-level Semantic Filtering (MSF) and primitive downsampling, which adaptively aligns annotation semantics with graphical primitives at different semantic levels and enables accurate cross-modal semantic injection and fusion. Experiments on real-world building-design datasets show that TextCAD effectively improves symbol spotting performance and achieves state-of-the-art results.
- Abstract(参考訳): CAD(Computer-Aided Design)のフロアプラン図にはグラフィカルプリミティブとテキストアノテーションの両方が含まれており、知的デザイン理解のための補完的な幾何学的および意味的な手がかりを提供する。
CAD解析タスクの中で,産業デジタル化やディープラーニングによる自動化の需要が高まるにつれて,パノプティカルシンボルのスポッティングがますます重要になっている。
しかし、既存のほとんどのメソッドは、その重要な意味的価値にもかかわらず、主にプリミティブ中心で過小評価されていないテキストのアノテーションのままである。
少数のテキスト認識アプローチでさえ、CADアノテーションの複雑な構文や階層的意味論を適切にモデル化することなく、アノテーションのみを表面的に扱うことが多く、セマンティックな損失と準最適スポッティングのパフォーマンスをもたらす。
このような制約に対処するために,図形プリミティブとテキストアノテーションを共同でモデル化するマルチモーダルフレームワークであるTextCADを提案する。
具体的には、タイプと属性を共同でモデル化することで、アノテーション内で構成意味を明示的にエンコードするタイプ属性相関エンコーダ(TACE)を設計する。
さらに,多レベルセマンティックフィルタ(MSF)とプリミティブダウンサンプリングを備えたセマンティック階層アライメントフレームワークを導入し,セマンティックなセマンティックなセマンティックなセマンティックなセマンティックなセマンティックなセマンティックなセマンティックなセマンティックなセマンティックなセマンティックなセマンティックなセマンティックなセマンティックなセマンティックなセマンティックなセマンティックなセマンティックなセマンティックインジェクションと融合を実現する。
実世界のビルディングデザインデータセットの実験により、TextCADはシンボルスポッティング性能を効果的に改善し、最先端の結果が得られることが示された。
関連論文リスト
- One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting [51.09550363815034]
シーンテキストスポッティングはテキスト認識と空間的局所化の間に高精度なアライメントを必要とする。
本研究では,個々のテキストインスタンスを単一のアンカー視覚トークンでルーティングする視覚中心のフレームワークであるSingle-Patch Text Spotting (SPaTS)を提案する。
SPaTS はフロンティアのクローズドソースMLLM と OCR MLLM の両方で一貫した性能を示し,その性能を著しく向上させる。
論文 参考訳(メタデータ) (2026-07-30T09:17:48Z) - Semantic-Structural Alignment for Generative Pictorial Charts [59.45629259524998]
画像チャートの自動合成のための生成フレームワークを提案する。
2つの並列外部制御信号によって誘導される二重条件生成タスクとしてこの問題をモデル化する。
本手法は,芸術的に魅力的で構造的に整合性のある図表を生成する。
論文 参考訳(メタデータ) (2026-05-05T05:20:46Z) - Learning 3D Representations for Spatial Intelligence from Unposed Multi-View Images [81.94999489820974]
UniSplat (UniSplat) は、未提示のマルチビュー画像から3D表現を学習するためのフィードフォワードフレームワークである。
エンコーダにおける幾何誘導を強化するデュアルマスキング戦略を導入する。
第2に,外見のセマンティックな矛盾を解消する粗大なガウス的スプレイティング戦略を開発する。
第3に、予測された3次元点と意味マップを画像平面に相互に関連付ける、ポーズ条件の補正機構を導入する。
論文 参考訳(メタデータ) (2026-04-12T10:36:18Z) - Bridging Cognitive Gap: Hierarchical Description Learning for Artistic Image Aesthetics Assessment [51.40989269202702]
審美的品質評価タスクは,AIGCの定量的評価システムの開発に不可欠である。
本研究では,記述生成による美的次元の分離を図った芸術的画像の美的評価フレームワークであるArtQuantを提案する。
提案手法は,従来のトレーニングの33%しか必要とせず,いくつかのデータセット上での最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-12-29T12:18:26Z) - Text-Enhanced Panoptic Symbol Spotting in CAD Drawings [14.367938077469008]
CAD自動化や設計検索といった下流アプリケーションを実現する上で、パノプティカルシンボルスポッティングは重要な役割を担っている。
既存の手法は主にCAD図面内の幾何学的プリミティブに焦点を当てている。
テキストアノテーションを組み込んだパノプティカルシンボルスポッティングフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-13T07:41:15Z) - Point or Line? Using Line-based Representation for Panoptic Symbol Spotting in CAD Drawings [67.5600169375126]
ベクトルグラフィカルプリミティブからなるCAD図面におけるパノプティカルシンボルスポッティングの課題について検討する。
既存の手法は通常、画像化、グラフ構築、あるいは点ベースの表現に依存している。
本稿では,プリミティブの行ベースの表現を通じてこれらの課題に対処する新しい手法であるVecFormerを提案する。
論文 参考訳(メタデータ) (2025-05-29T12:33:11Z) - Leveraging Foundation Models for Multimodal Graph-Based Action Recognition [2.066890710233268]
動的視覚符号化のためのビデオMAEとコンテキストテキスト埋め込みのためのBERTを統合したグラフベースのフレームワークを提案する。
提案手法は,多様なベンチマークデータセット上で,最先端のベースラインを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2025-05-21T07:15:14Z) - Draw with Thought: Unleashing Multimodal Reasoning for Scientific Diagram Generation [4.246322465055928]
そこで我々は,MLLMを指導し,図形を編集可能なmxGraph XMLコードに再構成する学習自由フレームワークDaw with Thought (DwT)を提案する。
DwTはモデル微調整なしで解釈可能で制御可能な出力を可能にする。
Plot2XMLは、ゴールドスタンダードのXMLアノテーションを備えた247の現実世界の科学図のベンチマークです。
論文 参考訳(メタデータ) (2025-04-13T08:22:09Z) - Improving vision-language alignment with graph spiking hybrid Networks [10.88584928028832]
本稿では,細粒度のセマンティックな特徴を生成するために,パノプティックセマンティック・セマンティック・セマンティクスの活用を必要とする包括的ビジュアルセマンティクス表現モジュールを提案する。
視覚的セマンティック情報を符号化するために,SNNとGATの相補的な利点を統合したグラフスパイキングハイブリッドネットワーク(GSHN)を提案する。
論文 参考訳(メタデータ) (2025-01-31T11:55:17Z) - Matching Visual Features to Hierarchical Semantic Topics for Image
Paragraph Captioning [50.08729005865331]
本稿では,階層的トピック誘導画像段落生成フレームワークを開発した。
複数の抽象レベルでの画像とテキストの相関をキャプチャするために、変分推論ネットワークを設計します。
段落生成を導くために、学習した階層的トピックと視覚的特徴を言語モデルに統合する。
論文 参考訳(メタデータ) (2021-05-10T06:55:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。