論文の概要: DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings
- arxiv url: http://arxiv.org/abs/2607.15418v1
- Date: Thu, 16 Jul 2026 19:44:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.690552
- Title: DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings
- Title(参考訳): DrawingVQA: 複数次元ビジュアルテキスト推論のための実世界のベンチマーク
- Authors: Yoonhwa Jung, Junryu Fu, Mani Golparvar-Fard,
- Abstract要約: DrawingVQAは、マルチモーダルな大規模言語モデル(MLLM)を実世界の構築図面上で評価するために設計された最初のベンチマークである。
ドローイングVQAはこのギャップを33点の"Issued for Construction"ドローイングと92点の専門的な質問応答ペアで埋める。
- 参考スコア(独自算出の注目度): 0.4078247440919472
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: We introduce DrawingVQA, the first benchmark designed to evaluate multimodal large language models (MLLMs) on real-world construction drawings -- a core media in architecture, civil, and many other engineering practices. Unlike natural images or schematic floor plans, construction drawings fuse abstract geometry, symbolic notation, tabular data, annotations, and domain-specific text, forming a uniquely complex visual-textual domain core to engineering workflows. DrawingVQA bridges this gap with 33 "Issued for Construction" drawings and 92 expertly curated question-answer pairs, spanning three reasoning depths: perceptual understanding, contextual interpretation, and domain-expert reasoning. To evaluate model capabilities, we present a dual categorization framework to jointly analyze performance across seven construction-engineering and four MLLM capability dimensions -- the first to explicitly map engineering workflows to AI reasoning competencies. Evaluations of state-of-the-art MLLMs reveal a substantial gap between model and expert performance, particularly at higher reasoning depths. This benchmark lays a foundation for domain-specialized multimodal reasoning to allow for advancement on integration of AI-driven understanding and real-world engineering workflows.
- Abstract(参考訳): 我々はDrawingVQAについて紹介する。DrawingVQAは、建築、土木、その他多くのエンジニアリングプラクティスのコアメディアである実世界の構築図面上で、マルチモーダルな大規模言語モデル(MLLM)を評価するために設計された最初のベンチマークである。
自然画像やスキーマ的なフロアプランとは異なり、建設図面は抽象幾何学、記号表記、表形式データ、アノテーション、ドメイン固有のテキストを融合させ、エンジニアリングワークフローにユニークな複雑なビジュアルテキストドメインコアを形成する。
ドローイングVQAはこのギャップを33の"Issued for Construction"図と92の専門的にキュレートされた質問応答ペアで埋め、知覚的理解、文脈解釈、ドメインエキスパート推論という3つの推論深さにまたがる。
モデル機能を評価するために、我々は7つの構築エンジニアリングと4つのMLLM機能ディメンションでパフォーマンスを共同で分析する2つの分類フレームワークを提示します。
最先端MLLMの評価は、特に高い推論深度において、モデルと専門家のパフォーマンスの間に大きなギャップがあることを明らかにする。
このベンチマークは、AI駆動の理解と現実世界のエンジニアリングワークフローの統合を向上するための、ドメイン特化マルチモーダル推論の基礎を成している。
関連論文リスト
- Symbolic and Abstractive Reasoning with Complex Visual Queries [57.59111649292774]
CVQ(complex visual query)と呼ばれる新しい抽象データ型を探索する。
CVQは記号的・抽象的推論(英語版)を探索し、MLLMに対する人間のような神経-記号的推論の批判的かつ過小評価された次元である。
本稿では、MLLMを頑健な視覚的推論能力で段階的に装備する2段階のトレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-08T08:30:51Z) - Dual-Pathway Geometry-Aware MLLM for Spatial Intelligence [63.11502936651325]
本稿では,空間知能のための二経路幾何対応MLLMであるGAMSIを提案する。
RGB画像のみを入力とし、両方の幾何学的形態を統一された自己回帰バックボーン内に内包する。
GAMSIは、7つの空間インテリジェンスベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-05-25T01:33:19Z) - Benchmarking Requirement-to-Architecture Generation with Hybrid Evaluation [8.867061253116367]
大規模言語モデル(LLM)は、ソフトウェアエンジニアリングタスクの自動化において大きな可能性を証明している。
要件文書からソフトウェアアーキテクチャ設計を生成することは、ソフトウェア開発における重要なステップである。
R2ABenchは、さまざまな現実世界のソフトウェアプロジェクトと、包括的製品要求文書(PRD)と専門家による参照図を組み合わせた、新しいベンチマークである。
論文 参考訳(メタデータ) (2026-04-08T04:58:36Z) - Enginuity: Building an Open Multi-Domain Dataset of Complex Engineering Diagrams [2.8809775760443657]
Enginuity - 自動ダイアグラム解析用に設計された包括的な構造アノテーションを備えた、最初のオープンで大規模なマルチドメインエンジニアリングダイアグラムデータセットを提案する。
階層的なコンポーネント関係,コネクション,セマンティック要素をさまざまなエンジニアリング領域にわたって取得することにより,提案したデータセットは,構造化図解析,クロスモーダル情報検索,AI支援エンジニアリングシミュレーションなどの重要な下流タスクに,マルチモーダルな大規模言語モデルで対処することが可能になる。
論文 参考訳(メタデータ) (2026-01-19T18:54:50Z) - CircuitSense: A Hierarchical Circuit System Benchmark Bridging Visual Comprehension and Symbolic Reasoning in Engineering Design Process [29.38618453695266]
エンジニアリング設計は、システム仕様からコンポーネント実装までの階層的な抽象化を通して行われる。
MLLM(Multi-modal Large Language Models)は自然画像のタスクに優れるが、技術図から数学的モデルを抽出する能力はいまだ解明されていない。
textbfCircuitSenseは、コンポーネントレベルのスキーマからシステムレベルのブロックダイアグラムにまたがる8,006以上の問題を通じて、この階層の回路理解を評価するベンチマークである。
論文 参考訳(メタデータ) (2025-09-26T13:32:14Z) - SoM-1K: A Thousand-Problem Benchmark Dataset for Strength of Materials [16.756001896133757]
材料強度の問題に関する基礎モデルを評価するための,最初の大規模マルチモーダルベンチマークデータセットであるSoM-1Kを紹介する。
この研究は、エンジニアリングAIのための厳格なベンチマークを確立し、より堅牢なマルチモーダル推論機能を開発するための重要なニーズを強調している。
論文 参考訳(メタデータ) (2025-09-25T12:28:22Z) - Spatial Understanding from Videos: Structured Prompts Meet Simulation Data [89.77871049500546]
本稿では,事前学習された視覚言語モデルにおける3次元空間推論を,アーキテクチャを変更することなく拡張するための統一的なフレームワークを提案する。
このフレームワークは、複雑なシーンと質問を解釈可能な推論ステップに分解する構造化プロンプト戦略であるSpatialMindと、多様な3Dシミュレーションシーンから構築されたスケーラブルな質問応答データセットであるScanForgeQAを組み合わせる。
論文 参考訳(メタデータ) (2025-06-04T07:36:33Z) - OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models [58.45517851437422]
VsTP(Visually-situated text parsing)は、自動化された文書理解の需要が高まり、最近顕著な進歩を遂げている。
既存のソリューションは、タスク固有のアーキテクチャと個々のタスクの目的に依存していることが多い。
本稿では,テキストスポッティング,キー情報抽出,テーブル認識,レイアウト解析など,VsTPの典型的なタスクを統一する汎用モデルであるOmni V2を紹介する。
論文 参考訳(メタデータ) (2025-02-22T09:32:01Z) - A Cognitive Paradigm Approach to Probe the Perception-Reasoning Interface in VLMs [3.2228025627337864]
本稿では,視覚言語モデル(VLM)における知覚推論インタフェースを識別するための構造化評価フレームワークを提案する。
本稿では,人間の問題解決戦略を反映した3つの評価パラダイムを提案する。
このフレームワークを適用したCAは、リッチで独立に生成された記述を推論するために強力な言語モデルを活用し、新しい最先端(SOTA)パフォーマンスを実現することを実証する。
論文 参考訳(メタデータ) (2025-01-23T12:42:42Z) - GLDesigner: Leveraging Multi-Modal LLMs as Designer for Enhanced Aesthetic Text Glyph Layouts [53.568057283934714]
本稿では,コンテンツ対応のテキストロゴレイアウトを生成するVLM(Vision-Language Model)ベースのフレームワークを提案する。
本稿では,複数のグリフ画像を同時に処理するための計算コストを削減する2つのモデル手法を提案する。
本モデルでは,既存の公開データセットの5倍の広義のテキストロゴデータセットを2つ構築する。
論文 参考訳(メタデータ) (2024-11-18T10:04:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。