論文の概要: Training-Free Agentic Computer Vision for Structural Component Detection in 2D Structural Framing Plans
- arxiv url: http://arxiv.org/abs/2608.17237v2
- Date: Wed, 26 Aug 2026 04:17:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:14.700985
- Title: Training-Free Agentic Computer Vision for Structural Component Detection in 2D Structural Framing Plans
- Title(参考訳): 2次元フラーミング計画における構成成分検出のための学習自由エージェントコンピュータビジョン
- Abstract要約: この研究は、フレーミング計画PDFから構造成分の検出とモデルドラフトにエージェント視覚言語層を応用した最初のものである。
決定論的段階は、プリミティブを抽出し、次元比のコンセンサスによるスケールを推定し、明示的なドラフト文法を用いて5つのエンティティクラスを認識し、編集可能なレイアウトを組み立てる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Converting structural framing plans into editable finite-element model drafts is labor-intensive and susceptible to transcription errors. Existing building-component recognition systems generally depend on task-specific neural detectors, whereas language-model agents in structural engineering typically operate on text or model data rather than on drawings. To the authors' knowledge, this work is the first to apply an agentic vision-language layer to structural-component detection and model drafting from framing-plan PDFs without task-specific detector training or fine-tuning. A deterministic stage extracts geometric primitives, estimates scale by dimension-ratio consensus, recognizes five entity classes using an explicit drafting grammar, and assembles an editable layout. The agentic stage constrains typed corrections through deterministic candidates, operation-specific admission tests, change-level review, and fail-closed transactions. Evaluation used an author-generated benchmark of 100 plans, divided equally between a development half used for all rule revisions and a seed-disjoint held-out half generated after the rules were frozen and evaluated once. All scores are end-to-end results for the complete framework on the held-out half. Scale estimates were within 0.1% of the generator reference for every drawing. Recall and precision were 0.922/0.997 for columns, 0.886/0.990 for beams, 1.000/1.000 for walls, 1.000/1.000 for braces, and 1.000/0.964 for openings. A controlled study repeated two corruptions three times on three development drawings. Calibration passed all nine trials, whereas member repair satisfied every strict end-state criterion in five of nine trials. Because both benchmark halves share a generator, the evaluation does not address independently drafted plans, raster input, analytical connectivity, or solver validation.
- Abstract(参考訳): 構造フレーミング計画を編集可能な有限要素モデルドラフトに変換することは、労働集約的で、転写エラーの影響を受けやすい。
既存のビルディングコンポーネント認識システムは一般にタスク固有のニューラル検出器に依存しているのに対し、構造工学における言語モデルエージェントは通常、図面ではなくテキストやモデルデータで動く。
著者らの知る限り、この研究は、タスク固有の検出器トレーニングや微調整なしに、フレーミング計画PDFからの構造成分検出とモデルドラフトにエージェント視覚言語層を応用した最初のものである。
決定論的段階は、幾何学的プリミティブを抽出し、次元比のコンセンサスによるスケールを推定し、明示的なドラフト文法を用いて5つのエンティティクラスを認識し、編集可能なレイアウトを組み立てる。
エージェントステージは、決定論的候補、オペレーション固有の受け入れテスト、変更レベルのレビュー、フェイルクローズドトランザクションによる型付き修正を制約する。
著者が作成した100プランのベンチマークは、すべてのルール修正に使用される開発ハーフと、ルールが凍結され一度評価された後に生成されたシード非結合の保留ハーフとで等しく分けられた。
すべてのスコアは、維持された半分のフレームワークのエンドツーエンドの結果です。
スケール推定は、描画毎にジェネレータ基準の0.1%以内であった。
リコールと精度はカラムが0.922/0.997、ビームが0.886/0.990、壁が1.000/1.000、ブレスが1.000/1.000、開口部が1.000/0.964であった。
統制された研究は、3つの開発図面で2回の汚職を繰り返した。
校正は9つの試験すべてに合格し、一方、メンバーの修復は9つの試験のうち5つの厳格な終末期基準を満足させた。
両方のベンチマークハーフがジェネレータを共有するため、評価は独立にドラフトされた計画、ラスター入力、分析接続性、あるいは解決者検証に対処しない。
関連論文リスト
- Verification-Aware Training for Speculative Decoding [57.84976863792784]
VAT(Verification-Aware Training)は、トレーニングステップ毎に検証をシミュレートし、その結果の受け入れパターンと拒否パターンを監督するプラグインフレームワークである。
VATはトレーニング対象のみを変更するため、ドラフトアーキテクチャやターゲットモデル、推論手順を変更することなく、既存のメソッドの上にレイヤー化することができる。
VATは平均受理期間を最大11.4%改善し、ウォールクロックのスピードアップを最大8.7%向上させ、数学、コード、チャットベンチマークで一貫した利益を得ている。
論文 参考訳(メタデータ) (2026-08-31T01:42:10Z) - Structuring Semantic Embeddings for Principle Evaluation: A Prototype-Guided Contrastive Learning Approach [58.15427952222424]
汎用的なテキスト埋め込みはそのようなタスクに広くデプロイされているが、意味的類似性は意味的に似ているがタスク固有の例を示すことができる。
本稿では,凍結したテキスト埋め込み上に構築された幾何正規化モジュールであるPGCL(Prototype-Guided Contrastive Learning)を紹介する。
論文 参考訳(メタデータ) (2026-08-15T13:19:25Z) - Toward Auditable Fraud Detection: Combining Graph Features, Model Explanations, and Agentic Case Investigation [0.0]
不正検出システムは、説明可能でレビュー可能なまま、トランザクションボリュームの上昇とともにスケールする必要がある。
本研究では,勾配ブースト型分類器,グラフに基づく構造特徴,オートエンコーダに基づく異常信号,および調査エージェントを組み合わせた層状パイプラインについて検討する。
我々は,各コンポーネントは特定の条件下でのみ寄与し,調査エージェントからのもっともらしい根拠は,よりよい判断の証拠ではないと結論づける。
論文 参考訳(メタデータ) (2026-07-21T16:37:41Z) - SciDiagramEdit: Learning to Edit Scientific Diagrams from Paper Revisions [66.46898035008782]
SciDiagramEditは、自然論文の改訂から学習する、ベンチマークおよびスキル進化フレームワークである。
エージェント提案者は、複数のエポック上の実行トレースからエージェントのスキル仕様を継続的に洗練する。
得られたスキルは、保持された検証セットの編集精度を段階的に引き上げる。
論文 参考訳(メタデータ) (2026-07-16T17:58:36Z) - Weave of Formal Thought [51.56484100374058]
WoFT(Weave of Formal Thought)は、厳密な構文的検証と学習された構造的表現を結合したパラダイムである。
本稿では,非終端文法記号を直接生成にインターリーブするために,言語モデルを訓練する潜時可変微調整法を提案する。
Pythonでは、RWS目的のStarCoder2-3Bを微調整することで、テキストのみのSFTベースラインと比較して、トーケン毎のクロスエントロピーが14.3%削減される。
論文 参考訳(メタデータ) (2026-06-24T15:58:11Z) - Automated sign detection across the Electronic Babylonian Library: A large-scale dataset and end-to-end cuneiform OCR pipeline [0.8481798330936975]
これまでで最大の注釈付きcuneiform signデータセットを使用し、Deformable Detection Transformer(DETR)ベースのオブジェクト検出モデルを評価する。
提案システムでは, 自動タブレット側抽出, ライングルーピング, n-gram によるテキスト類似性評価と, 視覚的手話検出とテキスト構造を統合した。
推測では、Electronic Babylonian Library (eBL) コーパスの87,668個のタブレットフラグメントに適用され、約290万のサイン検出が可能である。
論文 参考訳(メタデータ) (2026-06-21T17:31:05Z) - A Hybrid Vision-Language Architecture for Automated Defect Reasoning and Report Generation in Industrial Inspection [0.42970700836450487]
本稿では,風力タービン羽根試験用分離・エッジ展開可能なパイプラインについて述べる。
The EyesはY26-x-obb指向のバウンディングボックスで、データセットネイティブの解像度で欠陥をローカライズする。
ブリッジは決定論的でパラメータフリーな符号化モジュールであり、検出された各バウンディングボックスをグリッド参照トークンにマップする。
論文 参考訳(メタデータ) (2026-05-26T04:27:38Z) - The Deterministic Horizon: Impossibility Results as Design Specifications for Trustworthy AI Systems [0.0]
この論文は、好奇心から不合理性の結果を設計規則に変える。
そのフラッグシップとなる結果は、アーキテクチャだけで設定された精度の高い天井を証明している。
同じ引数がサブフィールドにまたがって再キャストされる。
論文 参考訳(メタデータ) (2026-05-21T20:48:35Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - From Perception to Autonomous Computational Modeling: A Multi-Agent Approach [0.0]
本稿では,協調型大言語モデル(LLM)エージェントが完全計算力学ワークフローを自律的に実行する,解法に依存しないフレームワークを提案する。
エージェントは、パイプライン層間の条件付きイテレーションを導入する品質ゲートを備えた共有コンテキスト空間上の条件付き演算子として形式化される。
論文 参考訳(メタデータ) (2026-04-08T07:56:34Z) - MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale [92.09717763663873]
我々は、データエンジニアリングとトレーニング戦略設計を通じて、純粋に最先端の技術を進化させるMinerU2.5-Proを提案する。
コアとなるのは、カバレッジ、情報性、アノテーションの正確性を中心に設計されたData Engineだ。
我々は,MinerU2.5-Pro が OmniDocBench v1.6 上で 95.69 を達成することを示す。
論文 参考訳(メタデータ) (2026-04-06T15:44:18Z) - Designing Any Imaging System from Natural Language: Agent-Constrained Composition over a Finite Primitive Basis [1.7259824817932294]
spec.mdは構造化された仕様フォーマットで、一文の自然言語記述を有界再構成エラーのある検証された前方モデルに変換する。
設計から実数への誤差定理は、総再構成誤差を5つの独立な有界項に分解し、それぞれが補正作用にリンクする。
プリミティブを3Dから5Dのチェーンに構成する新しい10の設計は、あらゆる単一モダリティツールを超えて構成的なリーチを示している。
論文 参考訳(メタデータ) (2026-03-26T16:47:27Z) - EdiVal-Agent: An Object-Centric Framework for Automated, Fine-Grained Evaluation of Multi-Turn Editing [170.71134330650796]
EdiVal-Agentは、命令ベースの画像編集のためのオブジェクト指向評価フレームワークである。
標準のシングルターンだけでなく、マルチターンの命令ベースの編集を精度良く評価するように設計されている。
EdiVal-Benchは、インコンテキスト、フローマッチング、拡散パラダイムにまたがる9つの命令タイプと13の最先端編集モデルをカバーするベンチマークである。
論文 参考訳(メタデータ) (2025-09-16T17:45:39Z) - Understanding Factual Errors in Summarization: Errors, Summarizers,
Datasets, Error Detectors [105.12462629663757]
本研究では、既存の9つのデータセットから事実性エラーアノテーションを集約し、基礎となる要約モデルに従ってそれらを階層化する。
本稿では,この階層化ベンチマークにおいて,最近のChatGPTベースの指標を含む最先端の事実性指標の性能を比較し,その性能が様々な種類の要約モデルで大きく異なることを示す。
論文 参考訳(メタデータ) (2022-05-25T15:26:48Z) - Constructing interval variables via faceted Rasch measurement and
multitask deep learning: a hate speech application [63.10266319378212]
本稿では,教師付き深層学習と多面的ラッシュアイテム応答理論(IRT)構築手法を組み合わせることで,連続区間スペクトル上の複素変数を測定する手法を提案する。
われわれは、YouTube、Twitter、Redditから5万件のソーシャルメディアコメントを収集し、1万1000人の米国拠点のAmazon Mechanical Turkの労働者によってラベル付けされたデータセット上で、この新しい手法を実証した。
論文 参考訳(メタデータ) (2020-09-22T02:15:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。