論文の概要: Foundation Models for Automatic CAD Generation
- arxiv url: http://arxiv.org/abs/2607.05573v1
- Date: Mon, 06 Jul 2026 19:17:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.306791
- Title: Foundation Models for Automatic CAD Generation
- Title(参考訳): CAD自動生成のための基礎モデル
- Authors: J de Curtò, Victoria Guillén, I. de Zarzà,
- Abstract要約: 本章では,機械部品の自動設計(CAD)のための基礎モデルに関する実証的研究を紹介する。
LLMForgeは空間的検証,解析的特徴スコアリング,メッシュ合成,マルチラウンド反復精錬を統合したマルチモデルテキスト・ツー・CADフレームワークである。
IterTracerの下では、4つの最高ランクのモデルが98.97%の成功率を持つ厳密なクラスタ(overall mean in [0.885, 0.890])を形成している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in Large Language Models (LLMs) and Vision-Language Models (VLMs) enable the automatic generation of parametric 3D designs from natural-language specifications. This chapter presents an empirical study of foundation models for automatic Computer-Aided Design (CAD) generation of mechanical parts, using a unified evaluation pipeline and a curated benchmark of 97 engineering design problems. We introduce LLMForge, a multi-model text-to-CAD framework integrating JSON-schema validation, analytic feature scoring, mesh synthesis, and multi-round iterative refinement, studied under two critique regimes. IterTracer uses a Phong-shaded ray-trace renderer with analytic visual metrics (silhouette IoU, hole visibility, edge clearance, aspect-ratio conformance) for lightweight geometry-aware feedback across rounds. IterVision replaces the analytic scorer with a VLM semantic critic (Qwen2.5-VL-72B) that evaluates rendered views via chain-of-thought visual reasoning, assessing spatial coherence and design intent. On a benchmark spanning four canonical geometry families (plates with holes and bolt circles, multi-feature boxes, flanged cylinders, and L-brackets), we evaluate seven foundation models: DeepSeek-V3.2, Qwen3-235B-A22B, Llama-3.3-70B, Gemma-3-27B, GLM-4.5, MiniMax-M2.1, and INTELLECT. Under IterTracer, the four highest-ranked models form a tight cluster (overall mean in [0.885, 0.890]) with 98.97% mesh success, showing that compact instruction-tuned models can match substantially larger systems. VLM-based critique in IterVision yields 100% watertight mesh generation on the leading model while surfacing systematic difficulty on rotationally symmetric geometries such as cylinders, where visual and semantic scoring diverge most. We discuss benchmark design, failure modes, CAD-oriented prompting, and implications for industrial workflows and scalable automated mechanical design.
- Abstract(参考訳): 近年のLarge Language Models (LLMs) とVision-Language Models (VLMs) は、自然言語仕様からパラメトリックな3Dデザインの自動生成を可能にしている。
本章では, 機械部品の自動作成のための基礎モデルについて, 統一評価パイプラインと97の工学設計問題をキュレートしたベンチマークを用いて実証的研究を行った。
我々は,JSONスキーマ検証,解析的特徴スコアリング,メッシュ合成,マルチラウンド反復精錬を統合したマルチモデルテキスト・ツー・CADフレームワークであるLLMForgeを紹介した。
IterTracerは、Pong-shaded ray-traceレンダラーを使用して、分析ビジュアルメトリクス(シルエットIoU、ホール可視性、エッジクリアランス、アスペクト比適合性)をラウンド全体の軽量な幾何学的フィードバックに使用する。
IterVisionは、分析スコアラをVLMセマンティック批評家(Qwen2.5-VL-72B)に置き換える。
4つの標準幾何学系(穴とボルト円を持つプレート、多機能箱、フランゲードシリンダー、Lブラケット)にまたがるベンチマークで、DeepSeek-V3.2、Qwen3-235B-A22B、Llama-3.3-70B、Gemma-3-27B、GLM-4.5、MiniMax-M2.1、INTELLECTの7つの基礎モデルを評価する。
IterTracerの下では、4つの最高ランクのモデルが98.97%のメッシュ成功率を持つ厳密なクラスタ(overall mean in [0.885, 0.890])を形成している。
VLMに基づくIterVisionの批判は、主モデル上で100%水密メッシュを生成する一方で、シリンダーのような回転対称な幾何学において、視覚的および意味的なスコアリングが最も多様である体系的困難を克服する。
本稿では, ベンチマーク設計, 故障モード, CAD指向のプロンプト, 産業ワークフロー, スケーラブルな自動機械設計への応用について論じる。
関連論文リスト
- Instruct-Particulate: Scaling Feed-Forward 3D Object Articulation with Kinematic Control [86.64250947574749]
合成された3Dオブジェクトの再構成は、アニメーション、ゲーム、ロボットシミュレーションにおいて重要である。
最近のニューラルネットワークは、3Dオブジェクトの明瞭な構造を推定できるが、その一般化は注釈付きデータの不足によって制限されている。
Instruct-Particulateは、3Dメッシュとターゲットキネマティック仕様を併用するモデルである。
論文 参考訳(メタデータ) (2026-06-12T17:59:36Z) - Dual-Pathway Geometry-Aware MLLM for Spatial Intelligence [63.11502936651325]
本稿では,空間知能のための二経路幾何対応MLLMであるGAMSIを提案する。
RGB画像のみを入力とし、両方の幾何学的形態を統一された自己回帰バックボーン内に内包する。
GAMSIは、7つの空間インテリジェンスベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-05-25T01:33:19Z) - RISE-Video: Can Video Generators Decode Implicit World Rules? [71.92434352963427]
テキスト画像合成(TI2V)の先駆的推論指向ベンチマークであるRISE-Videoを提案する。
RISE-Videoは、8つの厳格なカテゴリにまたがる、細心の注意深い人手によるサンプル467種からなる。
本研究では,LMM(Large Multimodal Models)を利用して人中心評価をエミュレートする自動パイプラインを提案する。
論文 参考訳(メタデータ) (2026-02-05T18:36:10Z) - Visual Autoregressive Modelling for Monocular Depth Estimation [69.01449528371916]
本稿では,視覚的自己回帰(VAR)に基づく単眼深度推定手法を提案する。
提案手法は,大規模テキスト・画像VARモデルに適応し,スケールワイド・コンディショナル・アップサンプリング機構を導入する。
本研究では,屋内ベンチマークにおける制約付きトレーニング条件下での最先端性能と,屋外データセットに適用した場合の強い性能について報告する。
論文 参考訳(メタデータ) (2025-12-27T17:08:03Z) - A Study of Finetuning Video Transformers for Multi-view Geometry Tasks [38.47908309127428]
ビデオに事前訓練された汎用モデルは、最小限の適応を伴う多視点問題に容易に移行できる。
Sintel clean, Sintel final, and KITTI datasetsにおいて、終点誤差(EPE)0.69, 1.78, 3.15の光学フロー推定のためのトップデータセットの一般化結果が得られた。
論文 参考訳(メタデータ) (2025-12-21T10:41:11Z) - Beyond 'Templates': Category-Agnostic Object Pose, Size, and Shape Estimation from a Single View [69.6117755984012]
物体の6Dポーズ、サイズ、形状を視覚入力から推定することは、コンピュータビジョンの基本的な問題である。
一つのRGB-D画像から6次元のポーズ,サイズ,密な形状を同時に予測する統合されたカテゴリ非依存フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-13T17:49:15Z) - Human-in-the-Loop: Quantitative Evaluation of 3D Models Generation by Large Language Models [0.0]
本稿では,大規模言語モデルの生成した3次元モデルの定量的評価のためのループ・フレームワークの人間について紹介する。
本稿では, 体積精度, 表面アライメント, 次元忠実度, トポロジ的複雑度など, 類似度と複雑性の総合的な指標スイートを提案する。
本研究は,コードレベルが完璧に再構築され,意味的豊かさが向上し,生成精度が向上したことを示す。
論文 参考訳(メタデータ) (2025-09-06T11:04:15Z) - HybridMQA: Exploring Geometry-Texture Interactions for Colored Mesh Quality Assessment [7.526258700061012]
メッシュ品質評価(MQA)モデルは、メッシュ運用システムの設計、最適化、評価において重要な役割を果たす。
モデルベースおよびプロジェクションベースのアプローチを統合するハイブリッドフル参照色付きMQAフレームワークであるHybridMQAを紹介する。
提案手法はグラフ学習を用いて詳細な3次元表現を抽出し,新しい特徴レンダリングプロセスを用いて2次元に投影する。
論文 参考訳(メタデータ) (2024-12-02T21:35:33Z) - CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning [61.21923643289266]
カオス・オブ・マニピュレーション(Chain of Manipulations)は、視覚言語モデル(Vision-Language Models)が、エビデンスを段階的に解決するメカニズムである。
トレーニング後、モデルは外部ツールを介さずに、本質的な操作(グラウンド、ズームインなど)を積極的に行うことで、様々な視覚的問題を解決することができる。
トレーニングされたモデルである textbfCogCoM は、4つのカテゴリの9つのベンチマークで最先端のパフォーマンスを実現しています。
論文 参考訳(メタデータ) (2024-02-06T18:43:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。