論文の概要: GReFEM: Multimodal LLMs as Zero-Shot Semantic Assistants for Physics-Guided 3D Mesh Refinement
- arxiv url: http://arxiv.org/abs/2607.08798v1
- Date: Wed, 08 Jul 2026 14:46:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.718689
- Title: GReFEM: Multimodal LLMs as Zero-Shot Semantic Assistants for Physics-Guided 3D Mesh Refinement
- Title(参考訳): GReFEM:物理誘導3次元メッシュ微細化のためのゼロショットセマンティックアシスタントとしてのマルチモーダルLCM
- Abstract要約: マルチモーダル大言語モデルの高レベルな意味論的理解は、有限要素メッシュの洗練のための、実行可能なゼロショット幾何学的プロキシとして機能するのか?
2次元MLLM事前学習と3次元ジオメトリのギャップを埋めるために,重要な特徴の可観測性を最大化するビュー選択モジュールであるortoViewsを導入する。
以上の結果から,MLLMは複雑な空間物理的指示を正確に追従するために頑健なゼロショット能力を示し,ブラインドアシスタントよりも高い精度でストレス関連特徴を分離することが明らかとなった。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Adaptive volumetric finite element meshing is a critical step in computer-aided engineering and analysis that dictates the computational budget of a given problem. It traditionally requires iterative PDE solvers or heavily supervised, data-driven surrogates trained on large-scale simulation data. While Multimodal Large Language Models (MLLMs) excel in 2D visual tasks, their zero-shot capability to semantically ground regions based on geometric understanding and physics remains an open question. Overall, this study explores a significant question: can the high-level semantic understanding of off-the-shelf MLLMs serve as a viable, zero-shot geometric proxy for finite element mesh refinement? To investigate this, we introduce GReFEM (Geometric Reasoning Enhanced Multimodal LLMs for Finite Element Meshing), a framework that utilizes MLLMs to visually localize stress-critical regions based on physics-guided textual prompts. To bridge the gap between 2D MLLM pre-training and 3D geometries, we introduce orthoViews, a view-selection module that maximizes the observability of key geometric features. We conduct an in-depth empirical evaluation across diverse CAD geometries, loading cases, and SOTA MLLMs, comparing them against a tuned geometric heuristic under a strict, matched refinement budget. Our findings reveal that MLLMs demonstrate robust zero-shot capacity to accurately follow complex spatial-physical instructions, isolating stress-relevant features with higher precision than blind heuristics. By mapping both the successes and current limitations of MLLMs in physical grounding, this study defines the frontier of foundation models as semantic assistants in automated simulation workflows.
- Abstract(参考訳): 適応体積有限要素メッシュリング(Adaptive volumetric finite element meshing)は、与えられた問題の計算予算を決定するコンピュータ支援工学と分析において重要なステップである。
伝統的には、大規模なシミュレーションデータに基づいて訓練された反復的なPDEソルバや、厳格に監督されたデータ駆動サロゲートが必要である。
MLLM(Multimodal Large Language Models)は2次元視覚タスクに優れるが、幾何学的理解と物理に基づく意味的な領域へのゼロショット能力は未解決の課題である。
全体として、本研究では、既成のMLLMの高レベルの意味論的理解は、有限要素メッシュ精錬のための実行可能なゼロショット幾何的プロキシとして機能するのか、という重要な疑問を提起する。
そこで我々は,GReFEM(Geometric Reasoning Enhanced Multimodal LLMs for Finite Element Meshing)を紹介した。
2次元MLLM事前学習と3次元ジオメトリのギャップを埋めるために,重要な幾何学的特徴の可観測性を最大化するビュー選択モジュールであるortoViewsを導入する。
各種CADジオメトリ,ローディングケース,SOTA MLLMの詳細な実験評価を行い,厳密で整合した改良予算の下での幾何的ヒューリスティックと比較した。
以上の結果から,MLLMは複雑な空間物理的指示を正確に追従するために頑健なゼロショット能力を示し,ブラインドヒューリスティックスよりも高い精度でストレス関連特徴を分離することが明らかとなった。
本研究は, 基礎モデルのフロンティアを, 自動シミュレーションワークフローにおけるセマンティックアシスタントとして定義する。
関連論文リスト
- Dual-Pathway Geometry-Aware MLLM for Spatial Intelligence [63.11502936651325]
本稿では,空間知能のための二経路幾何対応MLLMであるGAMSIを提案する。
RGB画像のみを入力とし、両方の幾何学的形態を統一された自己回帰バックボーン内に内包する。
GAMSIは、7つの空間インテリジェンスベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-05-25T01:33:19Z) - GeoAlign: Geometric Feature Realignment for MLLM Spatial Reasoning [12.641199394796436]
MLLM(Multimodal large language model)は様々な視覚的タスクにおいて顕著な性能を示したが、それでも空間的推論に苦慮している。
近年の取り組みは、3次元基礎モデルから幾何学的特徴を注入することでこれを緩和しているが、静的な単層抽出に依存している。
実要求に応えるために動的に多層幾何学的特徴を集約する新しいフレームワークGeoAlignを提案する。
論文 参考訳(メタデータ) (2026-04-14T11:58:02Z) - Let Geometry GUIDE: Layer-wise Unrolling of Geometric Priors in Multimodal LLMs [13.627465963609936]
GUIDE(Geometric Unrolling Inside MLLM Early-layers)は、プログレッシブな幾何学的事前注入フレームワークである。
本研究では,現在の意味論に基づいて必要な空間的手がかりを抽出できる文脈認識ゲーティングを提案する。
論文 参考訳(メタデータ) (2026-04-07T10:45:28Z) - GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models [70.61152292499737]
このギャップは、幾何学的事前の不足から生じるものではなく、訓練パラダイムの誤った調整から生じるものである、と我々は主張する。
既存のアプローチでは、通常、特徴の結合を示唆し、幾何学的な監督なしに下流のタスクを直接最適化する。
本稿では,下流適応前の構造知覚を明示的に活性化する幾何学的事前学習パラダイムであるGAP-MLLMを提案する。
論文 参考訳(メタデータ) (2026-03-17T12:43:48Z) - Concise Geometric Description as a Bridge: Unleashing the Potential of LLM for Plane Geometry Problem Solving [50.05273675575345]
PlaneThought Problem Solving (PGPS) は幾何学図と問題テキスト記述に基づく平面幾何学的問題を解決することを目的としている。
大規模言語モデル(LLM)は強力な推論能力を有しており、PGPSへの直接的な応用は視覚図の処理能力の欠如によって妨げられている。
視覚図の幾何学的記述を生成するためにMLLMインタープリタを訓練し、既製のLCMを用いて推論を行う。
論文 参考訳(メタデータ) (2026-01-29T02:03:33Z) - ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints [42.713620384054146]
本稿では,多段階空間推論能力の評価を目的とした新しいデータセットとベンチマークであるORIGAMISPACEを紹介する。
パターン予測,多段階空間推論,空間関係予測,終端CPコード生成という4つの評価課題を提案する。
論文 参考訳(メタデータ) (2025-11-23T13:42:22Z) - Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models [75.45940282834327]
本稿では,MLLMの空間的推論能力の評価と改善を目的とした視点学習を紹介する。
多様な視点とそれに対応する質問応答対を持つ100Kオブジェクト中心のイメージペアからなるViewpoint-100Kデータセットを提案する。
このアプローチでは2段階の微調整戦略を採用し,複数のタスクにまたがる大幅な改善を実現している。
論文 参考訳(メタデータ) (2025-11-03T14:27:00Z) - Large Language-Geometry Model: When LLM meets Equivariance [53.8505081745406]
本稿では,3次元物理システムを表現するための新しいフレームワークであるEquiLLMを提案する。
EquiLLMは分子動力学シミュレーション,ヒトの動作シミュレーション,抗体設計など,従来の手法よりも大幅に改善されている。
論文 参考訳(メタデータ) (2025-02-16T14:50:49Z) - MAPS: Advancing Multi-Modal Reasoning in Expert-Level Physical Science [62.96434290874878]
現在のMLLM(Multi-Modal Large Language Models)は、一般的な視覚的推論タスクにおいて強力な機能を示している。
我々は,MLLMに基づく物理知覚とシミュレーションによるマルチモーダル科学推論(MAPS)という新しいフレームワークを開発した。
MAPSは、専門家レベルのマルチモーダル推論タスクを物理的知覚モデル(PPM)を介して物理図理解に分解し、シミュレータを介して物理的知識で推論する。
論文 参考訳(メタデータ) (2025-01-18T13:54:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。