論文の概要: Can LLMs Learn and Apply Multi-Level Modelling Semantics? A First Empirical Study
- arxiv url: http://arxiv.org/abs/2607.13257v1
- Date: Tue, 14 Jul 2026 20:41:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.583136
- Title: Can LLMs Learn and Apply Multi-Level Modelling Semantics? A First Empirical Study
- Title(参考訳): LLMはマルチレベルモデリングセマンティックスを学べるか? : 最初の実証的研究
- Authors: Yuhong Fu, Weixing Zhang, Bowen Jiang, Haowei Cheng, Karamjti Kaur, Markus Stumptner,
- Abstract要約: マルチレベルモデリング(MLM)は、3つ以上の抽象化レベルを直接表現できるが、モデル正しさが依存するより複雑なセマンティック制約のコストがかかる。
本稿では,この問題に関する最初の実証的研究について述べる。
- 参考スコア(独自算出の注目度): 2.9612857576788447
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Industry 5.0 emphasises human-centric industrial system design, placing additional demands on modelling tools. Multi-level modelling (MLM) can directly represent three or more abstraction levels, but this comes at the cost of more complex semantic constraints that model correctness depends on. Large Language Models (LLMs) have been increasingly studied in model-driven engineering, but this evidence rests entirely on two-level modelling tasks, and whether it generalises to MLM, whose semantics differ in kind, remains untested. This paper presents the first empirical study of this question. We have three commercial LLMs (GPT-5.4, Claude Opus 4.6, and Gemini 3.1 Pro) generate multi-level models for the MULTI Warehouse Challenge in the SLICER language under six prompting strategies, yielding 90 generated models compared against a manually validated reference using fourteen metrics. Syntactic correctness is within reach, but semantic correctness is only partially achieved, with Instantiation/Specialisation Correctness ranging from 52% to 79%. Models reproduce content stated explicitly in the task text, but rarely complete structure and constraints the text implies without stating. Prompting strategies trade off precision against completeness, and self-checking functions mainly as a rule checker rather than reliably improving alignment with the reference design. Among the three LLMs, Claude shows the most balanced profile. These results clarify the boundaries of current LLM capability for MLM and inform the design of human-centred, AI-assisted modelling workflows for Industry 5.0.
- Abstract(参考訳): 産業 5.0 は人間中心の産業システム設計に重点を置いており、モデリングツールにさらなる需要を課している。
マルチレベルモデリング(MLM)は、3つ以上の抽象化レベルを直接表現できるが、モデル正しさが依存するより複雑なセマンティック制約のコストがかかる。
大規模言語モデル (LLM) は、モデル駆動工学においてますます研究されているが、この証拠は、完全に2段階のモデリングタスクに依存しており、それが意味論が異なるMLMに一般化するかどうかはまだ検証されていない。
本稿では,この問題に関する最初の実証的研究について述べる。
3つの商用LCM(GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro)がSLICER言語におけるマルチウェアハウスチャレンジのマルチレベルモデルを生成する。
構文的正しさは到達範囲内であるが、意味的正しさは部分的にしか達成されておらず、Instantiation/specisation correctnessは52%から79%である。
モデルはタスクテキストで明示的に記述された内容を再現するが、テキストが意味する完全な構造と制約を記述せずに再現することは滅多にない。
プロンプティング戦略は、完全性に対する精度と、参照設計との整合性を確実に改善するのではなく、主にルールチェッカーとして自己チェック機能とをトレードオフする。
3つのLDMの中で、クロードは最もバランスのとれたプロファイルを示している。
これらの結果は、MDMの現在のLLM能力の境界を明らかにし、産業用5.0のための人間中心AI支援モデリングワークフローの設計を通知する。
関連論文リスト
- Reliability of Large Language Models for Design Synthesis: An Empirical Study of Variance, Prompt Sensitivity, and Method Scaffolding [2.1843439591862333]
大規模言語モデル(LLM)は、ソフトウェアエンジニアリングタスクの自動化にますます適用されています。
本研究では,LLMがダイアグラム変換を超えて設計合成を行うことができるかどうかを検討する。
論文 参考訳(メタデータ) (2026-04-01T13:05:09Z) - Class Model Generation from Requirements using Large Language Models [5.685497917524985]
大規模言語モデル(LLM)は、自然言語要求から自動的にクラス図を生成することができる。
本稿では,GPT-5,Claude Sonnet 4.0,Gemini 2.5 Flash Thinking,Llama-3.1-8-B-Instructなどの最先端LLMの能力について検討する。
論文 参考訳(メタデータ) (2026-03-10T02:20:35Z) - One LLM to Train Them All: Multi-Task Learning Framework for Fact-Checking [7.856998585396422]
大規模言語モデル(LLM)は、統合されたエンドツーエンドの検証パイプラインを有効にすることで、自動化されたファクトチェック(AFC)を再構築している。
我々は,主張検出,エビデンスランキング,スタンス検出を共同で行うために,単一のモデルを微調整する,より効率的な代替手段として,textbfmulti-task Learning (MTL)を提案する。
論文 参考訳(メタデータ) (2026-01-16T13:44:25Z) - Can large language models assist choice modelling? Insights into prompting strategies and current models capabilities [0.0]
大規模言語モデル(LLM)は様々な分野をサポートするために広く使われているが、その選択肢モデリングの可能性はいまだに解明されていない。
本研究は, LLMの仕様における補助エージェントとしての可能性を検討するとともに, 技術的に実現可能なマルチノードロジットモデルの推定を行う。
論文 参考訳(メタデータ) (2025-07-29T13:24:44Z) - OptMerge: Unifying Multimodal LLM Capabilities and Modalities via Model Merging [124.91183814854126]
モデルマージは、複数のエキスパートモデルをひとつのモデルに組み合わせようとしている。
本稿ではMLLMのトレーニングと評価のタスクを明確に分割したモデルマージ研究のベンチマークを紹介する。
モデルマージは、トレーニングデータを必要とせずに改善されたMLLMを構築するための有望な方法であることがわかった。
論文 参考訳(メタデータ) (2025-05-26T12:23:14Z) - MM-R$^3$: On (In-)Consistency of Vision-Language Models (VLMs) [26.475993408532304]
本稿では,3つのタスク(質問文の表現,画像の復元,コンテキスト推論)に基づいて,SoTA視覚言語モデルの性能を解析する。
我々の分析では、一貫性が必ずしも精度と一致していないことを示し、高い精度のモデルが必ずしも一致しているとは限らないことを示し、その逆も示している。
本稿では,命令間の不整合を最小限に抑えるために訓練されたアダプタモジュールの形式で,シンプルながら効果的な緩和戦略を提案する。
論文 参考訳(メタデータ) (2024-10-07T06:36:55Z) - TAT-LLM: A Specialized Language Model for Discrete Reasoning over Tabular and Textual Data [73.29220562541204]
我々は,言語モデル(LLM)の驚くべきパワーを活用して課題を解決することを検討する。
LLaMA2を微調整し,既存のエキスパートアノテートデータセットから自動生成したトレーニングデータを用いてTAT-LLM言語モデルを開発する。
論文 参考訳(メタデータ) (2024-01-24T04:28:50Z) - LLM-Pruner: On the Structural Pruning of Large Language Models [65.02607075556742]
大規模言語モデル(LLM)は、言語理解と生成において顕著な能力を示している。
タスク非依存であり、元のトレーニングデータセットへの依存を最小限に抑えるという2つの制約の範囲内でLLMの圧縮に取り組む。
LLM-Prunerという名前のこの手法は、非臨界結合構造を選択的に除去する構造プルーニングを採用する。
論文 参考訳(メタデータ) (2023-05-19T12:10:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。