論文の概要: SimuVerity: Benchmarking Agents for Engineering-Grade Simulink Model Generation
- arxiv url: http://arxiv.org/abs/2610.02304v1
- Date: Thu, 01 Oct 2026 17:58:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.034022
- Title: SimuVerity: Benchmarking Agents for Engineering-Grade Simulink Model Generation
- Title(参考訳): SimuVerity: エンジニアリンググレードシミュリンクモデル生成のためのベンチマークエージェント
- Abstract要約: SimuVerityは10のエンジニアリングドメインにわたる101のテキストから実行可能なSimulinkモデル生成タスクのベンチマークである。
各タスクに対して、実行可能システムプロファイルは、エンジニアリング仕様とネイティブシミュレーションシナリオの4つのファミリの基礎となる。
階層的評価器は、まずアーティファクトデリバリ、ネイティブエグゼクタビリティ、エンジニアリングの資格をチェックし、次に6次元にわたる資格付きモデルを評価する。
- 参考スコア(独自算出の注目度): 22.487733455455565
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing Simulink benchmarks mainly evaluate whether generated models compile, execute, or resemble a reference model. These criteria do not establish whether a model satisfies its engineering requirements. We introduce SimuVerity, a benchmark of 101 text-to-executable Simulink model-generation tasks across ten engineering domains. For each task, executable-system profiles ground the engineering specification and four families of native simulation scenarios. A hierarchical evaluator first checks artifact delivery, native executability, and engineering qualification, then scores qualified models across six dimensions covering accuracy, output quality, mechanistic fidelity, control and causal integrity, operating-domain robustness, and dynamic response. We evaluate six agent systems with SimuVerity. The best system achieves an overall score of only 42.86. The results show that structural similarity is a poor proxy for engineering performance: capability bottlenecks arise both in producing qualified implementations and in satisfying multidimensional requirements after qualification. Meanwhile, some high-scoring models still exhibit severe visual-layout disorder. SimuVerity provides a systematic basis for assessing agents' engineering capabilities and diagnosing failures in executable Simulink model generation.
- Abstract(参考訳): 既存のSimulinkベンチマークは、生成されたモデルが参照モデルをコンパイル、実行、あるいは類似しているかどうかを主に評価する。
これらの基準は、モデルがそのエンジニアリング要件を満たすかどうかを定めていない。
SimuVerityは10のエンジニアリングドメインにわたる101のテキストから実行可能なSimulinkモデル生成タスクのベンチマークである。
各タスクに対して、実行可能システムプロファイルは、エンジニアリング仕様とネイティブシミュレーションシナリオの4つのファミリの基礎となる。
階層的評価器は、まず、アーティファクトのデリバリ、ネイティブ実行可能性、エンジニアリングの資格をチェックし、次に、正確性、出力品質、機械的忠実性、制御と因果的整合性、操作ドメインの堅牢性、動的応答を含む6つの次元の有資格モデルを評価する。
我々はSimuVerityを用いて6つのエージェントシステムを評価する。
最高スコアは42.86点である。
その結果, 構造的類似性は工学的性能の指標として不十分であることが示唆された。
一方、一部のハイスコアモデルでは、深刻な視覚的レイアウト障害を呈している。
SimuVerityは、エージェントのエンジニアリング能力を評価し、実行可能なSimulinkモデル生成の失敗を診断するための体系的な基盤を提供する。
関連論文リスト
- Model-Driven Discipline for Multi-Agent LLMs: Requirement-to-Verification Generation of Traceable System Models [62.62160094849002]
RADIANTは、MDEとMulti-Agent Large Language Modelを組み合わせたエンジニアリング方法論である。
工学的なフェーズにまたがる異種モデルを自動的に生成する。
正確かつ自動的な変更インパクト分析を提供する。
論文 参考訳(メタデータ) (2026-07-18T08:50:55Z) - Integration of an Agent Model into an Open Simulation Architecture for Scenario-Based Testing of Automated Vehicles [1.0499611180329804]
本稿では,ツールに依存しないトラヒックエージェントモデルの統合を可能にする,標準化されたモジュール化されたシミュレーション統合アーキテクチャを提案する。
このアーキテクチャは、構造化メッセージフォーマットとしてOpen Simulation Interface(OSI)と、動的モデル交換のためのFMI(Functional Mock-up Interface)の上に構築されている。
評価の一環として, モデルが全てのシミュレーションプラットフォームにおいて一貫した振る舞いをもたらすことを示す。
論文 参考訳(メタデータ) (2026-05-13T13:47:51Z) - Toward Visually Realistic Simulation: A Benchmark for Evaluating Robot Manipulation in Simulation [62.51953630639423]
既存のベンチマークには視覚的リアリズムがなく、シミュレーションと現実の間に大きな領域ギャップが生じる。
シミュレーションにおけるロボット操作評価のための,視覚的にリアルなベンチマークであるVISERを提案する。
VISERは、物理ベースのレンダリング(PBR)素材を備えた1000以上の3Dアセットの高忠実度データセットと、それらのアセットから作成される3Dシーンを、レイアウトや生成によって構成する。
論文 参考訳(メタデータ) (2026-05-07T14:13:05Z) - Source-Code Analysis of iFogSim for Simulating Distributed IoT Architectures: Coverage, Challenges, and Enhancements [0.0]
iFogSimは、フォグとエッジコンピューティングの研究コミュニティで広く採用されているプラットフォームの1つだ。
しかし、非標準のアプリケーション固有のアーキテクチャにiFogSimを使った経験は、まだ完全に文書化されていない。
この記事では2つの補完的なコントリビューションを通じて、そのガイダンスを提供するのに役立ちます。
論文 参考訳(メタデータ) (2026-04-25T03:20:25Z) - Modeling and Simulation Based Engineering in the Context of Cyber-Physical Systems [51.82266520875928]
実行セマンティクスは、第一級のエンジニアリングエンティティとして扱われない。
モデリングとシミュレーションに基づくエンジニアリングは、正式な実行、実験的な実行、検証、アクティビティによる検証を交互に行う反復サイクルのエンジニアリングを組織する。
これらの応用は、フレームワークがCPSを超えて、明示的に定義された実行条件に依存するあらゆるシステムに一般化することを示している。
論文 参考訳(メタデータ) (2026-04-13T12:42:12Z) - Rethinking Scientific Modeling: Toward Physically Consistent and Simulation-Executable Programmatic Generation [8.067859101380389]
非実行可能または物理的に一貫性のない出力は、厳密な工学的制約の下では依然として一般的である。
物理に一貫性のある自動建築モデリングのための枠組みを提案する。
CivilInstructは、構造工学の知識と制約推論を形式化するドメイン固有のデータセットとして導入された。
MBEvalは、実行可能性と構造的ダイナミクスの一貫性を評価する検証駆動ベンチマークとして提示される。
論文 参考訳(メタデータ) (2026-02-06T06:57:04Z) - OmniEAR: Benchmarking Agent Reasoning in Embodied Tasks [52.87238755666243]
OmniEARは,言語モデルが身体的相互作用やツールの使用,マルチエージェントの協調にどう影響するかを評価するためのフレームワークである。
我々は、家庭と工業領域にまたがる1500のシナリオにおける連続的な物理的特性と複雑な空間的関係をモデル化する。
我々の体系的な評価は、モデルが制約から推論しなければならない場合、厳しい性能劣化を示す。
論文 参考訳(メタデータ) (2025-08-07T17:54:15Z) - YuLan-OneSim: Towards the Next Generation of Social Simulator with Large Language Models [50.35333054932747]
本稿では,YuLan-OneSimというソーシャルシミュレータを紹介する。
ユーザは、シミュレータとの自然言語インタラクションを通じて、シミュレーションシナリオを記述し、洗練することができます。
我々は、経済学、社会学、政治、心理学、組織、人口統計学、法律、コミュニケーションを含む8つの領域にまたがる50のデフォルトシミュレーションシナリオを実装した。
論文 参考訳(メタデータ) (2025-05-12T14:05:17Z) - Semantic Capability Model for the Simulation of Manufacturing Processes [38.69817856379812]
シミュレーションは製造工程の検査の機会を提供する。
異なるシミュレーションの組み合わせは、あるシミュレーションの出力が別のシミュレーションの入力パラメータとして機能し、結果として一連のシミュレーションとなるときに必要である。
シミュレーション、特定の知識を生成する能力、それぞれの品質基準を表現した情報モデルが導入された。
論文 参考訳(メタデータ) (2024-08-15T09:28:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。