論文の概要: ModBench: A Pipeline for Building Modelica Benchmark Datasets Mined from Library Repositories
- arxiv url: http://arxiv.org/abs/2608.16638v1
- Date: Mon, 17 Aug 2026 14:35:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.74821
- Title: ModBench: A Pipeline for Building Modelica Benchmark Datasets Mined from Library Repositories
- Title(参考訳): ModBench: ライブラリリポジトリから抽出したModelica Benchmarkデータセットを構築するパイプライン
- Abstract要約: ModBenchは、モデルスナップショットのベンチマークデータセットを生成するために、ModelicaライブラリのGitリポジトリをマイニングするパイプラインである。
データセット、そのAPI、およびデータ生成パイプラインは、モデル進化分析、コンパイラテスト、自動モデル修復または生成に関する将来の研究をサポートするために、一般公開されている。
- 参考スコア(独自算出の注目度): 3.8699151027079566
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Research on equation-based cyber-physical systems modeling languages, such as Modelica, is constrained by the lack of curated benchmark datasets. This limits empirical insight into the evolution and development of models. We address this gap with ModBench, a pipeline that mines Git repositories of Modelica libraries to produce benchmark datasets of model snapshots. The pipeline (1) filters repository commits to retain human-authored, Modelica-relevant revisions; (2) extracts simulation-eligible classes; and (3) builds canonical representations of Modelica classes. For empirical validation, we applied ModBench to the Modelica Standard Library (MSL) and report the resulting dataset, spanning the full commit history (since Modelica language v3), with 85,562 distinct class snapshots, and links enabling traceability to original models and Git metadata. The dataset, its API, and the data generation pipeline are publicly available to support future research on model evolution analysis, compiler testing, and automated model repair or generation.
- Abstract(参考訳): Modelicaのような方程式に基づくサイバー物理システムモデリング言語の研究は、キュレートされたベンチマークデータセットの欠如によって制約されている。
これにより、モデルの進化と発展に関する経験的な洞察が制限される。
このギャップに対処するModBenchは、ModelicaライブラリのGitリポジトリをマイニングして、モデルスナップショットのベンチマークデータセットを生成するパイプラインです。
The pipeline (1) filters repository commits to maintain human-authored, Modelica-relevant revisions; (2) extracts simulation-eligible class; and (3) build canonical representations of Modelica class。
実証的な検証のために、ModBenchをModelica Standard Library(MSL)に適用し、完全なコミット履歴(Modelica言語v3以降)にまたがるデータセットを報告しました。
データセット、そのAPI、およびデータ生成パイプラインは、モデル進化分析、コンパイラテスト、自動モデル修復または生成に関する将来の研究をサポートするために、一般公開されている。
関連論文リスト
- SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models [88.64689505355055]
我々は、データ準備から長距離推論まで、インタラクティブなビデオワールドモデルを構築するための完全にオープンな基盤であるSolarWMを紹介した。
SolarWMは、再構成可能なマルチソースデータエンジンとバックボーンネイティブ適応フレームワークとの結合に対処する。
Wan2.2、LTX-2.5、MiniMax-H3に基づく4つの5B-33Bモデルを、ネイティブ表現と目的を保存しながらインスタンス化する。
結果として生じる因果モデルにより、わずか5秒のシーケンスでトレーニングされた数分から数時間のロールアウトをリアルタイムに対話することができる。
論文 参考訳(メタデータ) (2026-09-02T17:59:41Z) - GenTS: A Comprehensive Benchmark Library for Generative Time Series Models [8.868982298807554]
GenTSは、生成時系列モデルの体系的な評価のために設計された包括的なベンチマークライブラリである。
統合されたデータ前処理パイプライン、汎用モデルのコレクション、パノラマ評価メトリクスを備えている。
GenTSをベースとして,様々なタスクでベンチマーク実験を行い,モデル選択の提案と今後の研究の方向性について検討した。
論文 参考訳(メタデータ) (2026-05-18T03:27:54Z) - ChipMATE: Multi-Agent Training via Reinforcement Learning for Enhanced RTL Generation [55.947962672433675]
ChipMATEは、RTL生成のための最初の自己学習型マルチエージェントフレームワークである。
ChipMATEは産業的な実践に触発され、VerilogエージェントとPythonのリファレンスモデルエージェントをペアにし、相互に出力を検証する。
ChipMATEは、VerilogEval V2で75.0%と80.1%パス@1を4Bと9Bベースモデルで達成している。
論文 参考訳(メタデータ) (2026-05-13T01:04:21Z) - LEMUR Neural Network Dataset: Towards Seamless AutoML [35.57280723615144]
我々は、PyTorchベースのニューラルネットワークの大規模なコレクションを提供するオープンソースのデータセットとフレームワークであるLEMURを紹介する。
各モデルは統一されたテンプレートに従い、構成と結果が構造化データベースに格納され、一貫性が保証される。
LEMURはAutoMLの研究を加速し、公正なベンチマークを可能にし、大規模ニューラルネットワーク研究の障壁を減らすことを目的としている。
論文 参考訳(メタデータ) (2025-04-14T09:08:00Z) - Data-Juicer Sandbox: A Feedback-Driven Suite for Multimodal Data-Model Co-development [67.55944651679864]
統合データモデル共同開発に適した新しいサンドボックススイートを提案する。
このサンドボックスは、フィードバック駆動の実験プラットフォームを提供し、コスト効率とデータとモデルの両方のガイド付き洗練を可能にする。
論文 参考訳(メタデータ) (2024-07-16T14:40:07Z) - Heat Death of Generative Models in Closed-Loop Learning [63.83608300361159]
本研究では、独自の学習データセットに加えて、生成したコンテンツをフィードバックする生成モデルの学習ダイナミクスについて検討する。
各イテレーションで十分な量の外部データが導入されない限り、非自明な温度がモデルを退化させることを示す。
論文 参考訳(メタデータ) (2024-04-02T21:51:39Z) - Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data [49.73114504515852]
各世代の合成データによって元の実データを置き換えることは、モデル崩壊の傾向にあることを示す。
生成した実データと連続する合成データの蓄積は,モデル崩壊を回避することを実証する。
論文 参考訳(メタデータ) (2024-04-01T18:31:24Z) - An Integrated Data Processing Framework for Pretraining Foundation Models [57.47845148721817]
研究者や実践者は、しばしば異なるソースからデータセットを手動でキュレートする必要がある。
本稿では,処理モジュールと解析モジュールを統合したデータ処理フレームワークを提案する。
提案されたフレームワークは使いやすく、柔軟です。
論文 参考訳(メタデータ) (2024-02-26T07:22:51Z) - Modyn: Data-Centric Machine Learning Pipeline Orchestration [1.4448995242976572]
Modynは、データ中心のエンドツーエンド機械学習プラットフォームである。
データ中心のエンドツーエンド機械学習プラットフォームであるModynを紹介します。
論文 参考訳(メタデータ) (2023-12-11T09:50:52Z) - GSAP-NER: A Novel Task, Corpus, and Baseline for Scholarly Entity
Extraction Focused on Machine Learning Models and Datasets [3.9169112083667073]
学術的な文章では、機械学習モデルとデータセットへの参照が基本的なコンポーネントである。
既存の真理データセットは、MLモデルやモデルアーキテクチャのようなきめ細かい型を別々のエンティティタイプとして扱わない。
MLモデルとデータセットを中心とした10のエンティティタイプを対象とした,100のコーパスを手動でアノテートしたフルテキストの科学出版物と,最初のベースラインモデルをリリースする。
論文 参考訳(メタデータ) (2023-11-16T12:43:02Z) - ProtoNER: Few shot Incremental Learning for Named Entity Recognition
using Prototypical Networks [7.317342506617286]
プロトタイプネットワークに基づくエンドツーエンドKVP抽出モデルを示す。
モデルの初期トレーニングに使用されるデータセットに依存しない。
ノイズを付加し、結果としてモデルの性能劣化を引き起こすような中間合成データ生成は行われない。
論文 参考訳(メタデータ) (2023-10-03T18:52:19Z) - Model Reuse with Reduced Kernel Mean Embedding Specification [70.044322798187]
現在のアプリケーションで有用なモデルを見つけるための2段階のフレームワークを提案する。
アップロードフェーズでは、モデルがプールにアップロードされている場合、モデルの仕様としてカーネル平均埋め込み(RKME)を縮小する。
デプロイフェーズでは、RKME仕様の値に基づいて、現在のタスクと事前訓練されたモデルの関連性を測定する。
論文 参考訳(メタデータ) (2020-01-20T15:15:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。