論文の概要: Beyond Executable Models: The Pufibara Agent Harness and the Modelica Agent Workflow Benchmark for Physical System Modeling
- arxiv url: http://arxiv.org/abs/2608.23653v1
- Date: Mon, 24 Aug 2026 11:50:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.46827
- Title: Beyond Executable Models: The Pufibara Agent Harness and the Modelica Agent Workflow Benchmark for Physical System Modeling
- Title(参考訳): 実行可能モデルを超えて:Pufibara Agent Harness と Modelica Agent Workflow ベンチマークによる物理システムモデリング
- Abstract要約: 物理システムモデリングは、ソフトウェア工学における汎用コード生成とは異なる要件を提示する。
この課題は、モデルが意図した物理や工学的要求に違反しながら、モデルをコンパイルし、シミュレートできる方程式ベースのモデリング言語であるModelicaで研究されている。
提案するエージェントハーネスであるPufibaraは、リビジョン全体にわたって永続的なエンジニアリング状態を維持し、実行シミュレーションの証拠と、それを生成した候補を関連付け、明示的なエージェントアクションを提出する。
- 参考スコア(独自算出の注目度): 3.2102307224389484
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI agents are increasingly used for simulation-driven engineering. Physical system modeling presents different requirements from general-purpose code generation in software engineering, because correctness depends not only on syntax and executability but also on physical consistency and scenario-dependent behavior. We study this challenge in Modelica, an equation-based modeling language in which a model may compile and simulate while still violating its intended physics or engineering requirements. Across successive revisions, an agent may lose track of requirements or rely on simulation evidence produced by an outdated candidate. To address this challenge, we present Pufibara, an agent harness that maintains persistent engineering state across revisions, associates execution and simulation evidence with the candidate that produced it, and makes submission an explicit agent action. To evaluate end-to-end Modelica agent workflows, we also propose a source-grounded method for constructing realistic and independently evaluable tasks. We use this method to build the 232-task Modelica Agent Workflow Benchmark, spanning Model Repair, Model Generation, and Model Tuning. Each submitted candidate is scored by a benchmark-owned evaluator outside the agent loop. We compare Pufibara with Claude Code as complete harnesses under two matched large language model (LLM) backends. With DeepSeek v4 Flash, Pufibara passes 202 tasks, compared with 185 for Claude Code. With Claude Sonnet 5, Pufibara passes 202 tasks, compared with 187 for Claude Code. Under the repository-reported token accounting, Pufibara records 76.4%-82.5% lower logical-token totals. Its sequential runtime is 6.1%-58.4% lower. These findings show that, even under matched LLM backends, complete agent harnesses can differ substantially in both task success and resource use for physical system modeling.
- Abstract(参考訳): AIエージェントは、シミュレーション駆動エンジニアリングにますます使われています。
物理的システムモデリングは、ソフトウェア工学における汎用コード生成とは異なる要件を提示している。
この課題は、モデルが意図した物理や工学的要求に違反しながら、モデルをコンパイルし、シミュレートできる方程式ベースのモデリング言語であるModelicaで研究されている。
連続した改訂によって、エージェントは要求の追跡を失うか、時代遅れの候補者が生み出したシミュレーションエビデンスに依存する可能性がある。
この課題に対処するため、我々はPufibaraというエージェントハーネスを紹介した。このエージェントハーネスは、リビジョンを越えて永続的なエンジニアリング状態を維持し、実行とシミュレーションのエビデンスを、それを作成した候補に関連付け、明示的なエージェントアクションを提出する。
エンド・ツー・エンドのModelicaエージェント・ワークフローを評価するために,現実的かつ独立に評価可能なタスクを構築するためのソース・グラウンド・メソッドを提案する。
この手法を用いて、モデル修復、モデル生成、モデルチューニングにまたがる232タスクのModelica Agent Workflow Benchmarkを構築します。
各候補は、エージェントループの外側のベンチマーク所有の評価者によってスコアされる。
PufibaraとClaude Codeを2つのマッチした大言語モデル(LLM)バックエンドで完全なハーネスとして比較する。
DeepSeek v4 Flashでは、Pufibaraは202タスクをパスし、Claude Codeは185タスクをパスした。
Claude Sonnet 5では、Pufibaraは202のタスクをパスしている。
リポジトリに記録されたトークン会計では、Pufibaraは76.4%-82.5%低い論理トークン総数を記録した。
シーケンシャルランタイムは6.1%-58.4%低い。
これらの結果から,LLMバックエンドの下でも,タスク成功と物理的システムモデリングにおけるリソース利用の両面で,完全なエージェントハーネスが著しく異なることが示唆された。
関連論文リスト
- MADE: Belief-Driven Dual-Agent Coordination for Autonomous Model Deployment [19.126846876843356]
LLMベースのエージェントはドメイン固有のタスクに苦労し、外部ツールの統合を動機付けている。
オープンソースコミュニティは、典型的に異質な研究成果物としてリリースされる多数のAIモデルを提供している。
これらをプリ・ツー・コールのAPIに変換するのは費用がかかり、労力がかかる。
本稿では,デュアルエージェント協調システムであるModel Automated Deployment Engine (MADE)を紹介する。
論文 参考訳(メタデータ) (2026-08-02T12:14:43Z) - KAT-Coder-V2.5 Technical Report [61.907486544595336]
KAT-Coder-V2.5は、実際の実行可能リポジトリ内で自律的に動作するよう訓練されたコーディング中心のエージェントモデルである。
マルチ言語リポジトリをサンドボックス環境に再構築し、フェイル・ツー・パスとパス・ツー・パスの検証を大規模に行う。
我々はさらに、ハーネスランダム化による強化学習、信頼性の強化されたサンドボックス、非対称なアクター-クリティックPPO、およびハイチ指向の報酬フレームワークをスケールする。
論文 参考訳(メタデータ) (2026-07-06T08:14:02Z) - Dissecting model behavior through agent trajectories [15.811597127775812]
私たちはインテント・エグゼクティブのギャップを形式化し、モデルが意図するものと、ハーネスが実行しているものとのミスマッチと、その逆です。
このハーネスモデルアライメントの効果を説明するために,SSA(Simple Strands Agent)と呼ばれるシンプルでカスタマイズ可能なハーネスを開発した。
i) 一般的なエージェントベンチマークにおいて,多種多様なモデルプロジェクタファミリーが報告したpass@1のパフォーマンスを再現または改善し, (ii) SSAが生成した128k軌道の解析に基づいて構築する。
論文 参考訳(メタデータ) (2026-06-16T03:17:03Z) - From Question Answering to Task Completion: A Survey on Agent System and Harness Design [67.8241530947325]
本研究はモデルハーネスレンズを用いてLCMをベースとしたエージェントについて検討する。
まず, LLMをベースとしたエージェントを基礎モデルと実行ハーネスとして, エージェントの機能的定義と実装の視点を明らかにする。
次に、モデル中心のスケーリングの限界を分析し、エージェントエンジニアリングの4つのパラダイムをトレースし、実行ハーネスを6つの結合ランタイム責任に分解する。
論文 参考訳(メタデータ) (2026-06-14T05:40:16Z) - ClayBuddy: A Framework, Evaluation, & Mitigation of Coding Agent Failures [1.0742675209112622]
障害モードは、不特定性、能力エラー、エージェントハーネスエラーの3つのメカニズムから派生したものとして研究する。
我々はClayBuddyを提案する。ClayBuddyはユーザの好みを形作るハーネスで、モデルのインセッションで修正してこれらのエラーを軽減できる。
論文 参考訳(メタデータ) (2026-06-13T18:29:53Z) - Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows [18.6534256358905]
本稿では,リアルエージェントシステムにおける構成レベルのハーネス効果を評価するための診断ベンチマークであるHarness-Benchを紹介する。
ベンチマークには、実用的なエージェント使用パターンから構築された106のサンドボックス化されたオフラインタスクが含まれている。
5,194個の実行軌道にまたがって、完了、プロセス品質、効率、障害挙動のかなりの変化を観察する。
論文 参考訳(メタデータ) (2026-05-27T03:47:35Z) - LLM-driven design of physics-constrained constitutive models: two agents are better than one [0.0]
モデル生成のためのマルチエージェントLPM駆動型アプローチを初めて導入する。
作成エージェントがデータに合わせたモデルを提案し、インスペクタエージェントが9つの物理的制約に対して各提案を監査する。
この概念を、人工ニューラルネットワーク(CANN)で実証し、脳組織、実験ゴム、合成ゴムでベンチマークする。
論文 参考訳(メタデータ) (2026-05-22T15:27:09Z) - ChipMATE: Multi-Agent Training via Reinforcement Learning for Enhanced RTL Generation [55.947962672433675]
ChipMATEは、RTL生成のための最初の自己学習型マルチエージェントフレームワークである。
ChipMATEは産業的な実践に触発され、VerilogエージェントとPythonのリファレンスモデルエージェントをペアにし、相互に出力を検証する。
ChipMATEは、VerilogEval V2で75.0%と80.1%パス@1を4Bと9Bベースモデルで達成している。
論文 参考訳(メタデータ) (2026-05-13T01:04:21Z) - Every Step Counts: Decoding Trajectories as Authorship Fingerprints of dLLMs [63.82840470917859]
本稿では,dLLMの復号化機構をモデル属性の強力なツールとして利用できることを示す。
本稿では、デコードステップ間の構造的関係を捉え、モデル固有の振る舞いをよりよく明らかにする、DDM(Directed Decoding Map)と呼ばれる新しい情報抽出手法を提案する。
論文 参考訳(メタデータ) (2025-10-02T06:25:10Z) - Model-driven realization of IDTA submodel specifications: The good, the bad, the incompatible? [49.60138105915326]
アセット・マネジメント・シェルは産業4.0でトレンドになっている。
2024年2月、インダストリアル・デジタル・ツイン・アソシエーション (Industrial Digital Twin Association) は84と18のASサブモデル仕様を発表した。
本稿では、IDTA仕様から抽出した情報を中間メタモデルに変換し、そこからAPIコードとテストを生成するモデル駆動型アプローチを提案する。
論文 参考訳(メタデータ) (2024-06-20T16:33:46Z) - Model Reuse with Reduced Kernel Mean Embedding Specification [70.044322798187]
現在のアプリケーションで有用なモデルを見つけるための2段階のフレームワークを提案する。
アップロードフェーズでは、モデルがプールにアップロードされている場合、モデルの仕様としてカーネル平均埋め込み(RKME)を縮小する。
デプロイフェーズでは、RKME仕様の値に基づいて、現在のタスクと事前訓練されたモデルの関連性を測定する。
論文 参考訳(メタデータ) (2020-01-20T15:15:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。