論文の概要: EngiWorld: What Can Frontier Agents Deliver in Professional Engineering Environments?
- arxiv url: http://arxiv.org/abs/2609.37686v1
- Date: Tue, 29 Sep 2026 14:32:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.631721
- Title: EngiWorld: What Can Frontier Agents Deliver in Professional Engineering Environments?
- Title(参考訳): EngiWorld: プロのエンジニアリング環境でフロンティアエージェントは何を実現できるのか?
- Abstract要約: EngiWorldは完全なデザインループを中心に構築された最初のベンチマークである。
1,301のタスクは、6つのエンジニアリングドメイン(CAD, CAE, CAM, BIM, EDA, 3Dビジュアライゼーション)と26のプロフェッショナルソフトウェアプラットフォームにまたがる。
最も強力なモデルは、わずか44.3のEngiScoreであり、マルチソフトウェアの試みの3.6%しか成功していない。
- 参考スコア(独自算出の注目度): 22.883681292937954
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autonomous agents have made rapid progress in general-purpose computer use, but reliable automation of professional industrial engineering remains out of reach, as engineering workflows demand reasoning over geometric and physical constraints and dependencies preserved across software and design stages. We present EngiWorld, the first benchmark structured around the complete design loop: 1,301 expert-curated tasks spanning 6 engineering domains (CAD, CAE, CAM, BIM, EDA, and 3D visualization) and 26 professional software platforms, with both GUI and CLI interfaces and 6 task types ranging from software-selection to open-ended tasks. We further introduce an artifact-centric evaluation methodology built on a unified domain-verifier suite, which programmatically checks the geometric validity, physical feasibility, and rule compliance of final and intermediate artifacts, and scores quantitative design tasks continuously by specification attainment rather than binary success. Evaluation of seven frontier models reveals a substantial capability gap: the strongest model achieves an EngiScore of only 44.3, and just 3.6% of multi-software attempts succeed. EngiWorld provides the first rigorous foundation for measuring progress toward agents that operate professional engineering software end to end.
- Abstract(参考訳): 自律エージェントは汎用コンピュータの使用において急速に進歩してきたが、ソフトウェアや設計段階にまたがる幾何学的および物理的制約や依存関係を推論するエンジニアリングワークフローが要求されるため、プロフェッショナルな産業工学の信頼性の高い自動化は未完成のままである。
1,301個の専門的タスク(CAD, CAE, CAM, BIM, EDA, 3Dビジュアライゼーション)と26個の専門ソフトウェアプラットフォームにまたがる,GUIとCLIインターフェースと,ソフトウェア選択からオープンなタスクまでの6種類のタスクタイプ。
さらに,最終および中間のアーティファクトの幾何的妥当性,物理的実現可能性,規則順守をプログラム的に検証し,バイナリ成功よりも仕様達成による定量的設計タスクを連続的に評価する,統合されたドメイン検証スイート上に構築されたアーティファクト中心評価手法を導入する。
最強のモデルはわずか44.3のEngiScoreを達成し、マルチソフトウェアの試みのわずか3.6%が成功する。
EngiWorldは、プロフェッショナルなエンジニアリングソフトウェアをエンドツーエンドに運用するエージェントへの進捗を測定するための、初めての厳格な基盤を提供する。
関連論文リスト
- Design, development, and preliminary validity and reliability evidence of the Software Engineering Self-Efficacy Scale (SESES) [1.6419687521433917]
本研究は,Software Engineering Self-Efficacy Scale(SESES)の設計,開発,実装,および,事前の妥当性と信頼性の証明を提供することを目的とする。
ソフトウェア工学のカリキュラムと概念のガイダンスと自己効力の概念を用いた概念的なフレームワークによって、我々はn = 87項目の初期項目プールを生成しました。
この結果から,ソフトウェア工学の自己効力性は5つの理論的・相関的要因の多次元的構成である可能性が示唆された。
論文 参考訳(メタデータ) (2026-09-24T05:57:34Z) - UI-Venus-2 Technical Report [51.54957558722245]
UI-Venus-2は,モバイル,Web,デスクトップ環境で動作する汎用GUIエージェントである。
1) 環境, カバー範囲を170以上のマルチリンガルなモバイルアプリとネイティブなデスクトップオペレーティングシステムに拡大する, (2) 関数基底命令生成のためのディープリサーチパイプラインを利用するタスク, (3) 視覚的キーポイントとマルチモデル投票を用いたトレースレベルおよびサンプルレベルの評価器を採用して, トレーニングのための信頼性の高いRL信号を保証するための検証, という3つの重要な次元を共同で拡張する。
論文 参考訳(メタデータ) (2026-08-27T17:15:33Z) - Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments [67.2234316079859]
GauntletBenchは、挑戦的なシナリオでエージェントの一般化を評価するためのWebベースのベンチマークである。
調査されていない5つのプロフェッショナルアプリケーションにわたる3つの機能(時間的知覚、グラフィカルな理解、そして3D推論)に焦点を当てている。
実験結果から,フロンティアエージェントシステムは人間レベルの性能を達成するには程遠いことが判明した。
論文 参考訳(メタデータ) (2026-06-12T12:32:24Z) - Augment Engineering: A Methodology for Multi-Tool AI Orchestration Across Professional Domains [0.0]
拡張エンジニアリング(Augment Engineering)は、異なる専門分野にまたがる複数の目的に構築されたAIツールのオーケストレーションの分野である。
5ヶ月のフォーマティブケーススタディでは、プロのドメイン7つにまたがってプロのエンジニアリングを適用する1人の実践者が文書化されている。
論文 参考訳(メタデータ) (2026-05-22T22:44:18Z) - Composer 2 Technical Report [93.84516486051359]
Composer 2はエージェントソフトウェアエンジニアリング用に設計された特殊なモデルである。
モデルは2つのフェーズでトレーニングされる。まず、モデルの知識を改善するための事前トレーニングと、潜伏するコーディング能力だ。
デプロイされたモデルで使用されるのと同じカーソルハーネスでトレーニングをサポートするインフラを開発する。
論文 参考訳(メタデータ) (2026-03-25T16:18:37Z) - Using GUI Agent for Electronic Design Automation [123.86509061313912]
Graphical User Interface (GUI)エージェントは、スクリーンショットをアクションシーケンスにマッピングするエンドツーエンドパラダイムを採用する。
既存のGUIエージェントは、Microsoft WordやExcelのようなコモディティソフトウェアにのみ評価される。
この作業は、GUIエージェントを一般的なオフィス自動化から、専門的で高価値なエンジニアリングドメインまで拡張する。
論文 参考訳(メタデータ) (2025-12-12T14:49:32Z) - Engineering.ai: A Platform for Teams of AI Engineers in Computational Design [8.217119500224284]
計算設計におけるAIエンジニアのチームのためのプラットフォームであるEngineering.aiを紹介します。
このフレームワークは階層的なマルチエージェントアーキテクチャを採用しており、チーフエンジニアが特殊エージェントをコーディネートする。
このシステムはFreeCAD、Gmsh、OpenFOAM、CalculiX、BPM音響解析を統合し、並列多分野シミュレーションを可能にする。
論文 参考訳(メタデータ) (2025-10-31T08:00:48Z) - Investigating the Potential of Large Language Model-Based Router Multi-Agent Architectures for Foundation Design Automation: A Task Classification and Expert Selection Study [0.0]
シングルエージェント処理、マルチエージェントデザイナ-チェッカーアーキテクチャ、ルータベースのエキスパートセレクションの3つのアプローチが評価された。
性能評価はDeepSeek R1、ChatGPT 4 Turbo、Grok 3、Gemini 2.5 Proといったベースラインモデルを利用した。
その結果、ルータベースのマルチエージェントシステムは、プロのドキュメント標準を維持しつつ、基礎設計の自動化に最適なものとなった。
論文 参考訳(メタデータ) (2025-06-13T23:45:24Z) - An LLM-enabled Multi-Agent Autonomous Mechatronics Design Framework [49.633199780510864]
本研究は, 機械設計, 最適化, エレクトロニクス, ソフトウェア工学の専門知識を統合した多エージェント自律メカトロニクス設計フレームワークを提案する。
このフレームワークは、言語駆動のワークフローを通じて運用され、構造化された人間のフィードバックを組み込んで、現実世界の制約下での堅牢なパフォーマンスを保証する。
完全に機能する自律型容器は、最適化された推進、コスト効率の高い電子機器、高度な制御を備えていた。
論文 参考訳(メタデータ) (2025-04-20T16:57:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。