論文の概要: Evaluating LLM Trade-offs for Enterprise Automation: Lessons from Workflow Generation in a Production Enterprise Platform
- arxiv url: http://arxiv.org/abs/2608.03311v1
- Date: Tue, 04 Aug 2026 08:18:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.096471
- Title: Evaluating LLM Trade-offs for Enterprise Automation: Lessons from Workflow Generation in a Production Enterprise Platform
- Title(参考訳): 企業自動化のためのLLMトレードオフの評価 - プロダクションエンタープライズプラットフォームにおけるワークフロー生成からの教訓
- Authors: Xavier Wrenn, Radoslav Raykov, Aleksandar Angelov, Hirokuni Kitahara, Yuji Watanabe, Anca Sailer,
- Abstract要約: エンタープライズコンプライアンス管理は、進化する規制フレームワークに迅速に適応する必要がある。
従来の静的オーケストレータは、ハイブリッドクラウド環境では失敗することが多い。
本稿では、AI駆動ワークフロー生成のための6つの大規模言語モデルの評価から学んだ教訓について述べる。
- 参考スコア(独自算出の注目度): 35.18016233072556
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Enterprise compliance management requires rapid adaptation to evolving regulatory frameworks (e.g., DORA, AI RMF, FedRAMP) and tight remediation SLAs. Traditional static orchestrators often fail in hybrid cloud environments where event-driven assessments demand that automation code adapt to runtime context in seconds. This paper presents lessons learned from evaluating six large language models for AI-driven workflow generation in a production enterprise platform, benchmarked across 29 real-world IT automation scenarios, two generation pipeline architectures, and eight independent runs per prompt-model-pipeline configuration (2,784 runs total). Our initial pipeline used monolithic workflow generation, achieving 31.5-82.8% structural success rates (JSON schema validity and correct UI rendering), with most models struggling on complex JSON generation. We developed a redesigned piecewise pipeline that decomposes workflow construction into variable scaffolding, base block assembly, and nested block generation, raising structural success to 74.1-97.8% across all models. We analyze production tradeoffs including cost (USD 0.008-0.20 per workflow), latency (under 50s for interactive use), and model selection. Piecewise decomposition enables smaller models (e.g., mistral-small at 95.7% structural success and USD 0.01 per workflow) to reach production viability, removing dependency on expensive frontier models. While mistral-medium-2505 and gpt-oss-120b achieved the highest structural success (96.1% and 97.8%), mistral-medium-2505 carries a 19x cost premium versus mistral-small. Our deployment lessons highlight the need to separate structural validity from semantic correctness (logical fulfillment of user intent) and provide a solution for model-agnostic, scalable automation in cloud engineering.
- Abstract(参考訳): 企業コンプライアンス管理には、進化する規制フレームワーク(例えば、DORA、AI RMF、FedRAMP)と厳格な修正SLAに迅速に適応する必要がある。
従来の静的オーケストレータは、イベント駆動アセスメントが自動化コードのランタイムコンテキストへの適応を秒単位で要求するハイブリッドクラウド環境で失敗することが多い。
本稿では,実運用型エンタープライズプラットフォームにおけるAI駆動ワークフロー生成のための6つの大規模言語モデルの評価から得られた教訓を,実世界のIT自動化シナリオ29,2世代パイプラインアーキテクチャ,プロンプト-モデル-パイプライン構成毎の独立実行(2,784回)でベンチマークした。
最初のパイプラインでは、モノリシックなワークフロー生成を使用して、31.5-82.8%の構造的な成功率(JSONスキーマの妥当性と正しいUIレンダリング)を達成した。
我々は、ワークフロー構築を可変なスキャフォールディング、ベースブロックアセンブリ、ネストされたブロック生成に分解し、すべてのモデルで74.1-97.8%の構造的成功を上げた。
コスト(ワークフロー毎のUSD 0.008-0.20)、レイテンシ(インタラクティブな使用のために50秒未満)、モデル選択など、運用上のトレードオフを分析します。
ピースワイズ分解により、より小さなモデル(例えば、95.7%の構造上の成功とワークフロー当たりのUSD 0.01)が生産可能となり、高価なフロンティアモデルへの依存を排除できる。
Mistral-medium-2505とgpt-oss-120bは最も高い構造的成功(96.1%と97.8%)を達成したが、Mistral-medium-2505は19倍のコストのプレミアムを持つ。
私たちのデプロイメントレッスンは、セマンティックな正確性(ユーザの意図の論理的実現)から構造的妥当性を分離する必要性を強調し、クラウドエンジニアリングにおけるモデルに依存しないスケーラブルな自動化のためのソリューションを提供する。
関連論文リスト
- StructureClaw: Traceable LLM Agents and an Executable Benchmark for Structural Engineering Workflows [15.552044829103373]
構造工学要求のためのアーティファクト中心のワークベンチであるStructureClawを紹介します。
また、150の制御シナリオの実行可能なベンチマークであるStructureClaw-Benchを紹介します。
同じ50の標準ケースで評価された10のエージェントモデル構成の中で、平均成功率は56.8%、ジェネリックスキルベースラインは88.6%、完全な自動ワークフローは88.6%となっている。
論文 参考訳(メタデータ) (2026-07-16T12:13:41Z) - ChipMATE: Multi-Agent Training via Reinforcement Learning for Enhanced RTL Generation [55.947962672433675]
ChipMATEは、RTL生成のための最初の自己学習型マルチエージェントフレームワークである。
ChipMATEは産業的な実践に触発され、VerilogエージェントとPythonのリファレンスモデルエージェントをペアにし、相互に出力を検証する。
ChipMATEは、VerilogEval V2で75.0%と80.1%パス@1を4Bと9Bベースモデルで達成している。
論文 参考訳(メタデータ) (2026-05-13T01:04:21Z) - ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - EvoOpt-LLM: Evolving industrial optimization models with large language models [43.621054283138115]
EvoOpt-LLMは産業最適化モデリングの全ライフサイクルをサポートする統一LLMベースのフレームワークである。
生成率は91%、実行可能性は65.9%であり、トレーニングサンプルはわずか3,000であり、1500サンプル以下で重要なパフォーマンス向上が期待できる。
制約注入モジュールは、元の目的を保ちながら既存のMILPモデルを確実に増強し、可変プルーニングモジュールは計算効率を高め、400サンプルしか持たない中型のLPモデルでF1スコア0.56を達成する。
論文 参考訳(メタデータ) (2026-02-01T07:58:55Z) - ComfyUI-R1: Exploring Reasoning Models for Workflow Generation [49.09090292453288]
私たちはワークフローの自動生成のための最初の大きな推論モデルであるComfyUI-R1を紹介します。
ノードの選択、ワークフロー計画、コードレベルのワークフローを含む、長いチェーン・オブ・シンク(CoT)推論データを構築します。
実験の結果、我々の7B-パラメーターモデルでは、高いパスレート、ノードレベル、グラフレベルのF1スコアとともに、97%のフォーマットの妥当性が得られた。
論文 参考訳(メタデータ) (2025-06-11T14:35:15Z) - SLOT: Structuring the Output of Large Language Models [5.683327173793259]
SLOT(Structured LLM Output Transformer)は,非構造化LCM出力を正確な構造化形式に変換するモデルに依存しない手法である。
この結果から,制約付き復号化による微調整Mistral-7Bモデルでは,ほぼ完全なスキーマ精度が得られた。
特に、Llama-3.2-1Bのようなコンパクトなモデルでさえ、はるかに大きなプロプライエタリなモデルの出力能力にマッチまたは超えることができる。
論文 参考訳(メタデータ) (2025-05-06T23:29:43Z) - Fine-tuning a Large Language Model for Automating Computational Fluid Dynamics Simulations [11.902947290205645]
大規模言語モデル(LLM)は高度な科学計算を持ち、CFDでの使用は自動化されている。
ドメイン固有LLM適応に着目した新しいアプローチを提案する。
マルチエージェントフレームワークはプロセスをオーケストレーションし、入力を自律的に検証し、構成を生成し、シミュレーションを実行し、エラーを修正する。
論文 参考訳(メタデータ) (2025-04-13T14:35:30Z) - WorkflowLLM: Enhancing Workflow Orchestration Capability of Large Language Models [105.46456444315693]
ワークフローオーケストレーションにおける大規模言語モデルの能力を高めるための,データ中心のフレームワークであるLLMを提案する。
最初は106,763のサンプルで大規模な微調整Benchを構築し、28のカテゴリにわたる83のアプリケーションから1,503のAPIをカバーしている。
LlamaLlamaは複雑なAPIをオーケストレーションする能力を示しながら、優れた一般化性能を実現している。
論文 参考訳(メタデータ) (2024-11-08T09:58:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。