論文の概要: ACEM: A Cost Estimation Model for Agentic Software Engineering
- arxiv url: http://arxiv.org/abs/2608.02582v1
- Date: Mon, 03 Aug 2026 17:54:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 21:56:46.394133
- Title: ACEM: A Cost Estimation Model for Agentic Software Engineering
- Title(参考訳): ACEM:エージェントソフトウェアエンジニアリングのコスト推定モデル
- Abstract要約: 本稿では,エージェント開発総コストを3つの付加次元に分解するACEM(Agentic Cost Estimation Model)を提案する。
ACEMはエージェントダイナミクスのための3つの構成要素を紹介している。Revision Factor (RF)、出力の拒絶と再試行からトークンのオーバーヘッドをモデル化するContext Factor (CF)、コンテキストの蓄積に伴ってトークンの消費が上昇するのをキャプチャする HITL Intensity Score (HIS)、そして4段階の監視分類スキームであるHITL Intensity Score (HIS)である。
アーリーステージの提案として、研究コミュニティに実際のプロジェクトデータを通じてモデルを調整、テスト、拡張するよう呼びかけている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Traditional software cost estimation models, such as COCOMO II, Function Points, and Story Points, assume that development effort is primarily driven by human labor in design, coding, and testing. Agentic software engineering, where autonomous AI agents perform substantial implementation work and humans focus on planning, specification, and validation, challenges this assumption. New cost dimensions arise: large language model (LLM) token consumption across agent actions, Human-in-the-Loop (HITL) oversight effort, and infrastructure costs for agent orchestration and tooling. These costs are nondeterministic: identical tasks may consume different tokens, follow divergent reasoning paths, and require varying human correction, phenomena absent in traditional development. A new framework is needed to bridge standard sizing metrics with this cost structure. This paper proposes ACEM (Agentic Cost Estimation Model), which decomposes total agentic development cost into three additive dimensions: LLM, HITL, and infrastructure cost. ACEM introduces three constructs for agentic dynamics: the Revision Factor (RF), modeling token overhead from output rejection and retries; the Context Factor (CF), capturing rising token consumption as context accumulates; and the HITL Intensity Score (HIS), a four-level oversight classification scheme. It further maps Use Case Points, Story Points, and Function Points to estimated token consumption, enabling organizations to reuse existing project-scoping data for agentic cost forecasting. ACEM is presented as a fully specified model structure and calibration methodology, with constants left symbolic pending empirical grounding. As an early-stage proposal, it invites the research community to calibrate, test, and extend the model through real project data.
- Abstract(参考訳): COCOMO II、Function Points、Story Pointsといった従来のソフトウェアコスト推定モデルは、開発作業は主に設計、コーディング、テストにおける人的労力によって行われると仮定している。
エージェントソフトウェアエンジニアリング — 自律的なAIエージェントが実質的な実装作業を行い、人間が計画、仕様、検証に集中するエージェントソフトウェアエンジニアリングは、この仮定に挑戦する。
エージェントアクション全体にわたる大規模言語モデル(LLM)トークンの使用、Human-in-the-Loop(HITL)監視、エージェントオーケストレーションとツーリングのためのインフラストラクチャコスト。
これらのコストは非決定論的であり、同一のタスクは異なるトークンを消費し、異なる推論経路を辿り、様々な人間の修正を必要とする。
このコスト構造で標準サイズのメトリクスをブリッジするために、新しいフレームワークが必要です。
本稿では,総エージェント開発コストをLLM,HITL,インフラストラクチャコストの3つの付加次元に分解するACEM(Agentic Cost Estimation Model)を提案する。
ACEMはエージェントダイナミクスのための3つの構成要素を紹介している。Revision Factor (RF)、出力の拒絶と再試行からトークンのオーバーヘッドをモデル化するContext Factor (CF)、コンテキストの蓄積に伴ってトークンの消費が上昇するのをキャプチャする HITL Intensity Score (HIS)、そして4段階の監視分類スキームであるHITL Intensity Score (HIS)である。
さらに、ユースケースポイント、ストーリーポイント、ファンクションポイントを推定トークン消費にマッピングし、組織がエージェントコスト予測のために既存のプロジェクトスコープデータを再利用できるようにする。
ACEMは完全に特定されたモデル構造とキャリブレーション手法として提示され、定数は保留する経験的接地を象徴する。
アーリーステージの提案として、研究コミュニティに実際のプロジェクトデータを通じてモデルを調整、テスト、拡張するよう呼びかけている。
関連論文リスト
- Task-to-Model Optimization for Enterprise LLM Coding Assistants: A Data-Driven Framework for Cost-Optimal Routing [5.00725149774706]
エンタープライズAIコーディングアシスタントは、相当な推論費用を発生させ、トークンコストの最小化は、再試行、エスカレーション、開発者待ち時間を含むと、エンドツーエンドコストの削減に失敗することが多い。
実運用におけるモデル選択を最適化するためのデータ駆動手法であるタスク・ツー・モデル最適化(T2MO)を提案する。
私たちは、各開発者セッションを、発見、分類、難易度を評価、プロダクション風のハーネスでベンチマークし、品質とレイテンシの制約の中でそれを完了できる最も安価なモデルにルーティングできるタスクとして扱います。
論文 参考訳(メタデータ) (2026-08-09T06:57:53Z) - ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - A Survey on Efficient Vision-Language-Action Models [153.11669266922993]
VLA(Vision-Language-Action Model)は、物理世界の相互作用によってデジタル知識を橋渡しすることを目的とした、インテリジェンスにおける重要なフロンティアである。
これらの課題に緊急に対応する必要性から、この調査は、効率的なビジョン・ランゲージ・アクションモデルに関する最初の包括的なレビューを提示する。
論文 参考訳(メタデータ) (2025-10-27T17:57:33Z) - Toward a unified framework for data-efficient evaluation of large language models [12.922829524961813]
LEGO-IRTはデータ効率の大きな言語モデル評価のための統一的で柔軟なフレームワークです。
バイナリと継続的評価のメトリクスの両方をサポートする。
LEGO-IRTは,全体の評価項目のわずか3%の費用で,安定した能力推定を実現していることを示す。
論文 参考訳(メタデータ) (2025-10-05T06:13:50Z) - Cost-Optimal Active AI Model Evaluation [71.2069549142394]
生成AIシステムの開発には、継続的な評価、データ取得、アノテーションが必要である。
我々は、安価だがしばしば不正確で弱いレーダの使用を積極的にバランスさせる新しいコスト認識手法を開発した。
我々は、弱者と強者の間で所定のアノテーション予算を割り当てるためのコスト最適化政策のファミリーを導出する。
論文 参考訳(メタデータ) (2025-06-09T17:14:41Z) - Cost-of-Pass: An Economic Framework for Evaluating Language Models [25.152801302217693]
正しい解決策を生み出すための金銭的コストである「パスコスト」を導入します。
次に、「最前線のコスト」を、利用可能なモデルや「人間専門家」にまたがる最小のパスコストとして定義する。
私たちは、基本的な量的、知識集約的、複雑な量的タスクにおいてフロンティアを推し進めるために、軽量、大規模、推論モデルにおける革新が不可欠であることが分かりました。
論文 参考訳(メタデータ) (2025-04-17T21:58:29Z) - SMRS: advocating a unified reporting standard for surrogate models in the artificial intelligence era [0.8866016545928136]
我々は、サロゲートモデルのための構造化レポート標準を確立する緊急の必要性を論じる。
標準化されながらフレキシブルなフレームワークを推進することによって、サロゲートモデリングの信頼性を向上させることを目指している。
論文 参考訳(メタデータ) (2025-02-10T18:31:15Z) - Reqo: A Robust and Explainable Query Optimization Cost Model [2.184775414778289]
GRU(Gated Recurrent Units)によって集約された双方向グラフニューラルネットワーク(Bi-GNN)に基づくツリーモデルアーキテクチャを提案する。
我々は,確率的MLを用いて,コスト見積の不確実性を効果的に定量化する,新しい学習とランクのコストモデルを実装した。
さらに,学習型コストモデルに特化して設計された最初の説明可能性手法を提案する。
論文 参考訳(メタデータ) (2025-01-29T04:48:51Z) - Evolve Cost-aware Acquisition Functions Using Large Language Models [11.209139558885035]
本稿では,大規模言語モデル (LLM) と進化計算 (EC) を統合する新しいフレームワークであるEvolCAFを紹介する。
設計されたコストアウェアAFは、過去のデータ、サロゲートモデル、予算の詳細から利用可能な情報の利用を最大化する。
EIpu と EI-cool の手法は, 人的専門家が設計した手法と比較して, 様々なタスクにまたがる顕著な効率性と一般化を示す。
論文 参考訳(メタデータ) (2024-04-25T12:19:18Z) - How Much Data are Enough? Investigating Dataset Requirements for Patch-Based Brain MRI Segmentation Tasks [74.21484375019334]
ディープニューラルネットワークを確実にトレーニングするには、大規模なデータセットへのアクセスが必要である。
モデル開発に関連する時間的・経済的コストを緩和するためには,満足度の高いモデルをトレーニングするために必要なデータの量を明確に理解することが重要である。
本稿では,パッチベースのセグメンテーションネットワークのトレーニングに必要なアノテートデータの量を推定するための戦略的枠組みを提案する。
論文 参考訳(メタデータ) (2024-04-04T13:55:06Z) - Power Hungry Processing: Watts Driving the Cost of AI Deployment? [74.19749699665216]
生成された多目的AIシステムは、機械学習(ML)モデルをテクノロジに構築するための統一的なアプローチを約束する。
この「一般性」の野心は、これらのシステムが必要とするエネルギー量と放出する炭素量を考えると、環境に急激なコストがかかる。
これらのモデルを用いて,代表的なベンチマークデータセット上で1,000の推論を行うのに必要なエネルギーと炭素の量として,デプロイメントコストを測定した。
本稿は、多目的MLシステムの展開動向に関する議論から締めくくり、エネルギーと排出の面でコストの増大に対して、その実用性はより意図的に重み付けされるべきである、と警告する。
論文 参考訳(メタデータ) (2023-11-28T15:09:36Z) - QualEval: Qualitative Evaluation for Model Improvement [82.73561470966658]
モデル改善のための手段として,自動定性評価による定量的スカラー指標を付加するQualEvalを提案する。
QualEvalは強力なLCM推論器と新しいフレキシブルリニアプログラミングソルバを使用して、人間の読みやすい洞察を生成する。
例えば、その洞察を活用することで、Llama 2モデルの絶対性能が最大15%向上することを示す。
論文 参考訳(メタデータ) (2023-11-06T00:21:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。