論文の概要: Rethinking Complexity Metrics for LLM-Integrated Applications: Beyond Source Code
- arxiv url: http://arxiv.org/abs/2607.01903v1
- Date: Thu, 02 Jul 2026 09:02:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.752091
- Title: Rethinking Complexity Metrics for LLM-Integrated Applications: Beyond Source Code
- Title(参考訳): LLM統合アプリケーションのための複雑さメトリクスを再考する: ソースコードを超えて
- Abstract要約: 我々は、これらのアプリケーションのプロンプト層とコード層の複雑さを評価するために設計された最初のツールであるHECATEを紹介する。
HECATEの中心はPrompt-as-Specificationであり、これはホーア論理に着想を得た形式主義であり、全てのプロンプトを意図された振る舞いの仕様として解釈する。
- 参考スコア(独自算出の注目度): 27.806059099002507
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM-integrated applications blend natural language prompts with program code, and much of their runtime behavior originates in the prompt layer rather than in the code itself. Existing complexity metrics, however, operate solely at the code level and therefore overlook this behavioral logic entirely. We present HECATE, the first tool designed to assess complexity in both the prompt and code layers of such applications. Central to HECATE is Prompt-as-Specification, a Hoare-logic-inspired formalism that interprets every prompt as a specification of intended behavior. Grounded in 25 complexity dimensions identified across published taxonomies, the tool generates 52 candidate metrics. We assess each metric against 118 components collected from 18 open-source repositories, relying on maintenance activity derived from version history as an empirical proxy for complexity, and discard any metric that loses significance once code size is accounted for. Only ten metrics withstand this test. Seven belong to our newly introduced set; rather than measuring sheer volume, each tallies structurally distinct elements, such as LLM call sites, memory attributes, and prompt templates, an attribute we call structural breadth. Of the three surviving conventional metrics, RFC exhibits a similar breadth-oriented character, while Halstead N and V survive only as a residual effect of size; our top-performing metrics exceed all three. Crucially, the prompt-layer metrics retain significance even when the strongest code-level metric is added as a covariate, establishing prompt complexity as a dimension in its own right. A final validation on 20 components spanning six held-out repositories shows that the two best-performing metrics continue to predict maintenance effort, supporting their generalizability beyond the training set.
- Abstract(参考訳): LLM統合されたアプリケーションは、自然言語プロンプトとプログラムコードとをブレンドし、実行時の動作の多くは、コード自体よりもプロンプト層に由来する。
しかし、既存の複雑性メトリクスは、コードレベルでのみ動作するため、この振る舞いロジックを完全に見落としています。
我々は、これらのアプリケーションのプロンプト層とコード層の複雑さを評価するために設計された最初のツールであるHECATEを紹介する。
HECATEの中心はPrompt-as-Specificationであり、これはホーア論理に着想を得た形式主義であり、全てのプロンプトを意図された振る舞いの仕様として解釈する。
公表された分類学で特定された25の複雑さ次元に基づいて、このツールは52の候補メトリクスを生成する。
18のオープンソースリポジトリから収集された118のコンポーネントに対して、各メトリックを評価し、バージョン履歴から派生したメンテナンスアクティビティを複雑性の実証的プロキシとして頼りにし、コードサイズを考慮すれば意味を欠くメトリックを破棄します。
このテストに耐えられるメトリクスは10です。
LLMコールサイト、メモリ属性、プロンプトテンプレートなど、構造的に異なる要素、すなわち構造的幅を計測するのです。
従来の3つの指標のうち、RFCは同様の幅指向の性格を示し、一方Halstead NとVは大きさの残留効果としてしか生き残れない。
重要なのは、最強のコードレベルメトリックが共変量として追加されても、プロンプト層メトリクスは重要性を保ちます。
6つの保持されたリポジトリにまたがる20のコンポーネントに関する最終的な検証では、2つの最高のパフォーマンスのメトリクスがメンテナンスの労力を予測し続けており、トレーニングセットを超えてその一般化性をサポートしている。
関連論文リスト
- MTAC-IFBench: Benchmarking Instruction-Following in Multi-Turn Agentic Coding [83.0805548642958]
MTAC-IFBenchは、ソフトウェア開発におけるインストラクションフォローのための包括的なベンチマークである。
6つのプライマリと18のセカンダリカテゴリにまたがるさまざまな制約を持つ、多ターンプログレッシブなソフトウェア開発指示が特徴である。
MTAC-IFBenchは、マルチターン命令フォローにおける既存のコードエージェントの重大な欠陥を認識し、インタラクションセッションが長くなるにつれてパフォーマンスが急速に低下する。
論文 参考訳(メタデータ) (2026-09-14T03:57:37Z) - How Generation Architecture Shapes Code Complexity in Multi-Agent LLM Systems: A Paired Study on HumanEval [0.0]
我々は、HumanEvalタスクで広く使われている6つのマルチエージェント構成を比較した。
私たちは、最もリーンなアーキテクチャが、正確さで最も重いアーキテクチャと一致しているか、または打ち負かしていることに気付きました。
論文 参考訳(メタデータ) (2026-05-29T19:34:15Z) - From I/O to Code with Discovery Agent [103.88427301265669]
IO2Codeの発見エージェントであるDIO-Agentを提案する。
本手法は,プログラム空間上の進化的探索としてIO2Codeをフレーム化する。
大規模な実験により、DIO-Agentは従来のプログラムバイサンプル法とSOTA進化エージェントベースラインの両方を一貫して上回っていることが示された。
論文 参考訳(メタデータ) (2026-05-14T18:57:32Z) - Context Pruning for Coding Agents via Multi-Rubric Latent Reasoning [14.508049757681862]
LLMベースのコーディングエージェントは、トークンの予算の大部分をリポジトリファイルを読むのに費やしている。
この定式化がモデリングのボトルネックを生み出すことを示す。
コード関連性を2つの解釈可能な品質次元に分解する構造化プルーニングフレームワークであるLaMRを提案する。
論文 参考訳(メタデータ) (2026-05-14T18:30:10Z) - Rethinking Code Complexity Through the Lens of Large Language Models [11.460454386439698]
大規模言語モデル(LLM)の観点から設計した新しい符号複雑性計量であるLM-CCを提案する。
実験の結果,LM-CCは従来の指標よりもLLM性能と強く相関するだけでなく,タスク性能の低下も直接的に向上することがわかった。
論文 参考訳(メタデータ) (2026-02-08T09:20:20Z) - Completion by Comprehension: Guiding Code Generation with Multi-Granularity Understanding [37.78627994991325]
CoCoは、大規模なコードリポジトリから複数の粒度コンテキストでコード補完を可能にする新しいフレームワークである。
CrossCodeEvalとRepoEvalベンチマークの実験は、CoCoが最先端のベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2025-12-04T07:37:59Z) - Rethinking Testing for LLM Applications: Characteristics, Challenges, and a Lightweight Interaction Protocol [83.83217247686402]
大言語モデル(LLM)は、単純なテキストジェネレータから、検索強化、ツール呼び出し、マルチターンインタラクションを統合する複雑なソフトウェアシステムへと進化してきた。
その固有の非決定主義、ダイナミズム、文脈依存は品質保証に根本的な課題をもたらす。
本稿では,LLMアプリケーションを3層アーキテクチャに分解する: textbftextitSystem Shell Layer, textbftextitPrompt Orchestration Layer, textbftextitLLM Inference Core。
論文 参考訳(メタデータ) (2025-08-28T13:00:28Z) - AGENTIF: Benchmarking Instruction Following of Large Language Models in Agentic Scenarios [51.46347732659174]
LLM(Large Language Models)は、現実世界のエージェントアプリケーションにおいて高度な機能を示す。
AgentIFは、エージェントシナリオでLLM命令に従う能力を体系的に評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2025-05-22T17:31:10Z) - Is Compression Really Linear with Code Intelligence? [60.123628177110206]
textitFormat Annealingは、事前訓練されたモデルの本質的な能力を同等に評価するために設計された、軽量で透明なトレーニング手法である。
我々の経験的結果は、測定されたコードインテリジェンスとビット・パー・キャラクタ(BPC)の基本的な対数関係を明らかにする。
私たちの研究は、コードインテリジェンスの開発における圧縮の役割をより微妙に理解し、コードドメインにおける堅牢な評価フレームワークに貢献します。
論文 参考訳(メタデータ) (2025-05-16T16:59:14Z) - Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation [1.7268889851975326]
私たちは、テスト駆動開発(TDD)タスクにおいて、大規模言語モデル(LLM)を評価するための新しいベンチマークであるWebApp1Kを紹介します。
自然言語のプロンプトに依存する従来のアプローチとは異なり、我々のベンチマークでは、LLMがテストケースから直接機能を解釈し実装する能力を強調しています。
論文 参考訳(メタデータ) (2025-05-13T23:47:12Z) - Can Large Language Models Understand Real-World Complex Instructions? [54.86632921036983]
大型言語モデル(LLM)は人間の指示を理解することができるが、複雑な命令には耐えられない。
既存のベンチマークでは、LLMが複雑な命令を理解する能力を評価するには不十分である。
複雑な命令を体系的に追従するLSMの能力を評価するためのベンチマークであるCellOを提案する。
論文 参考訳(メタデータ) (2023-09-17T04:18:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。