論文の概要: Software Aging in LLM-Generated Applications: Runtime Evidence, Static Analysis, and Human-Written Comparisons
- arxiv url: http://arxiv.org/abs/2608.26391v2
- Date: Tue, 01 Sep 2026 18:05:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:17.339042
- Title: Software Aging in LLM-Generated Applications: Runtime Evidence, Static Analysis, and Human-Written Comparisons
- Title(参考訳): LLM生成アプリケーションにおけるソフトウェア老化:実行時エビデンス、静的解析、人文比較
- Abstract要約: 大規模言語モデル(LLM)は、自然言語仕様から実行可能なソフトウェアシステムを生成するために、ますます使われている。
LLM生成サービスベースアプリケーションにおけるソフトウェア老化症状を世代・実行環境にわたって実験的に検討した。
- 参考スコア(独自算出の注目度): 2.051924013527311
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) are increasingly used to generate executable software systems from natural language specifications, accelerating development and reducing manual implementation effort. Although recent studies have investigated the functional correctness, security, maintainability, and robustness of LLM-generated code, little is known about the long-term reliability of such systems under sustained execution. In this paper, we experimentally investigate software aging symptoms in LLM-generated service-based applications across generation-and-execution environments. Using backend scenarios derived from BaxBench, we generated applications targeting JavaScript, Python, and Rust through LLM-based generation platforms, validated them with BaxBench-derived tests, and subjected them to 48-hour workload executions. We monitored memory usage, response time, and throughput and analyzed them using the Mann--Kendall test and Sen's slope estimator. We further complemented the runtime evaluation with static analysis of the generated source code and an exploratory comparison with human-written implementations of related backend scenarios. The results show that memory usage is the most consistent indicator of potential software aging, with statistically significant upward trends in most application-environment combinations, while response time and throughput exhibit more heterogeneous behavior. Static analysis identified plausible code-level aging mechanisms, and the comparison with human-written systems showed that the aging symptoms observed in LLM-generated applications align with degradation patterns also found in manually developed implementations. These findings indicate that functional correctness alone is insufficient to assess the operational reliability of LLM-generated software before deployment in continuously running environments.
- Abstract(参考訳): 大きな言語モデル(LLM)は、自然言語仕様から実行可能なソフトウェアシステムを生成するために、開発を加速し、手作業による実装の労力を減らすために、ますます使われています。
近年の研究では、LLM生成コードの機能的正当性、セキュリティ、保守性、堅牢性について研究されているが、持続実行時のシステムの長期的な信頼性についてはほとんど分かっていない。
本稿では,LLM生成サービスベースアプリケーションにおけるソフトウェア老化症状を世代・実行環境全体にわたって実験的に検討する。
BaxBenchから派生したバックエンドシナリオを使用して、LLMベースの生成プラットフォームを通じてJavaScript、Python、Rustをターゲットにしたアプリケーションを生成し、BaxBenchから派生したテストで検証し、48時間のワークロード実行を実行しました。
メモリ使用量,応答時間,スループットを監視し,Mann-KendallテストとSenの傾斜推定器を用いて解析した。
さらに、生成したソースコードの静的解析と、関連するバックエンドシナリオの人間による実装との比較により、ランタイム評価を補完した。
その結果、メモリ使用量はソフトウェア老化の最も一貫性のある指標であり、ほとんどのアプリケーション環境と環境の組み合わせでは統計的に顕著な上昇傾向を示し、応答時間とスループットはより不均一な振る舞いを示すことがわかった。
静的解析により, 可塑性コードレベルの老化機構が同定され, 人間の手書きシステムとの比較により, LLM生成アプリケーションで観察される老化症状が手作業で開発された実装でも見られる劣化パターンと一致していることが確認された。
これらの結果から,LLM生成ソフトウェアの動作信頼性を評価するには,機能的正当性だけでは不十分であることが示唆された。
関連論文リスト
- The Imitation Game: When LLMs Learn to Reason Like Programs via Code-Centric Reasoning Data Synthesis [50.473217152006875]
MIMICは、データ合成を推論するための厳密な媒体として実行可能なコードを活用するフレームワークである。
MIMICは、ナラティブ融合、コード誘導テスト合成、動的コードインスツルメンテーションを通じて、アルゴリズムを検証可能な推論軌道に変換する。
提案手法は, 一般的な推論, 複雑な数学的ベンチマーク, きめ細かい決定論的タスクにおいて, 精度を著しく向上させる。
論文 参考訳(メタデータ) (2026-09-13T17:04:16Z) - Characterizing Software Aging in GPU-Based LLM Serving Systems [3.2117529539472716]
本稿では,GPU ベースの LLM サービスシステムにおいて,ソフトウェア老化を研究するための実証手法を提案する。
同一のストレス条件下で、6つの共同配置で216時間のキャンペーンを実施。
以上の結果から,すべてのデプロイメントにおけるメモリ老化は統計的に有意であり,リーク率はサービスおよびデプロイメント構成に大きく依存することがわかった。
論文 参考訳(メタデータ) (2026-06-10T10:48:50Z) - RealBench: A Repo-Level Code Generation Benchmark Aligned with Real-World Software Development Practices [54.956760584923295]
コード生成にLLM(Large Language Models)を使用することで、研究者は大幅に進歩した。
しかしながら、開発者は一般的に、生の自然言語記述ではなく、構造化された設計や仕様に基づいたコードを書く。
既存のベンチマークと実際の産業開発プラクティスのギャップは、現在のベンチマークスコアが、どれだけのコード生成が開発タスクの自動化に役立つかを正確に反映していないことを意味する。
論文 参考訳(メタデータ) (2026-04-24T15:35:54Z) - LLMs taking shortcuts in test generation: A study with SAP HANA and LevelDB [0.22940141855172033]
大規模言語モデル(LLM)は、しばしば高度な推論の主張につながる、公開ベンチマークで印象的な結果を得た。
本稿では,ソフトウェアメモリ化のための自動テスト生成の動作を,オープンソースシステムの性能と対比して検討する。
結果は、LLMはよく知られたオープンソースのベンチマークに優れているが、目立たない複雑で、多くの場合、有効性よりもコンパイル可能性に優先順位をつけるのに苦労していることを示している。
論文 参考訳(メタデータ) (2026-04-15T21:30:02Z) - Environment-Aware Code Generation: How far are We? [52.69113158357018]
大規模言語モデル(LLM)がユーザの特定の環境に適した実行可能コードを確実に生成できるかどうかは不明である。
本稿では,環境対応コード生成(EACG)の最初の体系的研究について述べる。
その結果,現在のLLMは環境固有のコード生成に苦しむ一方で,環境の適合性や実行性も向上していることがわかった。
論文 参考訳(メタデータ) (2026-01-18T04:58:15Z) - LoCoBench-Agent: An Interactive Benchmark for LLM Agents in Long-Context Software Engineering [90.84806758077536]
textbfLoCoBench-Agentは,大規模言語モデル(LLM)エージェントを現実的,長期的ソフトウェア工学で評価するための総合的な評価フレームワークである。
我々のフレームワークは、LoCoBenchの8000のシナリオを対話型エージェント環境に拡張し、マルチターン会話の体系的評価を可能にする。
我々のフレームワークは,8つの特殊なツール(ファイル操作,検索,コード解析)をエージェントに提供し,それを10Kから1Mトークンの範囲で評価する。
論文 参考訳(メタデータ) (2025-11-17T23:57:24Z) - Investigating Software Aging in LLM-Generated Software Systems [2.241579575562525]
本稿では,Large Language Models (LLM) によるアプリケーションにおけるソフトウェア老化現象を実験的に検討する。
BoltプラットフォームとBaxbenchからの標準化されたプロンプトを使用して、4つのサービス指向アプリケーションを生成し、50時間の負荷テストを実施しました。
その結果, 進行記憶の増大, 応答時間の増加, 性能不安定など, ソフトウェア老化の顕著な証拠が示された。
論文 参考訳(メタデータ) (2025-10-28T08:50:24Z) - InspectCoder: Dynamic Analysis-Enabled Self Repair through interactive LLM-Debugger Collaboration [71.18377595277018]
大きな言語モデル(LLM)は、診断が難しい複雑なロジックエラーを伴うバグの多いコードを生成することが多い。
対話型デバッガ制御による動的解析を LLM に委ねる初のエージェントプログラム修復システムである InspectCoder を提案する。
論文 参考訳(メタデータ) (2025-10-21T06:26:29Z) - Sample-Efficient Online Learning in LM Agents via Hindsight Trajectory Rewriting [92.57796055887995]
本稿では,言語モデルエージェントの強化学習から後視体験のリプレイに適応するプロンプトフレームワークECHOを紹介する。
ECHOは失敗した試みで達成できた代替目標のために最適化された軌道を生成する。
我々は、テキストベースのナビゲーションと計画ベンチマークであるXMiniGridのステートフルバージョンと、協調的な情報収集企業シミュレーションであるPeopleJoinQAについて、ECHOを評価した。
論文 参考訳(メタデータ) (2025-10-11T18:11:09Z) - On LLM-Assisted Generation of Smart Contracts from Business Processes [0.08192907805418582]
大規模言語モデル(LLM)は、ソフトウェアの生成方法の現実を変えました。
本稿では、ビジネスプロセス記述からスマートコントラクトコードを生成するためのLCMの使用について探索的研究を行う。
以上の結果から,LLMの性能はスマートコントラクト開発に必要な信頼性に劣ることがわかった。
論文 参考訳(メタデータ) (2025-07-30T20:39:45Z) - Training Language Models to Generate Quality Code with Program Analysis Feedback [66.0854002147103]
大規模言語モデル(LLM)によるコード生成は、ますます本番環境で採用されているが、コード品質の保証には失敗している。
実運用品質のコードを生成するためにLLMにインセンティブを与える強化学習フレームワークであるREALを提案する。
論文 参考訳(メタデータ) (2025-05-28T17:57:47Z) - SURGE: On the Potential of Large Language Models as General-Purpose Surrogate Code Executors [7.210032327838313]
大規模言語モデル(LLM)がコード実行予測の代理モデルとして機能するかどうかを検討する。
オープンソースおよびプロプライエタリ LLM の広範な分析を通じて,スケーリング法則,データ効率,予測精度について検討する。
計算機処理における効率的なサロゲートとしてのLCMの実現可能性に関する重要な知見を明らかにした。
論文 参考訳(メタデータ) (2025-02-16T15:38:19Z) - Leveraging Metamemory Mechanisms for Enhanced Data-Free Code Generation in LLMs [44.80420740455364]
M2WFは、大規模言語モデルのワンタイムコード生成を改善するためのフレームワークである。
従来の方法とは異なり、キュレートされたデータへの依存を最小限に抑え、さまざまなコーディングシナリオに適応する。
コードとフレームワークはGitHubとHuggingFaceで公開されている。
論文 参考訳(メタデータ) (2025-01-14T07:16:43Z) - Characterization of Large Language Model Development in the Datacenter [55.9909258342639]
大きな言語モデル(LLM)は、いくつかの変換タスクにまたがって素晴らしいパフォーマンスを示している。
しかし,大規模クラスタ資源を効率よく利用してLCMを開発することは容易ではない。
我々は,GPUデータセンタAcmeから収集した6ヶ月のLDM開発ワークロードの詳細な評価を行った。
論文 参考訳(メタデータ) (2024-03-12T13:31:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。