論文の概要: An Exploratory Study on LLM-Generated Code and Comments in Code Repositories
- arxiv url: http://arxiv.org/abs/2607.01867v1
- Date: Thu, 02 Jul 2026 08:25:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.743332
- Title: An Exploratory Study on LLM-Generated Code and Comments in Code Repositories
- Title(参考訳): コードリポジトリにおけるLCM生成コードとコメントの探索的研究
- Abstract要約: LLMが生成する可能性のあるコードとコメントとその特性について検討する。
当社は,2021年から2025年にかけて,企業とコミュニティの活発なリポジトリの実験を行っている。
- 参考スコア(独自算出の注目度): 6.161007996548193
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The use of LLMs in software development has become increasingly widespread on tasks such as code generation and summarization. Reports from large technology companies showed that around 20% to 30% of their code are generated by LLMs. However, there remains skepticism about the practical usage of LLM-generated code and comments, such as concerns on more time for debugging the generated code and the unnaturalness of the generated comments. In this paper, we study the code and comments detected as likely to be generated by LLMs and their characteristics, the differences between company- and community-maintained repositories, and how likely bugs are associated with LLM-generated code. We conduct extensive experiments on active company- and community-maintained repositories from 2021 to 2025 using various tools and techniques that detect code and comments generated by LLMs. Based on our detector-based proxy analysis, the results suggest that code detected as likely to be generated by LLMs decreased over time and appeared frequently in test cases, while that of comments remains relatively stable. Proxy results further suggest that code detected as likely to be generated by LLMs shows substantial intra-repository code clones, whereas comments exhibit a relatively low proportion of grammatically correct sentences. In addition, the company-maintained repositories show a higher percentage of code and comments detected as likely to be generated by LLMs, and only a small percentage of the human-labelled bugs are detected as being likely associated with LLM-generated code.
- Abstract(参考訳): ソフトウェア開発におけるLLMの使用は、コード生成や要約といったタスクでますます広まりつつある。
大企業の報告によると、そのコードの約20%から30%はLLMによって生成される。
しかしながら、LLMの生成したコードとコメントの実用的使用については、生成したコードのデバッグにより多くの時間を要することや、生成されたコメントの不自然さなど、懐疑的な意見が残っている。
本稿では,LLMが生成する可能性のあるコードとコメント,その特性,企業リポジトリとコミュニティリポジトリの違い,およびLLM生成コードにバグが関連している可能性について検討する。
LLMが生成するコードやコメントを検出する様々なツールや技術を用いて,2021年から2025年までの企業およびコミュニティが管理するリポジトリに対して,広範な実験を行った。
その結果,LLMによって検出される可能性のあるコードは時間とともに減少し,テストケースで頻繁に現れる一方で,コメントの数は比較的安定していることがわかった。
さらに, LLMによって検出される可能性のあるコードは, レポジトリ内コードクローンがかなり少ないのに対して, コメントは文法的に正しい文の比率が比較的低いことが示唆された。
さらに、LLMが生成する可能性のあるコードやコメントの割合がより高く、LLMが生成するコードに関連する可能性のあるバグが検出されるのは、ごくわずかである。
関連論文リスト
- Same Scrutiny, More Time: Eye Tracking Insights into Reviewing LLM-Labelled Code [3.7910079742785787]
We conduct a Wizard-of-Oz experiment to examine how software engineers behavior when code is clearly labeled as LLM- generated during a code review task。
コードレビューの徹底性は参加者にとって変わらなかったが、ラベル自体が注意に影響を及ぼすことを示すLCMに多くの時間を費やした。
実践者は、特定の基準に基づいてコードを評価したり、そのプロンプトを使ってレビューをガイドすることで、LLMをラベル付けしたコードに対するレビュー戦略にも適応した。
論文 参考訳(メタデータ) (2026-06-25T01:23:05Z) - RealBench: A Repo-Level Code Generation Benchmark Aligned with Real-World Software Development Practices [54.956760584923295]
コード生成にLLM(Large Language Models)を使用することで、研究者は大幅に進歩した。
しかしながら、開発者は一般的に、生の自然言語記述ではなく、構造化された設計や仕様に基づいたコードを書く。
既存のベンチマークと実際の産業開発プラクティスのギャップは、現在のベンチマークスコアが、どれだけのコード生成が開発タスクの自動化に役立つかを正確に反映していないことを意味する。
論文 参考訳(メタデータ) (2026-04-24T15:35:54Z) - The Fools are Certain; the Wise are Doubtful: Exploring LLM Confidence in Code Completion [4.215010577170175]
コードパープレキシティの測定により,コード生成時のLLM(Large Language Models)の信頼性を評価する。
強い型付け言語は動的型付け言語よりも難易度が低いことがわかった。
Perlは難易度が普遍的に高いが、Javaは低いように見える。
論文 参考訳(メタデータ) (2025-08-22T06:51:13Z) - IFEvalCode: Controlled Code Generation [69.28317223249358]
本稿では,Code LLMの命令追従能力を改善するために,前方および後方制約生成を提案する。
IFEvalCodeは、7つのプログラミング言語の1.6Kテストサンプルからなる多言語ベンチマークである。
論文 参考訳(メタデータ) (2025-07-30T08:08:48Z) - Code Evolution Graphs: Understanding Large Language Model Driven Design of Algorithms [2.827573861233375]
大規模言語モデル(LLM)はコード生成において大きな可能性を証明しています。
3つのベンチマーク問題クラスの結果を示し、新しい知見を示す。
論文 参考訳(メタデータ) (2025-03-20T19:30:22Z) - Combining LLM Code Generation with Formal Specifications and Reactive Program Synthesis [0.7580487359358722]
大規模言語モデル(LLM)は精度に苦しむが、リスクの高いアプリケーションには適さない。
コード生成を LLM で処理する部分と,形式的なメソッドベースのプログラム合成で処理する部分の2つに分割する手法を提案する。
論文 参考訳(メタデータ) (2024-09-18T15:59:06Z) - What's Wrong with Your Code Generated by Large Language Models? An Extensive Study [92.62952504133926]
本研究は,3つの一般的なベンチマーク上で,3つの主要なクローズドソースLLMと6つの人気のあるオープンソースLLMの性能評価を行った。
間違ったコードに対するバグの分類を開発し、一般的なバグタイプに対する根本原因を分析した。
本稿では,自己批判を導入し,LLMが生成したコードに対する批判と修正を可能にする,新たな学習自由反復手法を提案する。
論文 参考訳(メタデータ) (2024-07-08T17:27:17Z) - Where Is Self-admitted Code Generated by Large Language Models on GitHub? [14.13629953845785]
本研究では,GitHub上のLarge Language Modelsによって生成された自己許容コードについて検討する。
ChatGPTとCopilotはコード生成を支配しており、他のLLMからのコントリビューションは最小限である。
ほとんどのコードコメントは LLM の使用しか記述していないが、プロンプトやヒューマン編集、コードテストステータスなどの詳細は少ない。
論文 参考訳(メタデータ) (2024-06-27T21:47:27Z) - Towards Understanding the Characteristics of Code Generation Errors Made by Large Language Models [10.519984835232359]
大規模言語モデル(LLM)はコード生成において前例のない機能を示している。
我々は,HumanEvalデータセット上の6つの代表的なLCMに対して,コード生成エラーの詳細な解析を行った。
LLMによるコード生成エラーの発見と修正には,いくつかの課題が浮かび上がっている。
論文 参考訳(メタデータ) (2024-06-13T01:29:52Z) - Uncovering LLM-Generated Code: A Zero-Shot Synthetic Code Detector via Code Rewriting [78.48355455324688]
原符号とLLM書き換え版との類似性に基づく新しいゼロショット合成符号検出器を提案する。
以上の結果から,既存のSOTA合成コンテンツ検出装置よりも顕著な改善が得られた。
論文 参考訳(メタデータ) (2024-05-25T08:57:28Z) - CodeHalu: Investigating Code Hallucinations in LLMs via Execution-based Verification [73.66920648926161]
本稿では,コード幻覚の概念を導入し,実行検証に基づくコード幻覚の分類法を提案する。
本稿では,コード幻覚の検出と定量化を目的とした,CodeHaluと呼ばれる動的検出アルゴリズムを提案する。
また、699のタスクから8,883のサンプルを含むCodeHaluEvalベンチマークを導入し、コードの幻覚を体系的に定量的に評価する。
論文 参考訳(メタデータ) (2024-04-30T23:56:38Z) - InfiBench: Evaluating the Question-Answering Capabilities of Code Large Language Models [56.723509505549536]
InfiBenchは、私たちの知識に合ったコードのための、最初の大規模フリーフォーム質問回答(QA)ベンチマークです。
慎重に選択された234の高品質なStack Overflow質問で構成されており、15のプログラミング言語にまたがっている。
InfiBench上で100以上の最新のコードLLMに対して,系統的評価を行い,新しい知見と洞察に富んだ結果を得た。
論文 参考訳(メタデータ) (2024-03-11T02:06:30Z) - Assured LLM-Based Software Engineering [51.003878077888686]
この記事では,2024年4月15日にポルトガルのリスボンで開催された International Workshop on Interpretability, Robustness, and Benchmarking in Neural Software Engineering で,Mark Harman 氏による基調講演の内容の概要を紹介する。
論文 参考訳(メタデータ) (2024-02-06T20:38:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。