論文の概要: How Developers Experience Debugging Unfamiliar Codebases with Code Tours Generated and Evaluated by Local LLMs
- arxiv url: http://arxiv.org/abs/2607.26987v2
- Date: Wed, 05 Aug 2026 12:05:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 17:51:08.547724
- Title: How Developers Experience Debugging Unfamiliar Codebases with Code Tours Generated and Evaluated by Local LLMs
- Title(参考訳): ローカルLLMが生成し評価するコードツアーで開発者が馴染みのないコードベースをデバッグする方法
- Authors: Martin Balfroid, Julien Albert, Dzenatan Aliti, Xavier Devroey, Benoît Vanderose,
- Abstract要約: 実際のJavaバグからコードツアーを生成して評価するパイプラインを構築しました。
さまざまなバックグラウンドを持つ26人の開発者が,ユーザスタディに参加した。
開発者は、コードの長さで詳細をスケールしたツアーを好み、単にコードをリフレッシュすることを避け、ガイドのトーンを採用した。
- 参考スコア(独自算出の注目度): 0.23603300812061256
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Code tours are interactive, onboarding documentation to guide developers through a codebase. Large Language Models (LLMs) can automatically synthesize code tours. Prior work on code tour generation has not studied developer experience or trust calibration when debugging unfamiliar codebases with code tours generated and evaluated by open-weight LLMs. This study surveys how the properties of components in open-weight LLM-authored code tours influence developers' experiences when debugging unfamiliar codebases. We built a pipeline that generated and evaluated code tours from real reproducible bugs. 26 developers with varying backgrounds participated in a user study. In total, 26 code tours were authored from real Java bugs mined from 2025 GitHub commits, with each tour independently judged by two different LLMs, resulting in 52 evaluated configurations. Participants thought aloud as they explored each tour. Three authors qualitatively coded the interviews to identify recurring themes. Developers generally preferred tours that scaled detail with the code length, avoided merely restating code, were easily scannable, and adopted a guiding tone. However, some preferences were mutually exclusive, such as the use of imperative mood. Stack traces were often insufficient to identify all steps developers found relevant. Developers also trusted descriptions they perceived as human-written more than those they believed were AI-generated. Finally, LLM-generated annotations of tour quality were unreliable: sycophancy, confabulation, and incoherence were pervasive. This work lays a basis for future research on fine-tuning open-weight models for code tour generation, personalizing generation to accommodate diverging preferences, selecting relevant steps beyond stack traces, calibrating users' trust to avoid both disuse and misuse, and improving open-weight LLMs' ability to be more trustworthy evaluators
- Abstract(参考訳): コードツアーはインタラクティブで、開発者がコードベースをガイドするためのドキュメントが載っている。
LLM(Large Language Models)は、コードツアーを自動的に合成する。
コードツアー生成の以前の研究は、オープンウェイト LLM によって生成されたコードツアーで馴染みのないコードベースをデバッグする際に、開発者エクスペリエンスや信頼性のキャリブレーションを研究していなかった。
本研究では,LLMライセンスのオープンウェイトコードツアーにおけるコンポーネントの特性が,不慣れなコードベースをデバッグする際の開発者の経験にどのように影響するかを調査する。
私たちは、実際の再現可能なバグからコードツアーを生成し、評価するパイプラインを構築しました。
さまざまなバックグラウンドを持つ26人の開発者が,ユーザスタディに参加した。
合計26のコードツアーが、2025年のGitHubコミットから抽出された実際のJavaバグから作成され、各ツアーは2つの異なるLSMによって独立して判断され、52のコンフィギュレーションが評価された。
参加者は各ツアーを探検するときに大声で考えた。
3人の著者がインタビューを質的にコーディングし、繰り返し発生するテーマを特定した。
開発者は一般的に、コードの長さで詳細をスケールしたツアーを好んでおり、単にコードをリフレッシュすることを避け、簡単にスキャンでき、ガイドのトーンを採用した。
しかし、衝動的気分の使用など、相互排他的な嗜好もあった。
スタックトレースは、開発者が関連性を見出したすべてのステップを特定するのに不十分であることが多い。
開発者は、AIが生成したと信じているものよりも、人間が書いたと認識した記述も信頼している。
最終的に、LLMが生成したツアー品質のアノテーションは信頼できないものとなった。
この研究は、コードツアー生成のための微調整オープンウェイトモデルの研究、多様化する好みに対応するパーソナライズ生成、スタックトレースを超えて関連するステップの選択、使い捨てと誤用の両方を避けるためのユーザの信頼の調整、より信頼できる評価者になるためのオープンウェイトLLMの能力の向上の基礎となる。
関連論文リスト
- Same Scrutiny, More Time: Eye Tracking Insights into Reviewing LLM-Labelled Code [3.7910079742785787]
We conduct a Wizard-of-Oz experiment to examine how software engineers behavior when code is clearly labeled as LLM- generated during a code review task。
コードレビューの徹底性は参加者にとって変わらなかったが、ラベル自体が注意に影響を及ぼすことを示すLCMに多くの時間を費やした。
実践者は、特定の基準に基づいてコードを評価したり、そのプロンプトを使ってレビューをガイドすることで、LLMをラベル付けしたコードに対するレビュー戦略にも適応した。
論文 参考訳(メタデータ) (2026-06-25T01:23:05Z) - Patterns of Developer Adoption of LLM-Generated Code Refactoring Suggestions [3.008881106008445]
大規模言語モデル(LLM)は広く普及し、時間とともに着実に改善されている。
LLMは、可読性や保守性などの品質特性を改善するために、開発者がコードに適用することを提案する。
コミットメッセージにリンクされたChatGPT会話に基づいて、開発者がコードをコードする169のGitHubコミットを分析します。
開発者はほとんど修正せずに提案を受け入れて利用しているのがわかりました。
論文 参考訳(メタデータ) (2026-05-06T12:31:49Z) - IFEvalCode: Controlled Code Generation [69.28317223249358]
本稿では,Code LLMの命令追従能力を改善するために,前方および後方制約生成を提案する。
IFEvalCodeは、7つのプログラミング言語の1.6Kテストサンプルからなる多言語ベンチマークである。
論文 参考訳(メタデータ) (2025-07-30T08:08:48Z) - Enhancing Code Generation via Bidirectional Comment-Level Mutual Grounding [6.867043179943195]
大規模言語モデル(LLM)はコード生成において前例のない能力を示している。
最近の研究によると、開発者はLLMが生成した間違ったコードの検査と修正に苦労することが多い。
コミュニケーションにおける相互基盤理論に着想を得て,コードコメントを開発者やLLMにとってのメディアとして活用し,共通理解を確立するインタラクティブなアプローチを提案する。
論文 参考訳(メタデータ) (2025-05-12T17:20:30Z) - Understanding Code Understandability Improvements in Code Reviews [79.16476505761582]
GitHub上のJavaオープンソースプロジェクトからの2,401のコードレビューコメントを分析した。
改善提案の83.9%が承認され、統合され、1%未満が後に復活した。
論文 参考訳(メタデータ) (2024-10-29T12:21:23Z) - What's Wrong with Your Code Generated by Large Language Models? An Extensive Study [92.62952504133926]
本研究は,3つの一般的なベンチマーク上で,3つの主要なクローズドソースLLMと6つの人気のあるオープンソースLLMの性能評価を行った。
間違ったコードに対するバグの分類を開発し、一般的なバグタイプに対する根本原因を分析した。
本稿では,自己批判を導入し,LLMが生成したコードに対する批判と修正を可能にする,新たな学習自由反復手法を提案する。
論文 参考訳(メタデータ) (2024-07-08T17:27:17Z) - Where Is Self-admitted Code Generated by Large Language Models on GitHub? [14.13629953845785]
本研究では,GitHub上のLarge Language Modelsによって生成された自己許容コードについて検討する。
ChatGPTとCopilotはコード生成を支配しており、他のLLMからのコントリビューションは最小限である。
ほとんどのコードコメントは LLM の使用しか記述していないが、プロンプトやヒューマン編集、コードテストステータスなどの詳細は少ない。
論文 参考訳(メタデータ) (2024-06-27T21:47:27Z) - Bugs in Large Language Models Generated Code: An Empirical Study [12.625305075672456]
コード用の大規模言語モデル(LLM)が最近注目を集めている。
人間書きのコードと同様、LLM生成コードはバグを起こしやすい。
本稿では,3つのLLMを用いて生成されたコードから収集した333個のバグのサンプルについて検討する。
論文 参考訳(メタデータ) (2024-03-13T20:12:01Z) - InfiBench: Evaluating the Question-Answering Capabilities of Code Large Language Models [56.723509505549536]
InfiBenchは、私たちの知識に合ったコードのための、最初の大規模フリーフォーム質問回答(QA)ベンチマークです。
慎重に選択された234の高品質なStack Overflow質問で構成されており、15のプログラミング言語にまたがっている。
InfiBench上で100以上の最新のコードLLMに対して,系統的評価を行い,新しい知見と洞察に富んだ結果を得た。
論文 参考訳(メタデータ) (2024-03-11T02:06:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。