論文の概要: LLM-Enhanced Commit Message Generation via Issue Information: An Exploratory Study
- arxiv url: http://arxiv.org/abs/2608.22004v1
- Date: Sat, 22 Aug 2026 15:17:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.555004
- Title: LLM-Enhanced Commit Message Generation via Issue Information: An Exploratory Study
- Title(参考訳): 課題情報によるLCM強化コミットメッセージ生成:探索的研究
- Abstract要約: 本稿では,Isue-Augmented framework for Commit Message Generation (ISAC) を提案する。
GPT-5.5 と DeepSeek-V4-Flash の2つの代表的な LLM を用いて4つの入力構成を評価する。
- 参考スコア(独自算出の注目度): 17.922274177126766
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Commit messages help developers understand code changes, support collaboration, and improve long-term maintenance. However, the use of issue information alone as the external context for LLM-based CMG has not been systematically studied. We propose an ISsue-Augmented framework for Commit message generation (ISAC) by combining code diffs with issue information as LLM input. To support the evaluation, we construct ApacheCM-Issue, a commit-issue aligned dataset built upon ApacheCM by linking commits with issues from GitHub and Apache Jira. Using samples from Scala, Java, and C++ projects, we evaluate four input configurations using two representative LLMs, GPT-5.5 and DeepSeek-V4-Flash in different reasoning configurations. The results show that incorporating issue information consistently improves LLM-based CMG across all evaluated model configurations and metrics, with the largest gains observed for CIDEr. Incorporating a similar historical commit further improves automatic metric scores, while replacing full issue information with a structured issue summary decreases them. ISAC also outperforms the four reproduced state-of-the-art (SOTA) CMG baselines across all five automatic metrics on the experimental dataset. The human evaluation further shows that structured issue summaries may improve perceived completeness, although replacing the original issue information can sacrifice contextual details and lead to worse results on automatic metrics.
- Abstract(参考訳): コミットメッセージは、開発者がコードの変更を理解し、コラボレーションをサポートし、長期的なメンテナンスを改善するのに役立つ。
しかし、LCMベースのCMGの外部コンテキストとしての課題情報のみの使用は、体系的に研究されていない。
LLM入力としてコード差分と問題情報を組み合わせたISsue-Augmented framework for Commit Message Generation (ISAC)を提案する。
この評価をサポートするために、GitHubとApache Jiraの課題にコミットをリンクすることで、ApacheCM上に構築されたコミット対応データセットであるApacheCM-Issueを構築します。
Scala、Java、C++プロジェクトのサンプルを使用して、2つの代表的なLCM、GPT-5.5とDeepSeek-V4-Flashを使って4つの入力構成を評価する。
その結果、問題情報の導入は、CIDErで観測される最大のゲインを持つ全ての評価モデル構成とメトリクスに対して、LCMベースのCMGを一貫して改善することを示した。
類似した履歴コミットを組み込むことにより、自動メートル法スコアがさらに向上すると同時に、フルイシュー情報を構造化されたイシューサマリに置き換えることにより、それらが減少する。
ISACはまた、実験データセット上の5つの自動メトリクスすべてに対して、再現された4つのSOTA(State-of-the-art)CMGベースラインを上回っている。
人的評価により、構造化された課題要約は、認識された完全性を改善する可能性があるが、元の課題情報を置き換えることで、文脈の詳細を犠牲にして、自動測定結果の悪化につながる可能性がある。
関連論文リスト
- MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation [51.15583711678273]
本稿では,データ生成,モデルトレーニング,評価を橋渡しする新しいクローズドループシステムを提案する。
各ループイテレーションの中で、MLLM-DataEngineはまず評価結果に基づいてモデルの弱点を分析する。
MLLM-DataEngineは,人間を介さずに,目標かつ自動でMLLMの能力を高めることができる。
論文 参考訳(メタデータ) (2026-07-07T08:35:38Z) - CoRaCMG: Contextual Retrieval-Augmented Framework for Commit Message Generation [17.392708936075223]
Commit Message Generationは、コード差分から記述的なコミットメッセージを自動的に生成し、開発者の労力を削減し、メッセージ品質を向上させることを目的としている。
本稿では,3つのフェーズで構成されたCommit Message Generationのためのコンテキスト検索拡張フレームワークであるCoRaCMGを提案する。
CoRaCMGは、プロジェクト固有の用語やスタイルを検索したdiff-messageペアから学習することを可能にする。
論文 参考訳(メタデータ) (2025-09-22T19:00:04Z) - A Real-World Benchmark for Evaluating Fine-Grained Issue Solving Capabilities of Large Language Models [11.087034068992653]
FAUN-Eval は LLM の Fine-grAined issUe solviNg 機能を評価するために特別に設計されたベンチマークである。
30の有名なGitHubリポジトリからキュレートされたデータセットを使って構築されている。
FAUN-Evalでは,4つのクローズドソースモデルと6つのオープンソースモデルを含む10個のLLMを評価した。
論文 参考訳(メタデータ) (2024-11-27T03:25:44Z) - Towards Realistic Evaluation of Commit Message Generation by Matching Online and Offline Settings [77.20838441870151]
オンラインメトリック - VCSに生成されたメッセージをコミットする前にユーザが導入する編集回数 - を使用して、オフライン実験用のメトリクスを選択します。
我々は,GPT-4が生成したコミットメッセージと,人間の専門家が編集したコミットメッセージからなる57対のデータセットを収集した。
以上の結果から,編集距離が最も高い相関性を示すのに対し,BLEUやMETEORなどの類似度は低い相関性を示すことがわかった。
論文 参考訳(メタデータ) (2024-10-15T20:32:07Z) - DARG: Dynamic Evaluation of Large Language Models via Adaptive Reasoning Graph [70.79413606968814]
本稿では,適応推論グラフ展開(DARG)によるLCMの動的評価を導入し,複雑性と多様性を制御した現在のベンチマークを動的に拡張する。
具体的には、まず現在のベンチマークでデータポイントの推論グラフを抽出し、それから推論グラフを摂動させて新しいテストデータを生成する。
このような新しく生成されたテストサンプルは、元のベンチマークと同様の言語的多様性を維持しながら、複雑さのレベルが異なる可能性がある。
論文 参考訳(メタデータ) (2024-06-25T04:27:53Z) - Automated Commit Message Generation with Large Language Models: An Empirical Study and Beyond [24.151927600694066]
コミットメッセージ生成(CMG)アプローチは、与えられたコード差分に基づいてコミットメッセージを自動的に生成することを目的としている。
本稿では,Large Language Models (LLMs) を用いて高品質なコミットメッセージの生成にどの程度の期間を費やしてきたかを調べるための,最初の包括的な実験を行う。
論文 参考訳(メタデータ) (2024-04-23T08:24:43Z) - Beyond Traditional Benchmarks: Analyzing Behaviors of Open LLMs on Data-to-Text Generation [0.0]
データ・トゥ・テキスト(D2T)生成タスクにおけるオープン・大規模言語モデル(LLM)の挙動を解析する。
オープン LLM は,Quintd で収集した共通フォーマットのデータから,ゼロショット設定で,ゆるやかで一貫性のあるテキストを生成することができる。
論文 参考訳(メタデータ) (2024-01-18T18:15:46Z) - ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code [76.84199699772903]
ML-Benchは、既存のコードリポジトリを利用してタスクを実行する現実世界のプログラミングアプリケーションに根ざしたベンチマークである。
LLM(Large Language Model)とAIエージェントの両方を評価するために、事前に定義されたデプロイメント環境でLLMのテキスト-コード変換を評価するML-LLM-Benchと、Linuxサンドボックス環境でエンドツーエンドのタスク実行で自律エージェントをテストするML-Agent-Benchの2つの設定が採用されている。
論文 参考訳(メタデータ) (2023-11-16T12:03:21Z) - What Makes for Good Visual Instructions? Synthesizing Complex Visual Reasoning Instructions for Visual Instruction Tuning [111.01953096869947]
マルチモーダル大言語モデル(MLLM)のゼロショット一般化能力向上に視覚的指導チューニングが不可欠である
我々は,高品質な視覚的推論命令を自動生成する体系的手法を開発した。
実験結果から, MLLMの強化性能が一貫した結果を得た。
論文 参考訳(メタデータ) (2023-11-02T15:36:12Z) - The GitHub Recent Bugs Dataset for Evaluating LLM-based Debugging
Applications [20.339673903885483]
大規模言語モデル(LLM)は、強力な自然言語処理とコード合成機能を示している。
LLMのトレーニングデータの詳細は公開されていないことが多く、既存のバグベンチマークが含まれているかどうかが懸念されている。
このデータセットには、OpenAIデータカットオフポイント後に収集された76の現実世界のJavaバグが含まれている。
論文 参考訳(メタデータ) (2023-10-20T02:37:44Z) - Struc-Bench: Are Large Language Models Really Good at Generating Complex Structured Data? [49.688233418425995]
Struc-Benchは、大きな言語モデル(LLM)を特徴とする包括的なベンチマークである。
Pスコア(Prompting Score)とHスコア(Heuristical Score)の2つの革新的な指標を提案する。
実験の結果,LLaMA-7Bに構造認識の微調整を適用すると,性能が大幅に向上することがわかった。
論文 参考訳(メタデータ) (2023-09-16T11:31:58Z) - MLLM-DataEngine: An Iterative Refinement Approach for MLLM [62.30753425449056]
本稿では,データ生成,モデルトレーニング,評価を橋渡しする新しいクローズドループシステムを提案する。
各ループ内で、MLLM-DataEngineはまず評価結果に基づいてモデルの弱点を分析する。
ターゲットとして,異なる種類のデータの比率を調整する適応型バッドケースサンプリングモジュールを提案する。
品質については、GPT-4を用いて、各データタイプで高品質なデータを生成する。
論文 参考訳(メタデータ) (2023-08-25T01:41:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。