論文の概要: Understanding before Naming! Enhancing LLM-based Method Name Prediction with Code Summarization
- arxiv url: http://arxiv.org/abs/2607.12467v1
- Date: Tue, 14 Jul 2026 07:51:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.08138
- Title: Understanding before Naming! Enhancing LLM-based Method Name Prediction with Code Summarization
- Title(参考訳): 命名前理解! コード要約によるLCMに基づくメソッド名予測の強化
- Abstract要約: メソッド名は、コードの理解性、保守性、開発者のコラボレーションに影響を与える。
コードスニペットからメソッド名を自動的に生成するメソッド名予測が最近注目を集めている。
既存の評価は主にトークンの類似度指標に依存しており、意味的品質の人間の判断を反映しないことが多い。
- 参考スコア(独自算出の注目度): 19.50157537060179
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Method names are critical to software quality, affecting code comprehensibility, maintainability, and developer collaboration. However, manually designing meaningful method names is challenging. Method Name Prediction (MNP), which automatically generates method names from code snippets, has recently attracted attention. Although large language models (LLMs) show promising performance for MNP, two challenges remain. First, existing evaluations mainly rely on token similarity metrics, which often fail to reflect human judgments of semantic quality. Second, current LLM-based MNP methods usually generate names through direct code-to-name mapping, which differs from the human process of understanding functionality before naming. To address these challenges, we conduct empirical studies on LLM-based evaluation and MNP strategies. We compare 6 metric-based evaluators, 5 LLM-based evaluators, and 6 human evaluators. Results show that LLM-based evaluators, especially DeepSeek-based evaluators, are more consistent with human judgments than traditional metrics. We further compare direct generation and summarization-and-refinement strategies. Results indicate that summarization and refinement generally improve the semantic quality of generated names. Case studies reveal three limitations: inaccurate summaries, semantic misalignment, and close semantic scores. Based on these findings, we propose SMNP, an MNP approach combining MNP-oriented summarization and chain-of-thought enhanced refinement. Experiments on 5 LLMs and 2 datasets demonstrate the effectiveness and robustness of SMNP.
- Abstract(参考訳): メソッド名は、コードの理解性、保守性、開発者のコラボレーションに影響を与える。
しかし,手作業で意味のあるメソッド名を設計することは困難である。
コードスニペットからメソッド名を自動的に生成するメソッド名予測(MNP)が最近注目を集めている。
大きな言語モデル(LLM)はMNPに有望な性能を示すが、2つの課題が残っている。
まず、既存の評価は主にトークンの類似度指標に依存しており、意味的品質の人間の判断を反映しないことが多い。
第二に、現在の LLM ベースの MNP メソッドは通常、直接コード・ツー・ネームマッピングによって名前を生成する。
これらの課題に対処するため,LLMに基づく評価とMDN戦略に関する実証的研究を行った。
6つの計量式評価器,5つのLLM式評価器,および6つの人間式評価器を比較した。
その結果,LLMに基づく評価器,特にDeepSeekに基づく評価器は従来の指標よりも人間の判断と一致していることがわかった。
さらに、直接生成と要約・縮小戦略を比較します。
その結果,要約や改良によって生成した名前の意味的品質が向上することが示唆された。
ケーススタディでは、不正確な要約、セマンティックなミスアライメント、密接なセマンティックスコアの3つの制限が示されている。
これらの知見に基づいて,MNP指向の要約とチェーン・オブ・ファインメントの強化を併用したMNPアプローチであるSMNPを提案する。
SMNPの有効性とロバスト性を示す5つのLLMと2つのデータセットの実験を行った。
関連論文リスト
- On the Effectiveness of LLM-as-a-judge for Code Generation and Summarization [54.965787768076254]
大規模言語モデルは、最近、Q&Aのような複雑な自然言語処理タスクの裁判官として活用されている。
コード生成とコード要約という2つのコード関連タスクに対するLLMs-as-a-judgeの有効性について検討した。
論文 参考訳(メタデータ) (2025-07-22T13:40:26Z) - Deep Learning-Based Identification of Inconsistent Method Names: How Far Are We? [6.199085977656376]
本稿では,非一貫性なメソッド名を識別するための最先端のディープラーニング手法を評価する実証的研究について述べる。
我々はコミット履歴からの自動識別と手動の開発者検査を組み合わせることで、新しいベンチマークを作成する。
その結果、バランスの取れたデータセットから新しいベンチマークに移行すると、パフォーマンスが大幅に低下することがわかった。
論文 参考訳(メタデータ) (2025-01-22T03:51:56Z) - Ontology Matching with Large Language Models and Prioritized Depth-First Search [0.2454454561635539]
優先的な深度優先探索 (PDFS) 戦略に, 検索・識別・分岐パイプラインを組み込む新しいアプローチであるMILAを導入する。
このアプローチは、高い精度で多数の意味的対応を効果的に識別し、LLM要求を最も境界的なケースに限定する。
提案手法は,5つの教師なしタスクのうち4つのタスクのうち,最も高いF-Measureを実現し,最先端OMシステムよりも最大17%向上した。
論文 参考訳(メタデータ) (2025-01-20T12:29:09Z) - Human-Like Code Quality Evaluation through LLM-based Recursive Semantic Comprehension [39.277408536940825]
コード品質評価には、特定の問題ステートメントに対する参照コードに基づいて生成されたコード品質を評価することが含まれる。
現在、コード品質の評価には、マッチベースの評価と実行ベースの評価の2つの主要な形態がある。
論文 参考訳(メタデータ) (2024-11-30T01:49:25Z) - Source Code Summarization in the Era of Large Language Models [34.80939934434718]
大規模言語モデル(LLM)は、コード関連のタスクのパフォーマンスを大幅に向上させた。
本稿では,LLMにおけるコード要約の体系的および包括的研究を行う。
論文 参考訳(メタデータ) (2024-07-09T05:48:42Z) - MR-Ben: A Meta-Reasoning Benchmark for Evaluating System-2 Thinking in LLMs [55.20845457594977]
大規模言語モデル(LLM)は、問題解決と意思決定の能力の向上を示している。
本稿ではメタ推論技術を必要とするプロセスベースのベンチマークMR-Benを提案する。
メタ推論のパラダイムは,システム2のスロー思考に特に適しています。
論文 参考訳(メタデータ) (2024-06-20T03:50:23Z) - Sample-Efficient Human Evaluation of Large Language Models via Maximum Discrepancy Competition [38.822535662755314]
大規模言語モデル(LLM)のためのサンプル効率のよい人的評価手法を提案する。
提案手法は,LLM応答のペア間のセマンティックな差異を最大化する,コンパクトな入力命令セットを自動的に適応的に選択する。
人間の評価者は、これらのペア化された反応に対して3つの代替的な選択を行い、エロ評価を用いてグローバルなランキングに集約される。
論文 参考訳(メタデータ) (2024-04-10T01:26:24Z) - Evaluating Generative Language Models in Information Extraction as Subjective Question Correction [49.729908337372436]
本稿では,新しい評価手法SQC-Scoreを提案する。
主観的質問訂正の原則に着想を得て,新しい評価手法SQC-Scoreを提案する。
3つの情報抽出タスクの結果から,SQC-Scoreは基準値よりもアノテータの方が好ましいことが示された。
論文 参考訳(メタデータ) (2024-04-04T15:36:53Z) - CLOMO: Counterfactual Logical Modification with Large Language Models [109.60793869938534]
本稿では,新しいタスク,CLOMO(Counterfactual Logical Modification)と高品質な人間アノテーションベンチマークを紹介する。
このタスクでは、LLMは所定の論理的関係を維持するために、与えられた議論的テキストを順応的に変更しなければなりません。
LLMの自然言語出力を直接評価する革新的な評価指標である自己評価スコア(SES)を提案する。
論文 参考訳(メタデータ) (2023-11-29T08:29:54Z) - InfiMM-Eval: Complex Open-Ended Reasoning Evaluation For Multi-Modal
Large Language Models [50.03163753638256]
MLLM(Multi-modal Large Language Models)は人工知能の分野で注目されている。
本ベンチマークは, 帰納的, 帰納的, 類推的推論の3つの主要な推論カテゴリから構成される。
我々は,この厳密に開発されたオープンエンド多段階精巧な推論ベンチマークを用いて,代表MLLMの選択を評価する。
論文 参考訳(メタデータ) (2023-11-20T07:06:31Z) - Benchmarking Generation and Evaluation Capabilities of Large Language Models for Instruction Controllable Summarization [132.25202059478065]
命令制御可能なテキスト要約の大規模言語モデル(LLM)をベンチマークする。
本研究は,LLMにおいて,命令制御可能なテキスト要約が依然として困難な課題であることを示す。
論文 参考訳(メタデータ) (2023-11-15T18:25:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。