論文の概要: Balancing Usefulness and Naturalness: An LLM-based Curation Pipeline for Code Review Comments
- arxiv url: http://arxiv.org/abs/2607.09524v1
- Date: Fri, 10 Jul 2026 15:33:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.891344
- Title: Balancing Usefulness and Naturalness: An LLM-based Curation Pipeline for Code Review Comments
- Title(参考訳): 有用性と自然性のバランスをとる - コードレビューのためのLLMベースのキュレーションパイプライン
- Abstract要約: コードレビューはソフトウェア開発の基盤であり、レビュー担当者はコードの品質、保守性、正確性を保証するために、コメントを書くことでフィードバックを提供する。
既存のコードレビューデータセットは、しばしば騒々しく、一貫性がなく、構造化が不十分である。
大規模コードレビューデータセットの品質と有用性を改善するために,2つの異なるキュレーションパイプラインを提案する。
- 参考スコア(独自算出の注目度): 3.55827089220224
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Code review is a cornerstone of software development, where reviewers provide feedback through written comments to ensure code quality, maintainability, and correctness. The effectiveness of this process hinges on the quality of review comments. As large language models (LLMs) gain traction in automating code review tasks, the utility of these systems is directly limited by the quality of the datasets on which they are trained. Unfortunately, existing code review datasets are often noisy, inconsistent, or poorly structured, which hinders the ability of LLMs to learn to generate accurate, helpful, and human-like review comments. To overcome these limitations, we propose two different curation pipelines designed to improve both the quality and the utility of large-scale code review datasets. In the first pipeline, all review comments are systematically reformulated by an LLM to improve their clarity, conciseness, and civility while preserving their semantic intent. The curated dataset resulting from this approach, called CuREV, offers cleaner, higher-quality, and easier-to-learn-from comments that lead to measurable improvements in downstream automation tasks, namely review comment generation and code refinement. Building on this, we propose an improved pipeline, guided by high-quality exemplars, that enhances the realism and diversity of curated review comments. This method first separates the dataset into high-quality and low-quality reviews, based on a systematic quality assessment using an evaluation framework. High-quality comments are preserved in their original form and further used as in-context exemplars to inspire the reformulation of low-quality comments. By varying the exemplars provided, the reformulated comments are not only clearer and more actionable but also exhibit a broader range of writing styles, making them more realistic and human-like.
- Abstract(参考訳): コードレビューはソフトウェア開発の基盤であり、レビュー担当者はコードの品質、保守性、正確性を保証するために、コメントを書くことでフィードバックを提供する。
このプロセスの有効性は、レビューコメントの品質に左右される。
大規模な言語モデル(LLM)がコードレビュータスクの自動化において勢いを増すにつれて、これらのシステムの実用性はトレーニング対象のデータセットの品質によって直接的に制限される。
残念なことに、既存のコードレビューデータセットは、しばしばうるさい、一貫性がない、あるいは構造化されていないため、LCMが正確で役に立つ、人間らしいレビューコメントを生成することを学ぶのを妨げている。
これらの制限を克服するために、大規模なコードレビューデータセットの品質と実用性を改善するために設計された2つの異なるキュレーションパイプラインを提案する。
最初のパイプラインでは、すべてのレビューコメントはLLMによって体系的に改革され、意味的な意図を維持しながら、その明確さ、簡潔さ、市民性を改善する。
このアプローチによるキュレートされたデータセットは、CuREVと呼ばれ、よりクリーンで、高品質で、より学習しやすいコメントを提供する。
そこで我々は,高品質な専門家が指導する改良されたパイプラインを提案し,レビューコメントの現実性と多様性を高める。
本手法はまず,評価フレームワークを用いた体系的品質評価に基づいて,データセットを高品質で低品質なレビューに分離する。
高品質なコメントは元の形式で保存され、低品質なコメントの改革を促すために、インコンテキストの例証としてさらに使用される。
提案された例によって、改訂されたコメントはより明確で実用的なだけでなく、幅広い書体スタイルが示され、より現実的で人間らしくなっている。
関連論文リスト
- Conversation for Non-verifiable Learning: Self-Evolving LLMs through Meta-Evaluation [56.84819098277464]
CoNLは、マルチエージェントのセルフプレイを通じて生成、評価、メタ評価を統合するフレームワークである。
CoNLは、安定したトレーニングを維持しながら、自己回帰ベースラインよりも一貫した改善を実現している。
論文 参考訳(メタデータ) (2026-01-29T09:41:14Z) - Reviewing the Reviewer: Elevating Peer Review Quality through LLM-Guided Feedback [75.31379834079648]
レビューを論証セグメントに分解するLLM駆動型フレームワークを提案する。
遅延思考と特異性をラベル付けした1,309文のデータセットであるLazyReviewPlusもリリースしました。
論文 参考訳(メタデータ) (2026-01-17T20:32:18Z) - LAURA: Enhancing Code Review Generation with Context-Enriched Retrieval-Augmented LLM [17.54065758880181]
本稿では,LAURA というコードレビュー生成のための LLM ベースの知識付加型コンテキスト認識フレームワークを提案する。
このフレームワークは、コードレビューコメントの生成におけるChatGPT-4oとDeepSeek v3のパフォーマンスを高めるために、レビュー検索、コンテキスト拡張、システマティックガイダンスを統合している。
論文 参考訳(メタデータ) (2025-12-01T07:10:23Z) - Unblocking Fine-Grained Evaluation of Detailed Captions: An Explaining AutoRater and Critic-and-Revise Pipeline [58.832237984587664]
VNLI-Critiqueは,自動文レベルの事実性分類と批判生成のためのモデルである。
1) VNLI-CritiqueはM-HalDetectベンチマークの最先端性能によって検証された堅牢な一般化を実証し、(2) VNLI-CritiqueによるDOCCI-Critique向けAutoRaterは信頼性の高いVLMランキングを提供し、人間の事実性判断と優れた整合性を示す。
論文 参考訳(メタデータ) (2025-06-09T10:57:26Z) - Leveraging Reward Models for Guiding Code Review Comment Generation [13.306560805316103]
コードレビューは、コード品質の評価、潜在的な問題に対するフィードバックの提供、特定された問題に対処するためのコード修正を含む、現代のソフトウェア開発において重要なコンポーネントである。
ディープラーニングのテクニックは、人間のレビュアーが行うようなコードにコメントすることで、コードレビューのジェネレーティブな側面に取り組むことができる。
本稿では,報酬機構を備えた強化学習を活用することによって,レビューコメント生成を自動化するディープラーニングフレームワークであるCoRALを紹介する。
論文 参考訳(メタデータ) (2025-06-04T21:31:38Z) - LazyReview A Dataset for Uncovering Lazy Thinking in NLP Peer Reviews [74.87393214734114]
この研究は、微粒な遅延思考カテゴリで注釈付けされたピアレビュー文のデータセットであるLazyReviewを紹介している。
大規模言語モデル(LLM)は、ゼロショット設定でこれらのインスタンスを検出するのに苦労する。
命令ベースのデータセットの微調整により、パフォーマンスが10~20ポイント向上する。
論文 参考訳(メタデータ) (2025-04-15T10:07:33Z) - Harnessing Large Language Models for Curated Code Reviews [2.5944208050492183]
コードレビューでは、構造化され、関連するコメントを生成することは、コードの問題を識別し、正確なコード変更を容易にするために不可欠である。
既存のコードレビューデータセットは、しばしば騒々しく、未解決であり、AIモデルの学習可能性に制限を課している。
本稿では,最大規模の公開コードレビューデータセットの品質向上を目的としたキュレーションパイプラインを提案する。
論文 参考訳(メタデータ) (2025-02-05T18:15:09Z) - Too Noisy To Learn: Enhancing Data Quality for Code Review Comment Generation [2.990411348977783]
オープンソースのデータセットは、自動コードレビュータスクのためのニューラルネットワークのトレーニングに使用される。
これらのデータセットには、クリーニングメソッドにもかかわらず持続する大量のノイズの多いコメントが含まれている。
大規模言語モデル(LLM)を用いて,これらのデータセットをさらにクリーン化する手法を提案する。
論文 参考訳(メタデータ) (2025-02-04T22:48:58Z) - Automating Patch Set Generation from Code Review Comments Using Large Language Models [2.045040820541428]
5つの人気のあるLarge Language Model(LLM)にコードコンテキストを提供します。
実世界のコードレビューコメントから提案したコード変更(パッチセット)を得る。
生成したパッチセットを人為的なパッチセットの履歴データと比較することにより、各モデルの性能を慎重に評価する。
論文 参考訳(メタデータ) (2024-04-10T02:46:08Z) - CritiqueLLM: Towards an Informative Critique Generation Model for Evaluation of Large Language Model Generation [87.44350003888646]
Eval-Instructは、疑似参照でポイントワイズした批評を取得し、マルチパスプロンプトを通じてこれらの批評を修正できる。
CritiqueLLMは、ChatGPTとすべてのオープンソースベースラインを上回るように実証的に示されています。
論文 参考訳(メタデータ) (2023-11-30T16:52:42Z) - Deep Just-In-Time Inconsistency Detection Between Comments and Source
Code [51.00904399653609]
本稿では,コード本体の変更によりコメントが矛盾するかどうかを検出することを目的とする。
私たちは、コメントとコードの変更を関連付けるディープラーニングアプローチを開発しています。
より包括的な自動コメント更新システムを構築するために,コメント更新モデルと組み合わせて提案手法の有用性を示す。
論文 参考訳(メタデータ) (2020-10-04T16:49:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。