論文の概要: MRCoder: An Efficient Context Selecting Approach for Repository-Level Code Generation
- arxiv url: http://arxiv.org/abs/2607.26805v1
- Date: Wed, 29 Jul 2026 11:47:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.656547
- Title: MRCoder: An Efficient Context Selecting Approach for Repository-Level Code Generation
- Title(参考訳): MRCoder:リポジトリレベルコード生成のための効率的なコンテキスト選択アプローチ
- Abstract要約: 大規模言語モデル(LLM)は、コード生成において強力な能力を示している。
リポジトリレベルのコード生成には、リポジトリ固有のコンテキストを効果的に識別し、利用する必要があります。
本稿では,効率的なコンテキスト選択フレームワークMRCoderを提案する。
- 参考スコア(独自算出の注目度): 6.7383807549793255
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) have demonstrated strong capabilities in code generation. However, repository-level code generation remains challenging, as it requires effectively identifying and utilizing repository-specific context. While retrieval-augmented generation (RAG) incorporates relevant code snippets, it often introduces redundant context that interferes with the LLM's ability to utilize relevant information, leading to degraded generation quality and increased computational cost. Moreover, existing context selection and compression methods struggle to balance efficiency and quality, either introducing additional computational overhead or failing to effectively select valid context. In this paper, we propose MRCoder, an efficient context selection framework that improves both the effectiveness and efficiency of repository-level code generation. MRCoder adopts a Map-Reduce paradigm: in the Map Phase, a lightweight draft model generates drafts over partitioned contexts, and Structure-Aware Draft-Guided Selection (SADGS) selects informative contexts based on drafts through API consistency and logical similarity; in the Reduce Phase, the refined contexts are aggregated for final generation, with a parallel verification strategy further accelerating decoding. We evaluate MRCoder on two widely used repository-level code generation benchmarks, CoderEval and DevEval, using Qwen2.5-Coder and DeepSeek-Coder as backbone LLMs. Experimental results show that MRCoder improves code generation accuracy over strong baselines while reducing token consumption by 30 to 50% and inference time by up to 52%. These results demonstrate that our proposed structured and draft-guided context selection strategy is crucial for improving both the quality and efficiency of repository-level code generation
- Abstract(参考訳): 大規模言語モデル(LLM)は、コード生成において強力な能力を示している。
しかし、リポジトリ固有のコンテキストを効果的に識別し利用する必要があるため、リポジトリレベルのコード生成は依然として困難である。
検索強化生成(RAG)は関連するコードスニペットを組み込んでいるが、LLMが関連する情報を利用する能力に干渉する冗長なコンテキストを導入し、劣化した生成品質と計算コストを増大させる。
さらに、既存のコンテキスト選択と圧縮手法は効率と品質のバランスをとるのに苦労し、計算オーバーヘッドを増大させるか、有効なコンテキストを選択するのに失敗する。
本稿では,リポジトリレベルのコード生成の有効性と効率性を両立させる,効率的なコンテキスト選択フレームワークMRCoderを提案する。
MRCoderはMap-Reduceパラダイムを採用している。Map Phaseでは、軽量のドラフトモデルが分割されたコンテキスト上のドラフトを生成し、Structure-Aware Draft-Guided Selection (SADGS)はAPIの一貫性と論理的類似性を通じて、ドラフトに基づいた情報的コンテキストを選択する。
我々は,広く使用されている2つのリポジトリレベルのコード生成ベンチマークであるCoderEvalとDevEvalについて,Qwen2.5-CoderとDeepSeek-Coderを用いてMRCoderを評価した。
実験結果から,MRCoderはトークン消費量を30~50%削減し,推論時間を最大52%削減しながら,強いベースライン上でのコード生成精度を向上させることがわかった。
これらの結果は、リポジトリレベルのコード生成の品質と効率を改善するために、提案した構造化およびドラフト誘導型コンテキスト選択戦略が重要であることを示している。
関連論文リスト
- Adaptive Critical Token-Aware Retrieval for Repository-Level Code Generation [53.85136813868056]
ACToRは、リポジトリレベルのコード生成のための適応型クリティカルトークン対応検索フレームワークである。
我々は、ACToRが、リポジトリレベルのベンチマークにおいて、最先端のメソッドを一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-09-01T17:59:39Z) - Do Not Treat Code as Natural Language: Implications for Repository-Level Code Generation and Beyond [13.550121154853715]
自然言語ではなく構造化コードとしてコードを扱う,リポジトリレベルのコード生成フレームワークであるHydraを紹介します。
我々はHydraがオープンソースおよびクローズドソースのCodeLLMにまたがって最先端のパフォーマンスを実現することを示す。
論文 参考訳(メタデータ) (2026-02-12T07:44:00Z) - AlignCoder: Aligning Retrieval with Target Intent for Repository-Level Code Completion [55.21541958868449]
リポジトリレベルのコード補完フレームワークであるAlignCoderを提案する。
我々のフレームワークは、初期クエリとターゲットコードのセマンティックギャップを橋渡しする拡張クエリを生成する。
我々は、拡張クエリにおける推論情報を活用してより正確な検索を行うAlignRetrieverのトレーニングに強化学習を採用する。
論文 参考訳(メタデータ) (2026-01-27T15:23:14Z) - Knowledge Graph Based Repository-Level Code Generation [0.0]
本稿では,コード検索と検索を改善するための知識グラフに基づく新しい手法を提案する。
提案手法は,コードリポジトリをグラフとして表現し,コンテキスト認識型コード生成のための構造情報とリレーショナル情報をキャプチャする。
提案手法を,リポジトリレベルのコード生成ベンチマークであるEvolutionary Code Benchmarkデータセットにベンチマークし,提案手法がベースラインアプローチを著しく上回ることを示す。
論文 参考訳(メタデータ) (2025-05-20T14:13:59Z) - FastCoder: Accelerating Repository-level Code Generation via Efficient Retrieval and Verification [10.286072352686874]
我々は、コード生成用に特別に設計された推論アクセラレーションアプローチであるFastCoderを提案する。
FastCoderはマルチソースのデータストアを構築し、一般的な知識とプロジェクト固有の知識の両方へのアクセスを提供する。
リポジトリレベルとスタンドアロンのコード生成タスクにおける自動回帰デコードと比較して、最大2.53倍と2.54倍のスピードアップに達する。
論文 参考訳(メタデータ) (2025-02-24T13:30:30Z) - Reward-Guided Speculative Decoding for Efficient LLM Reasoning [80.55186052123196]
Reward-Guided Speculative Decoding (RSD)は,大規模言語モデル(LLM)における推論の効率向上を目的とした新しいフレームワークである。
RSDは、厳密な偏りを強制する既存の投機的復号法とは対照的に、制御されたバイアスをハイリワード出力の優先順位付けに取り入れている。
RSDは,対象モデルのみでの復号化に対して,高い効率向上を実現し,並列復号法よりも高い精度を実現している。
論文 参考訳(メタデータ) (2025-01-31T17:19:57Z) - CodeRAG-Bench: Can Retrieval Augment Code Generation? [78.37076502395699]
検索拡張生成を用いたコード生成の系統的,大規模な解析を行う。
まず、コード生成タスクの3つのカテゴリを含む総合的な評価ベンチマークであるCodeRAG-Benchをキュレートする。
CodeRAG-Bench上のトップパフォーマンスモデルについて、1つまたは複数のソースから検索したコンテキストを提供することにより検討する。
論文 参考訳(メタデータ) (2024-06-20T16:59:52Z) - On the Impacts of Contexts on Repository-Level Code Generation [5.641402231731082]
本稿ではレポジトリレベルのコード生成を評価するために設計された新しいベンチマークであるRepoExecを紹介する。
実行可能性、包括的なテストケース生成による機能的正当性、ファイル間のコンテキストの正確な利用という3つの重要な側面に注目します。
論文 参考訳(メタデータ) (2024-06-17T10:45:22Z) - Comments as Natural Logic Pivots: Improve Code Generation via Comment Perspective [85.48043537327258]
本稿では, MANGO (comMents As Natural loGic pivOts) を提案する。
その結果、MANGOは強いベースラインに基づいてコードパス率を大幅に改善することがわかった。
論理的なコメントの復号化戦略の堅牢性は、考えの連鎖よりも顕著に高い。
論文 参考訳(メタデータ) (2024-04-11T08:30:46Z) - Repoformer: Selective Retrieval for Repository-Level Code Completion [30.706277772743615]
検索強化生成(RAG)の最近の進歩は、リポジトリレベルのコード補完の新たな時代が始まった。
本稿では,不要な場合の検索を回避するため,選択的なRAGフレームワークを提案する。
我々のフレームワークは、異なる世代モデル、レトリバー、プログラミング言語に対応できることを示します。
論文 参考訳(メタデータ) (2024-03-15T06:59:43Z) - StepCoder: Improve Code Generation with Reinforcement Learning from
Compiler Feedback [58.20547418182074]
2つの主要コンポーネントからなるコード生成の新しいフレームワークであるStepCoderを紹介します。
CCCSは、長いシーケンスのコード生成タスクをCurriculum of Code Completion Subtaskに分割することで、探索課題に対処する。
FGOは、未実行のコードセグメントをマスクすることでのみモデルを最適化し、Fine-Grained Optimizationを提供する。
提案手法は,出力空間を探索し,対応するベンチマークにおいて最先端の手法より優れた性能を発揮する。
論文 参考訳(メタデータ) (2024-02-02T13:14:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。