論文の概要: Adaptive Critical Token-Aware Retrieval for Repository-Level Code Generation
- arxiv url: http://arxiv.org/abs/2609.01601v1
- Date: Tue, 01 Sep 2026 17:59:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.944057
- Title: Adaptive Critical Token-Aware Retrieval for Repository-Level Code Generation
- Title(参考訳): リポジトリレベルコード生成のための適応的臨界トークン認識検索
- Authors: Kefeng Duan, Dewu Zheng, Yanlin Wang, Terry Yue Zhuo, Mingwei Liu, Jianxing Yu, Jiachi Chen, Ensheng Shi, Xilin Liu, Yuchi Ma, Zibin Zheng,
- Abstract要約: ACToRは、リポジトリレベルのコード生成のための適応型クリティカルトークン対応検索フレームワークである。
我々は、ACToRが、リポジトリレベルのベンチマークにおいて、最先端のメソッドを一貫して上回っていることを示す。
- 参考スコア(独自算出の注目度): 53.85136813868056
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The repository-level code generation task requires synthesizing code that satisfies task requirements while remaining consistent with the target repository context. Since real-world repositories often exceed the input length limits of LLMs, existing approaches commonly adopt retrieval-augmented generation (RAG) to provide repository-specific context. Despite improving repository-context retrieval, existing methods typically provide context as task-level support, without explicitly identifying the critical tokens that require fine-grained repository context during generation. During the autoregressive generation process of LLMs, errors often concentrate at a small number of decisive positions: once such tokens are generated incorrectly, subsequent code may follow an incorrect semantic path and eventually lead to functional failure. We refer to these positions as "critical tokens". In this paper, we propose ACToR, an adaptive critical token-aware retrieval framework for repository-level code generation. ACToR identifies critical tokens during generation and triggers targeted retrieval on demand to provide repository context at these decisive positions. In addition, we design a position-aware weighting method for dense retrievers to prioritize context that is more informative for generation. We evaluate ACToR on two representative repository-level benchmarks, RepoExec and CoderEval. Experimental results show that ACToR consistently outperforms state-of-the-art methods, achieving relative improvements of 8.4% on RepoExec and 15.4% on CoderEval. Beyond performance gains, we systematically quantify the impact of critical tokens, revealing their central role in major generation failures and highlighting the necessity of targeted retrieval strategies. We provide the code and data at https://github.com/DeepSoftwareAnalytics/ACToR.
- Abstract(参考訳): リポジトリレベルのコード生成タスクは、対象のリポジトリコンテキストと整合性を維持しながら、タスク要求を満たすコードを合成する必要がある。
実世界のレポジトリはLLMの入力長制限を超えることが多いため、既存のアプローチではレポジトリ固有のコンテキストを提供するために検索拡張生成(RAG)が一般的である。
リポジトリコンテキスト検索の改善にもかかわらず、既存のメソッドは通常、生成時にきめ細かいリポジトリコンテキストを必要とするクリティカルトークンを明示的に特定することなく、タスクレベルのサポートとしてコンテキストを提供する。
LLMの自動回帰生成プロセスでは、エラーは少数の決定的な位置に集中することが多く、そのようなトークンが誤って生成されると、後続のコードは誤ったセマンティックパスを辿り、最終的には機能不全につながる。
これらの位置を「クリティカルトークン」と呼ぶ。
本稿では,リポジトリレベルのコード生成のための適応型クリティカルトークン認識検索フレームワークACToRを提案する。
ACToRは、生成中のクリティカルトークンを特定し、必要に応じてターゲット検索をトリガーし、これらの決定的な位置でリポジトリコンテキストを提供する。
さらに,高密度検索者の位置認識重み付け手法を設計し,生成に有用なコンテキストの優先順位付けを行う。
代表的なリポジトリレベルのベンチマークであるRepoExecとCoderEvalでACToRを評価する。
実験の結果、ACToRは最先端の手法より一貫して優れており、RepoExecでは8.4%、CoderEvalでは15.4%の相対的な改善が達成されている。
性能向上の他に、重要なトークンの影響を体系的に定量化し、主要な世代の失敗における彼らの中心的な役割を明らかにし、対象とする検索戦略の必要性を強調します。
私たちはhttps://github.com/DeepSoftwareAnalytics/ACToRでコードとデータを提供しています。
関連論文リスト
- RepoReasoner: Evaluating Repository-Level Code Reasoning Ability of Long-Context Language Models [54.53236295237077]
リポジトリレベルのコード推論を評価するベンチマークであるRepoReasonerを紹介します。
出力予測は、ファイル間でのきめ細かいステートフルな実行推論を計測します。
Call Chain Predictionは、ノイズの多いコンテキスト下での高レベルのアーキテクチャ依存性の理解を評価する。
論文 参考訳(メタデータ) (2026-07-28T17:12:41Z) - AlignCoder: Aligning Retrieval with Target Intent for Repository-Level Code Completion [55.21541958868449]
リポジトリレベルのコード補完フレームワークであるAlignCoderを提案する。
我々のフレームワークは、初期クエリとターゲットコードのセマンティックギャップを橋渡しする拡張クエリを生成する。
我々は、拡張クエリにおける推論情報を活用してより正確な検索を行うAlignRetrieverのトレーニングに強化学習を採用する。
論文 参考訳(メタデータ) (2026-01-27T15:23:14Z) - RepoScope: Leveraging Call Chain-Aware Multi-View Context for Repository-Level Code Generation [16.544483144957407]
RepoScopeは、リポジトリレベルのコード生成のためのコールチェーン対応のマルチビューコンテキストである。
本稿では,リポジトリの構造的セマンティクスを利用して,対象関数における呼び出し者の識別を改善する新しいコールチェーン予測手法を提案する。
RepoScopeは最先端の手法より優れており、pass@1スコアの36.35%の相対的な改善を達成している。
論文 参考訳(メタデータ) (2025-07-20T02:35:36Z) - CodeRAG-Bench: Can Retrieval Augment Code Generation? [78.37076502395699]
検索拡張生成を用いたコード生成の系統的,大規模な解析を行う。
まず、コード生成タスクの3つのカテゴリを含む総合的な評価ベンチマークであるCodeRAG-Benchをキュレートする。
CodeRAG-Bench上のトップパフォーマンスモデルについて、1つまたは複数のソースから検索したコンテキストを提供することにより検討する。
論文 参考訳(メタデータ) (2024-06-20T16:59:52Z) - On the Impacts of Contexts on Repository-Level Code Generation [5.641402231731082]
本稿ではレポジトリレベルのコード生成を評価するために設計された新しいベンチマークであるRepoExecを紹介する。
実行可能性、包括的なテストケース生成による機能的正当性、ファイル間のコンテキストの正確な利用という3つの重要な側面に注目します。
論文 参考訳(メタデータ) (2024-06-17T10:45:22Z) - On The Importance of Reasoning for Context Retrieval in Repository-Level Code Editing [82.96523584351314]
我々は、コンテキスト検索のタスクをリポジトリレベルのコード編集パイプラインの他のコンポーネントと分離する。
我々は、推論が収集された文脈の精度を向上させるのに役立っているが、それでもその十分性を識別する能力は欠如していると結論づける。
論文 参考訳(メタデータ) (2024-06-06T19:44:17Z) - Repoformer: Selective Retrieval for Repository-Level Code Completion [30.706277772743615]
検索強化生成(RAG)の最近の進歩は、リポジトリレベルのコード補完の新たな時代が始まった。
本稿では,不要な場合の検索を回避するため,選択的なRAGフレームワークを提案する。
我々のフレームワークは、異なる世代モデル、レトリバー、プログラミング言語に対応できることを示します。
論文 参考訳(メタデータ) (2024-03-15T06:59:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。