論文の概要: RepoReasoner: Evaluating Repository-Level Code Reasoning Ability of Long-Context Language Models
- arxiv url: http://arxiv.org/abs/2607.25996v1
- Date: Tue, 28 Jul 2026 17:12:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.945236
- Title: RepoReasoner: Evaluating Repository-Level Code Reasoning Ability of Long-Context Language Models
- Title(参考訳): RepoReasoner: 長期言語モデルのリポジトリレベルコード推論能力の評価
- Authors: Yanlin Wang, Suiquan Wang, Yanli Wang, Bowen Zhang, Daya Guo, Jiachi Chen, Zibin Zheng,
- Abstract要約: リポジトリレベルのコード推論を評価するベンチマークであるRepoReasonerを紹介します。
出力予測は、ファイル間でのきめ細かいステートフルな実行推論を計測します。
Call Chain Predictionは、ノイズの多いコンテキスト下での高レベルのアーキテクチャ依存性の理解を評価する。
- 参考スコア(独自算出の注目度): 54.53236295237077
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent large language models (LLMs) have shown strong performance on software engineering tasks, yet most existing benchmarks evaluate code reasoning at the function level, where all relevant information is localized. This setting fails to reflect real-world development, which requires reasoning across multiple files and complex dependency structures. We introduce RepoReasoner, a benchmark for evaluating repository-level code reasoning. It assesses two complementary abilities: Output Prediction, which measures fine-grained, stateful execution reasoning across files, and Call Chain Prediction, which evaluates high-level architectural dependency understanding under noisy context. Our benchmark is constructed through a multi-stage pipeline that leverages dynamic tracing of pytest executions to obtain ground-truth call chains, along with LLM-based I/O rewriting to reduce memorization effects. We evaluate seven state-of-the-art LLMs. Even under oracle context, the best-performing model achieves only 69.1% Pass@1 on Output Prediction, indicating that cross-file reasoning remains a major challenge. In Call Chain Prediction, models exhibit high precision but low recall, suggesting limited multi-hop dependency understanding. Furthermore, performance drops on rewritten data reveal partial reliance on memorization, and longer contexts do not consistently improve results due to noise. These findings highlight fundamental limitations in current LLMs' repository-level reasoning and motivate future work on structured architectural understanding and cross-file inference.
- Abstract(参考訳): 最近の大規模言語モデル(LLM)は、ソフトウェア工学のタスクにおいて強力なパフォーマンスを示しているが、既存のベンチマークでは、すべての関連する情報がローカライズされる関数レベルでコード推論を評価している。
この設定は、複数のファイルにまたがる推論と複雑な依存関係構造を必要とする現実世界の開発を反映しない。
リポジトリレベルのコード推論を評価するベンチマークであるRepoReasonerを紹介します。
ファイル間できめ細かなステートフルな実行推論を計測する出力予測と、ノイズの多いコンテキスト下で高いレベルのアーキテクチャ依存理解を評価するコールチェーン予測という2つの補完的な能力を評価する。
我々のベンチマークは、ピテスト実行の動的トレースを利用したマルチステージパイプラインを用いて構築され、LLMベースのI/O書き換えとともに、暗記効果の低減を図る。
我々は7つの最先端LCMを評価した。
オラクルのコンテキスト下でさえ、最高のパフォーマンスモデルは出力予測において69.1%のPass@1しか達成していない。
Call Chain Predictionでは、モデルは高精度だが低いリコールを示し、マルチホップ依存性の理解が制限されていることを示唆している。
さらに、書き直したデータに対する性能低下により、暗記への部分的依存が明らかとなり、より長いコンテキストではノイズによる結果が一貫して改善されない。
これらの知見は、現在のLLMのリポジトリレベルの推論における基本的な制限を強調し、構造化アーキテクチャ理解とクロスファイル推論に関する将来の研究を動機付けている。
関連論文リスト
- METER: Evaluating Multi-Level Contextual Causal Reasoning in Large Language Models [61.33372454250959]
コンテキスト因果推論は、大規模言語モデルにとって重要なが難しい能力である。
既存のベンチマークでは、コンテキスト整合性を保証するか、完全な因果階層をカバーすることができない。
私たちはMETERの先駆者であり、因果はしごの3つのレベルすべてにわたってLSMを体系的にベンチマークしました。
論文 参考訳(メタデータ) (2026-04-13T14:07:11Z) - Beyond Code Snippets: Benchmarking LLMs on Repository-Level Question Answering [4.120344028676837]
大規模言語モデル(LLM)は、質問応答(QA)を含む、ソフトウェアエンジニアリングタスク全体で印象的な機能を示している。
StackRepoQAは、134のオープンソースJavaプロジェクト間で、1,318の実際の開発者質問と受け入れられた回答から構築された、最初のマルチプロジェクト、リポジトリレベルの質問応答データセットです。
論文 参考訳(メタデータ) (2026-03-27T16:30:54Z) - Understanding by Reconstruction: Reversing the Software Development Process for LLM Pretraining [66.89012795621349]
大規模言語モデル(LLM)は、複雑なソフトウェア工学に必要な、深く、長期にわたる推論に苦しむことが多い。
本稿では,再構築による理解という,新しいパラダイムを提案する。
マルチエージェントシミュレーションを用いて潜在エージェント軌道を合成するフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-11T09:23:20Z) - A Scalable Benchmark for Repository-Oriented Long-Horizon Conversational Context Management [15.052977169932054]
大規模言語モデル(LLM)は急速に進歩し、コード理解と生成能力を大幅に強化した。
しかし、過度に長期にわたる会話のコンテキストがモデルに圧倒され、重要な情報が失われ、性能が低下する可能性がある。
LoCoEvalは、リポジトリ指向の開発シナリオに合わせた、最初の長期会話コンテキスト管理ベンチマークです。
論文 参考訳(メタデータ) (2026-03-06T15:09:40Z) - DiffuRank: Effective Document Reranking with Diffusion Language Models [71.16830004674513]
拡散言語モデル(dLLM)に基づいて構築されたフレームワークであるDiffuRankを提案する。
dLLMは、左から右への順序に制約されないより柔軟なデコーディングと生成プロセスをサポートする。
モデルサイズが類似した自己回帰LDMに匹敵する性能を示す。
論文 参考訳(メタデータ) (2026-02-13T02:18:14Z) - CoRe: Benchmarking LLMs Code Reasoning Capabilities through Static Analysis Tasks [14.408364047538578]
大規模言語モデル(LLM)は、ソフトウェア工学の様々な領域で広く採用されている。
この研究は、基本的な静的解析タスク上でのLCMを評価するために設計されたベンチマークであるCOREを提示する。
論文 参考訳(メタデータ) (2025-07-03T01:35:58Z) - StoryBench: A Dynamic Benchmark for Evaluating Long-Term Memory with Multi Turns [7.60350050736492]
長期記憶は、自律的な知性を達成するために、大規模言語モデルにとって不可欠である。
既存のベンチマークでは、知識保持と動的シーケンシャル推論を評価する上で、課題に直面している。
インタラクティブなフィクションゲームに基づく新しいベンチマークフレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-16T10:54:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。