論文の概要: RepoProbe: Benchmarking Architecture-Aware Repository Comprehension with Checklists
- arxiv url: http://arxiv.org/abs/2608.04783v1
- Date: Wed, 05 Aug 2026 12:49:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.928012
- Title: RepoProbe: Benchmarking Architecture-Aware Repository Comprehension with Checklists
- Title(参考訳): RepoProbe: チェックリストによるアーキテクチャ対応リポジトリ理解のベンチマーク
- Authors: Yuexi Yang, Alyssa Wu, Ji Luo, Richeng Xuan, Zhichao Hu, Yuhong Liu, Zhen Qin,
- Abstract要約: RepoProbeは、リポジトリレベルのコード理解を評価するための新しいベンチマークである。
本稿では,回答をアトミックで検証可能な事実に分解するチェックリストベースの検証プロトコルを提案する。
- 参考スコア(独自算出の注目度): 12.810164698494281
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The integration of Large Language Models (LLMs) into software engineering has shifted the focus from function-level generation to repository-scale assistance. However, existing benchmarks largely rely on bug reports from GitHub Issues, which often allow models to bypass genuine understanding via pattern matching on error logs. This misalignment under-measures Edit Bias, which refers to premature generation, where models prematurely propose code modifications instead of understanding the existing repository architecture. Furthermore, current LLM-as-a-Judge scalar scoring suffers from high variance and low interpretability. This work introduces RepoProbe, a novel benchmark for evaluating repository-level code understanding through open-ended Q&A using GitHub Discussions, which focuses on open-ended architectural inquiries rather than defect reporting. To ensure rigorous evaluation, we propose a Checklist-Based Verification Protocol that decomposes answers into atomic, verifiable facts, thereby replacing subjective ratings with objective verification. Our evaluation of state-of-the-art (SOTA) LLMs reveals a persistent gap between high clarity and evidencegrounded technical correctness. It also quantitatively confirms the prevalence of edit bias, in which models prioritize code generation instead of architectural analysis. Finally, we demonstrate that our verification protocol significantly improves evaluation reliability compared to traditional evaluations with scalar scoring.
- Abstract(参考訳): ソフトウェア工学へのLLM(Large Language Models)の統合は、関数レベルの生成からリポジトリスケールのアシストへと焦点を移した。
しかし、既存のベンチマークはGitHub Issuesのバグレポートに大きく依存しているため、モデルがエラーログのパターンマッチングを通じて真に理解することを回避できることが多い。
モデルでは、既存のリポジトリアーキテクチャを理解する代わりに、早めにコード修正を提案する。
さらに, 現在のLCM-as-a-Judgeスカラースコアリングは, 高いばらつきと低い解釈性に悩まされている。
この記事では、GitHub Discussionsを使用して、リポジトリレベルのコード理解を評価するための新しいベンチマークであるRepoProbeを紹介した。
厳密な評価を確保するために,回答をアトミックで検証可能な事実に分解し,主観的評価を客観的な検証に置き換えるチェックリストベースの検証プロトコルを提案する。
現状のSOTA (State-of-the-art) LLM) の評価は, 高明度と実証的技術的正当性の間に持続的なギャップがあることを明らかにする。
また、モデルがアーキテクチャ分析ではなくコード生成を優先する編集バイアスの頻度を定量的に確認する。
最後に,スカラースコアリングによる従来の評価と比較して,検証プロトコルが評価信頼性を著しく向上することを示す。
関連論文リスト
- RepoReasoner: Evaluating Repository-Level Code Reasoning Ability of Long-Context Language Models [54.53236295237077]
リポジトリレベルのコード推論を評価するベンチマークであるRepoReasonerを紹介します。
出力予測は、ファイル間でのきめ細かいステートフルな実行推論を計測します。
Call Chain Predictionは、ノイズの多いコンテキスト下での高レベルのアーキテクチャ依存性の理解を評価する。
論文 参考訳(メタデータ) (2026-07-28T17:12:41Z) - RepoZero: Can LLMs Generate a Code Repository from Scratch? [13.87780777614509]
RepoZeroは、完全に自動化された実行ベースのレポジトリレベルの生成をスクラッチから検証できる最初のベンチマークである。
我々の結果は、RepoZeroをエンドツーエンドのコード生成のための、困難でスケーラブルで信頼性の高いテストベッドとして確立しています。
論文 参考訳(メタデータ) (2026-05-08T01:56:02Z) - DocSync: Agentic Documentation Maintenance via Critic-Guided Reflexion [0.0]
DocSyncは、ドキュメントのメンテナンスを構造的に基盤付けられた反復的な生成タスクとしてフレーム化するエージェントワークフローである。
LoRA適応小言語モデルを用いたDocSyncの資源制約実装を実証的に評価する。
このAST対応エージェントアプローチが標準エンコーダ・デコーダのベースラインを大幅に上回ることを示す。
論文 参考訳(メタデータ) (2026-05-04T02:41:33Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - RepoReviewer: A Local-First Multi-Agent Architecture for Repository-Level Code Review [3.272585676511349]
RepoReviewerは、GitHubリポジトリの自動レビューのためのローカルファーストのマルチエージェントシステムである。
我々は、Python CLI、FastAPI API、LangGraphオーケストレーション層、Next.jsユーザインターフェースを備えたRepoReviewerを提示する。
論文 参考訳(メタデータ) (2026-03-17T04:17:51Z) - GREPO: A Benchmark for Graph Neural Networks on Repository-Level Bug Localization [50.009407518866965]
リポジトリレベルのバグローカライゼーションは、ソフトウェアエンジニアリングの重要な課題です。
GNNは、複雑なリポジトリ全体の依存関係をモデル化できるため、有望な代替手段を提供する。
GREPOは、リポジトリスケールのバグローカライゼーションタスクのための最初のGNNベンチマークである。
論文 参考訳(メタデータ) (2026-02-14T23:22:15Z) - EdiVal-Agent: An Object-Centric Framework for Automated, Fine-Grained Evaluation of Multi-Turn Editing [170.71134330650796]
EdiVal-Agentは、命令ベースの画像編集のためのオブジェクト指向評価フレームワークである。
標準のシングルターンだけでなく、マルチターンの命令ベースの編集を精度良く評価するように設計されている。
EdiVal-Benchは、インコンテキスト、フローマッチング、拡散パラダイムにまたがる9つの命令タイプと13の最先端編集モデルをカバーするベンチマークである。
論文 参考訳(メタデータ) (2025-09-16T17:45:39Z) - Probing Pre-trained Language Models on Code Changes: Insights from ReDef, a High-Confidence Just-in-Time Defect Prediction Dataset [0.0]
本稿では,22の大規模C/C++プロジェクトから得られた関数レベル修正の信頼性の高いベンチマークであるReDefを紹介する。
欠陥ケースはコミットの反転によって固定され、クリーンケースはポストホック履歴チェックによって検証される。
このパイプラインは3,164の欠陥と10,268のクリーンな修正をもたらし、既存のリソースよりも信頼性の高いラベルを提供する。
論文 参考訳(メタデータ) (2025-09-11T07:07:11Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - End-to-End Object Detection with Transformers [88.06357745922716]
本稿では,オブジェクト検出を直接セット予測問題とみなす新しい手法を提案する。
我々のアプローチは検出パイプラインを合理化し、手作業で設計された多くのコンポーネントの必要性を効果的に除去する。
この新しいフレームワークの主な構成要素は、Detection TRansformerまたはDETRと呼ばれ、セットベースのグローバルな損失である。
論文 参考訳(メタデータ) (2020-05-26T17:06:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。