論文の概要: Agent Retrieval Bench: Evaluating Repository Context Retrieval for Coding Agents
- arxiv url: http://arxiv.org/abs/2607.24882v1
- Date: Mon, 27 Jul 2026 09:39:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.56857
- Title: Agent Retrieval Bench: Evaluating Repository Context Retrieval for Coding Agents
- Title(参考訳): エージェント検索ベンチ:コーディングエージェントのリポジトリコンテキスト検索の評価
- Abstract要約: Agent Retrieval Benchはこの上流検索問題のファイルレベルベンチマークである。
ベンチマークでは、code2test、 comment2context、 trace2code、Edit2rippleの4つの肯定的なタスクがカバーされている。
コーパスには308のベースコミットスナップショット、392,000ファイル、7.9百万チャンクが含まれている。
- 参考スコア(独自算出の注目度): 8.81342573156581
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern coding agents are usually evaluated by whether they eventually produce a correct patch, but patch generation depends on an earlier context-acquisition stage: finding the repository files needed for the task. We introduce Agent Retrieval Bench, a file-level benchmark for this upstream retrieval problem. Samples are built from real coding-workflow signals and evaluated against frozen base-commit repositories, with relevance defined by what an agent needs next rather than direct query-file semantic similarity. The benchmark covers four positive-retrieval tasks: code2test, comment2context, trace2code, and edit2ripple; a fifth subset evaluates selective retrieval using natural evidence-backed no-gold cases and counterfactual wrong-repository controls. Agent Retrieval Bench contains 427 samples across 25 repositories: 345 positive examples, 50 natural no-gold examples, and 32 counterfactual controls. The corpus includes 308 base-commit snapshots, 392,000 files, and 7.9 million chunks. We evaluate lexical retrieval, RepoMap, open-source embeddings, selective abstention, and logged agent context selection. No single retrieval family dominates: Qwen3-Embedding-4B has the best sample-weighted MRR on positive samples, Qwen3-Embedding-8B the best Recall@20, and RepoMap the best budgeted context yield at 8K tokens, with task-level winners differing substantially. Selective thresholds calibrated with counterfactual controls do not improve selective success on natural no-gold cases, revealing a calibration gap. Logged trajectories also miss every gold file on 27-35 percent of samples. A controlled seed-intervention pilot finds that retrieval-derived initial context yields higher file F1 with less post-seed exploration than random non-gold context, while oracle gold context shows substantial remaining headroom.
- Abstract(参考訳): 現代のコーディングエージェントは通常、最終的に正しいパッチを生成するかどうかによって評価されるが、パッチ生成は以前のコンテキスト獲得段階(タスクに必要なリポジトリファイルを見つける)に依存する。
本稿では,この上流検索問題に対するファイルレベルのベンチマークであるAgent Retrieval Benchを紹介する。
サンプルは実際のコーディングワークフロー信号から構築され、フリーズされたベースコミットリポジトリに対して評価される。
code2test, comment2context, trace2code, edit2rippleの4つの肯定的なタスクをカバーする。
Agent Retrieval Benchには25のリポジトリにわたる427のサンプルが含まれている。
コーパスには308のベースコミットスナップショット、392,000ファイル、7.9百万チャンクが含まれている。
我々は、語彙検索、RepoMap、オープンソースの埋め込み、選択的禁忌、ログ化されたエージェントコンテキスト選択を評価した。
Qwen3-Embedding-4Bは正のサンプル上で最高のサンプル重み付きMRRを持ち、Qwen3-Embedding-8BはRecall@20、RepoMapは8Kトークンで最高の予算付きコンテキスト収率を持ち、タスクレベルの勝者は大幅に異なる。
対物制御で調整された選択閾値は、自然の無金症例の選択的成功を改善せず、校正ギャップが明らかになる。
記録された軌跡は、サンプルの27~35%ですべての金のファイルを見逃している。
制御されたシード・インターベンション・パイロットは、検索から派生した初期コンテキストが、ランダムな非ゴールドのコンテキストよりもポストシードの探索が少ない高いファイルF1を生成するのに対して、オラクルゴールドのコンテキストは、かなり残っている。
関連論文リスト
- Codebook Agent: Amortized Topology Design for LLM Multi-Agent Systems [67.04448659688579]
クエリ非依存の16エントリのコードブックを開発し、上位のデコード候補を1回のバッチフォワードパスでランク付けする。
反復検索がなく、テスト時にメッセージパッシングがないため、Codebook Agentは6つのベンチマークでもっとも正確な方法である。
論文 参考訳(メタデータ) (2026-09-02T08:10:22Z) - Adaptive Critical Token-Aware Retrieval for Repository-Level Code Generation [53.85136813868056]
ACToRは、リポジトリレベルのコード生成のための適応型クリティカルトークン対応検索フレームワークである。
我々は、ACToRが、リポジトリレベルのベンチマークにおいて、最先端のメソッドを一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-09-01T17:59:39Z) - Cost-Effective Repository Exploration for Agentic Issue Localization [0.2715382584771446]
我々は、この段階を低価格モデルに委譲できるかどうか検討する。
我々は、早期の候補発見、トップ3のゴールドファイルカバレッジ、厳格なファイルセット回復、エージェント時間、トークン使用率を測定する。
高品質なエクスプローラーは、ローカライゼーションの指標を越えてリードするが、かなり安い運用ポイントが出現する。
論文 参考訳(メタデータ) (2026-08-30T09:16:33Z) - Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents [60.650808962786364]
外部判断や選択時間テストの実行なしに,ネイティブなMoEルータトレースがステアリングと選択をガイドできるかどうかを検討する。
我々の分析は、ルーティングが堅牢な行動的役割シグナルを提供することを示している。トークン・グラニュラ・リードアウトと決定整合比較セットは、ルーティングを効果的に制御する。
オープンウェイトスパースMOEエージェントを用いたSWEベンチ検証を行い,評価を行った。
論文 参考訳(メタデータ) (2026-08-23T03:07:03Z) - Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction [57.138342889101345]
Tencent WorkBuddy Benchは、コーディングエージェントのためのマルチドメイン評価スイートである。
本報告では, 設計手法, スコアリングプロトコル, クロスモデルリーダーボードについて述べる。
論文 参考訳(メタデータ) (2026-07-23T04:34:06Z) - Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence [56.25095230687242]
コーディングエージェントは、しばしば自身のローカル検証ルーチンを過度に信頼し、表面チェックを満たすアーティファクトの成功を宣言する。
この問題は、事前評価が結果駆動である変換において特に深刻である。
ブラインド・コンバージョンは26.7-28.9%に達し、スペック・パスレートは91.1%まで上昇した。
このことは、失敗は限られた予算やバックボーンの強さよりも、契約ミスによる自己検証に起因していることを示唆している。
論文 参考訳(メタデータ) (2026-05-27T19:57:15Z) - Skill-as-Pseudocode: Refactoring Skill Libraries to Pseudocode for LLM Agents [50.78646963535282]
Skill-as-Pseudocode (SaP) はマークダウンスキルライブラリの型付き擬似コードへの自動変換である。
1つ以上のスキルから引き出された類似の手続きパスのクラスタごとに、SaPは型付きコントラクトを抽出し、それを4チェック決定性検証器を通じてフィルタリングする。
プロモートされた契約は、復元された具体的なアクションテンプレートと共に書き直されたスキルスケルトンにインライン化され、エージェントは2つの補完的な信号を与える。
論文 参考訳(メタデータ) (2026-05-27T04:48:40Z) - RepoMirage: Probing Repository Context Reasoning in Code Agents with Perturbations [51.43574078961796]
本稿では,SWE-Bench Verified上に構築された2段階評価スイートRepoMirageを紹介する。
RepoMirage-Perturbは、リポジトリレベルの摂動を保存する3つのタイプのセマンティクスを適用している。
RepoAnchorは、下流の問題解決からリポジトリの探索を分離する構造第一のプロトタイプワークフローである。
論文 参考訳(メタデータ) (2026-05-25T06:26:43Z) - EvoCode-Bench: Evaluating Coding Agents in Multi-Turn Iterative Interactions [9.297494684604763]
EvoCode-Benchは26のステートフルコーディングタスクと227のラウンドのベンチマークである。
各タスクはエージェントのワークスペースを5~15ラウンド保存し、観測可能な振る舞いを通じて要求を記述する。
MT@4は4段階のフェールストップマルチラウンドスコアであり、SRは参照完了前の状態からのシングルラウンドスコアである。
論文 参考訳(メタデータ) (2026-05-22T18:17:28Z) - When Retrieval Hurts Code Completion: A Diagnostic Study of Stale Repository Context [4.235809074981841]
Retrievalの拡張されたコード生成は、クロスファイルリポジトリのコンテキストに依存するが、検索されたスニペットは、時代遅れのプロジェクト状態から来る可能性がある。
時間的に古いリポジトリスニペットが無害なノイズとして振る舞うか、あるいは現在非互換なコードを積極的に誘導するかを検討する。
論文 参考訳(メタデータ) (2026-05-14T07:18:30Z) - A Benchmark for Evaluating Repository-Level Code Agents with Intermediate Reasoning on Feature Addition Task [11.218318079376365]
RACE-benchは、機能追加タスクでコードエージェントを評価するための推論強化ベンチマークである。
RACE-benchには、12のオープンソースリポジトリから528の現実世界の機能追加インスタンスが含まれている。
RACE-bench上での3つのリポジトリレベルのコードエージェントの評価を行った。
論文 参考訳(メタデータ) (2026-03-27T11:58:47Z) - SpatialBench-UC: Uncertainty-Aware Evaluation of Spatial Prompt Following in Text-to-Image Generation [0.0]
SpaceBench-UCは、ペアの空間関係を再現可能な小さなベンチマークである。
ベンチマークパッケージ、バージョン付きプロンプト、ピン付き構成、サンプルごとのチェッカー出力、レポートテーブルをリリースします。
安定拡散1.5, SD 1.5 BoxDiff, SD 1.4 GLIGENの3つのベースラインについて検討した。
論文 参考訳(メタデータ) (2026-01-19T23:37:10Z) - Agentic Rubrics as Contextual Verifiers for SWE Agents [8.469998524915818]
本稿では,エージェントルーブリックがSWEエージェントに対して,効率的でスケーラブルで粒度の高い検証信号を提供することを示す。
結果から,Agenic rubricsは接地トルーステストと整合性を示し,テストが捉えない問題をフラグ付けする。
論文 参考訳(メタデータ) (2026-01-07T18:38:23Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification [71.34070740261072]
本稿では,テストケースの生成と完成におけるモデルの能力を評価するためのベンチマークCLOVERを提案する。
ベンチマークはタスク間でのコード実行のためにコンテナ化されています。
論文 参考訳(メタデータ) (2025-02-12T21:42:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。