論文の概要: Cost-Effective Repository Exploration for Agentic Issue Localization
- arxiv url: http://arxiv.org/abs/2608.29675v1
- Date: Sun, 30 Aug 2026 09:16:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.042807
- Title: Cost-Effective Repository Exploration for Agentic Issue Localization
- Title(参考訳): エージェント・イシュー・ローカライゼーションのための費用効果レポジトリ探索
- Abstract要約: 我々は、この段階を低価格モデルに委譲できるかどうか検討する。
我々は、早期の候補発見、トップ3のゴールドファイルカバレッジ、厳格なファイルセット回復、エージェント時間、トークン使用率を測定する。
高品質なエクスプローラーは、ローカライゼーションの指標を越えてリードするが、かなり安い運用ポイントが出現する。
- 参考スコア(独自算出の注目度): 0.2715382584771446
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Repository exploration is a distinct and costly stage of coding-agent pipelines: before generating a patch, an agent must identify which repository files are likely to matter. We study whether this stage can be delegated to lower-cost models while retaining useful localization quality. Using our IssueLoc-Bench, we evaluate five explorer models under the same read-only interactive interface on 499 SWE-bench Verified-derived tasks and 500 tasks from 153 additional repositories. We measure early candidate discovery, top-three gold-file coverage, strict file-set recovery, agent time, and token usage, with paired instance-level uncertainty and repository-clustered sensitivity analysis. The highest-quality explorer leads across localization metrics, but substantially cheaper operating points emerge: depending on the model and evaluation arm, lower-cost explorers retain approximately 78-94% of the reference Hit@3 and 73-92% of its F1 while reducing mean agent time by 41-88% and token usage by 84-95%. The preferred operating point depends on how localization is consumed downstream: ranking and coverage metrics characterize recoverable candidate handoffs, whereas F1 and exact match characterize restrictive file gates. These results support treating repository exploration as an independently measurable and budgetable stage of modular coding agents, with explorer selection guided by the downstream handoff contract.
- Abstract(参考訳): パッチを生成する前に、エージェントはどのリポジトリファイルが重要かを特定する必要がある。
我々は,この段階をローコストモデルに委譲できるかどうか検討し,ローカライゼーションの質を保ちながら検討した。
IssueLoc-Benchを用いて、499 SWE-benchの検証タスクと153の追加リポジトリの500タスクに対して、同じ読み取り専用インタラクティブインターフェースで5つのエクスプローラーモデルを評価する。
初期候補発見,上位3つのゴールドファイルカバレッジ,厳格なファイルセット回復,エージェント時間,トークン使用率を,ペア化されたインスタンスレベルの不確実性とリポジトリクラスタ化感度分析を用いて測定した。
モデルと評価アームによって、低価格の探検家は参照Hit@3の約78-94%とF1の73-92%を保持し、平均エージェント時間を41-88%削減し、トークン使用量を84-95%削減している。
ランク付けとカバレッジのメトリクスは復元可能な候補のハンドオフを特徴付けるが、F1と正確なマッチは制限のあるファイルゲートを特徴付ける。
これらの結果は、下流ハンドオフ契約によるエクスプローラーの選択により、モジュールコーディングエージェントの独立して測定可能かつ予算可能な段階としてのリポジトリ探索の処理を支援する。
関連論文リスト
- GoAnt: Quality-Diversity Multi-Agent Search for Alpha Factor Discovery in Market Microstructure Data [0.0]
GoAntは品質の多様性のあるマルチエージェント検索フレームワークで、Explorer、Explorer、Connectorのワーカと、共有適応メンタルマップとコンパクトなクイーンディスパッチを組み合わせている。
GoAntは価格と注文書の設定で41.8と47.6の高収率に達し、一致した予算の下で最強のベースラインを57%、97%改善した。
論文 参考訳(メタデータ) (2026-09-08T13:19:18Z) - The Thousand-Graph Hypothesis: A Testable Hypothesis of Task-Conditioned Relation Materialization in Repository-Level Code Reasoning [2.7787094635105185]
モデルに対するリポジトリの知識のトレーニングは費用がかかり、すぐに停滞するが、ローカル検索は散在する要求を見逃す可能性がある。
推論中にタスク条件付き関係を実体化するエンティティのみの外部インタフェースを提案する。
論文 参考訳(メタデータ) (2026-08-27T04:33:48Z) - From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents [75.69180947909148]
大規模言語モデル(LLM)エージェントのためのトラジェクトリレベルのUQフレームワークを提案する。
RuPAは、推論状態、ツールインタラクション、環境フィードバックが時間的およびセマンティックな依存関係エッジで接続されたノードである、指向的なトラジェクトリグラフとして実行履歴を表現している。
我々は,複数のモデルファミリにまたがる6つのオープンソースLCMを用いて,代用エージェントベンチマーク($2, Terminal-Bench-2, GAIA)でRUPAを評価した。
論文 参考訳(メタデータ) (2026-08-17T01:40:14Z) - A-SR: Self-Evolving Agentic LLMs for Symbolic Regression via Hierarchical Coordination [51.06539604709775]
本稿では、制御ユニットを表現編集からロール条件のエビデンスビューへシフトさせる自己進化型エージェントフレームワークであるA-SRを提案する。
A-SRは、コーディネートプロトコル、オンライン評価器・リワードロールポリシー、および状態制御プロセスメモリ間のルーティングによる公式発見をコーディネートする。
論文 参考訳(メタデータ) (2026-08-05T14:01:10Z) - DREA: Decoupled Reasoning and Exploration Agents for Repository-Level Vulnerability Detection [16.007199928732614]
DREAはリポジトリレベルの脆弱性検出のための仮説駆動型フレームワークである。
ゴール指向コンテキスト取得は、この設計における検出改善の主な原因である。
RepoPairBenchは,実世界のプロジェクトから検証済みのPython脆弱性修正ペアの,リポジトリを基盤としたベンチマークである。
論文 参考訳(メタデータ) (2026-07-15T04:49:05Z) - SingGuard-NSFA: Extensible Guardrails for Agentic AI via Generative Reasoning and Real-Time Classification [0.0]
nsfaguardは、エージェントAIシステムを運用上の脅威から保護するためのガードレールフレームワークである。
まず,185種のリスク変異をCIA-Triad-grounded 階層に分類するNSFA分類について紹介する。
凍結したバックボーン上の識別的分類ヘッドと解釈可能なオフライン監査のためのSFTに基づく生成推論を組み合わせたデュアルモードアプローチを開発した。
論文 参考訳(メタデータ) (2026-07-13T07:28:45Z) - PACE: A Proxy for Agentic Capability Evaluation [60.3743414796937]
PACEは、既存の非エージェント評価からインスタンスを選択することで、プロキシベンチマークを構築するフレームワークである。
14のモデル、4つのエージェントベンチマーク、19の非エージェントベンチマークによる実験では、PACE-Benchがエージェントスコアを予測し、LOOCVは絶対誤差(MAE)を4%以下、スピアマン相関は0.80以上、ペアワイズモデルの精度は85%で、いずれもエージェント評価コストの1%以下である。
論文 参考訳(メタデータ) (2026-07-02T10:59:03Z) - Persistent AI Agents in Academic Research: A Single-Investigator Implementation Case Study [0.0]
分析の単位は、研究者、エージェント、メモリ層、ツール、リポジトリ、スケジュールされたジョブ、特殊なエージェントロール、ガバナンスルールといった、永続的なヒューマンエージェント環境であった。
2026年5月、厳格なトラジェクトリ・サブセットが627のモデル関連イベントと7395万のトークンをキャプチャし、そのうち82.9%がキャッシュ読み取りだった。
論文 参考訳(メタデータ) (2026-05-26T11:28:36Z) - RepoMirage: Probing Repository Context Reasoning in Code Agents with Perturbations [51.43574078961796]
本稿では,SWE-Bench Verified上に構築された2段階評価スイートRepoMirageを紹介する。
RepoMirage-Perturbは、リポジトリレベルの摂動を保存する3つのタイプのセマンティクスを適用している。
RepoAnchorは、下流の問題解決からリポジトリの探索を分離する構造第一のプロトタイプワークフローである。
論文 参考訳(メタデータ) (2026-05-25T06:26:43Z) - ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - AgenticRAG: Agentic Retrieval for Enterprise Knowledge Bases [0.7176906280023592]
本稿では,企業知識ベース上での検索と分析のためのエージェントハーネスであるAgenticRAGを提案する。
我々のアプローチは、既存のエンタープライズ検索インフラの上に軽量なハーネスを積み重ねることで、この過度さを軽減します。
本研究は,実環境における実運用環境への適合性を示すものである。
論文 参考訳(メタデータ) (2026-05-07T00:39:22Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。