論文の概要: IssueExec: A Test-Driven Approach for Localizing Software Engineering Issues
- arxiv url: http://arxiv.org/abs/2607.17286v1
- Date: Sun, 19 Jul 2026 15:08:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.419537
- Title: IssueExec: A Test-Driven Approach for Localizing Software Engineering Issues
- Title(参考訳): IssueExec: ソフトウェアエンジニアリングの問題をローカライズするためのテスト駆動アプローチ
- Abstract要約: 本稿では,課題記述とテスト表現のセマンティックなギャップを埋めるため,IssueExecを提案する。
IssueExecは最先端のパフォーマンスを実現し、最強のベースラインに対して関数レベルのRecall@1を41.57%改善した。
- 参考スコア(独自算出の注目度): 31.053977727885762
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Issue localization, which identifies code locations requiring modification from issue descriptions, is a critical step in automated software maintenance. Existing approaches predominantly attempt to directly align issue descriptions with code elements, yet often struggle due to the inherent abstraction gap between the issue description and code implementation. Seeking alternative signals, our theoretical analysis suggests that test suites can serve as executable proxies for requirements, reducing localization uncertainty by 7.73 bits of entropy on average. A large-scale empirical study on 18 repositories validates this premise: existing tests cover 96.98\% of ground-truth files, and the two-hop pathway yields stronger semantic connectivity than direct matching in 82.4\% of cases. Despite their potential, leveraging tests for localization faces two key challenges: the semantic gap separating issue descriptions from test identifiers, and the substantial noise in execution traces from infrastructure code. To address these, we propose IssueExec, which bridges the semantic gap through domain-knowledge-enhanced test representations and filters noise via hierarchical trace analysis. Experiments on SWE-bench Lite show that IssueExec achieves state-of-the-art performance, improving function-level Recall@1 by 41.57\% over the strongest baseline. When integrated into the Agentless pipeline, IssueExec resolves 17.72\% more issues, demonstrating practical downstream benefits.
- Abstract(参考訳): 問題ローカライゼーション(イシューローカライゼーション)は、イシュー記述から修正を必要とするコードの位置を特定するもので、自動ソフトウェアのメンテナンスにおいて重要なステップである。
既存のアプローチは主に、イシュー記述とコード要素を直接整合させようとするが、イシュー記述とコード実装の間に固有の抽象的なギャップがあるため、しばしば苦労する。
代替信号を求めると,テストスイートが要求に対する実行可能なプロキシとして機能し,平均7.73ビットのエントロピーによる局所化の不確実性を低減することが理論的に示唆された。
18のリポジトリに関する大規模な実証的研究は、この前提を実証している: 既存のテストでは、96.98 %のグランドトルースファイルをカバーしており、2ホップ経路は、82.4 %のケースで直接マッチングよりも強いセマンティック接続をもたらす。
その可能性にもかかわらず、ローカライゼーションのためにテストを活用するには、セマンティックギャップがテスト識別子からイシュー記述を分離し、インフラストラクチャコードから実行トレースが大幅にノイズになる、という2つの大きな課題に直面します。
そこで本研究では,ドメイン知識を付加したテスト表現を通じてセマンティックギャップをブリッジし,階層的トレース解析によりノイズをフィルタするIssueExecを提案する。
SWE-bench Liteの実験によると、IssueExecは最先端のパフォーマンスを実現し、最強のベースラインに対して関数レベルのRecall@1を41.57\%改善している。
Agentlessパイプラインに統合されると、IssueExecは17.72\%以上の問題を解決し、実用的なダウンストリームのメリットを実証する。
関連論文リスト
- RESTOR: Automated Test Oracle Generation for RESTful APIs via Reinforcement Learning [21.927343858709122]
Restorは、ブラックボックスの設定で単一のリクエスト-レスポンスペアから実行可能なテストアサーションを生成するフレームワークである。
実世界の246のサービスにまたがる2,300以上のAPIトレースからなる産業データセット上でRestorを評価する。
論文 参考訳(メタデータ) (2026-07-27T03:20:28Z) - Ethereum NFT Smart Contracts: Knowledge-Guided Vulnerability Detection with LLM and Code Slicing [2.0706429677946563]
本稿では,脆弱性に着目したコードスライシング,ERC-721指向の知識ベース,制約付きDeepSeek解析を組み合わせた脆弱性検出手法を提案する。
450 NFTの契約サンプルでは、完全な構成で437の正のラベルが作られ、97.1%の正のラベルが報告された。
外部知識ベースを取り除き87.11%まで削減し、知識ベースを使わずに完全な契約を分析することで73.78%まで削減した。
論文 参考訳(メタデータ) (2026-07-24T05:10:26Z) - Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence [56.25095230687242]
コーディングエージェントは、しばしば自身のローカル検証ルーチンを過度に信頼し、表面チェックを満たすアーティファクトの成功を宣言する。
この問題は、事前評価が結果駆動である変換において特に深刻である。
ブラインド・コンバージョンは26.7-28.9%に達し、スペック・パスレートは91.1%まで上昇した。
このことは、失敗は限られた予算やバックボーンの強さよりも、契約ミスによる自己検証に起因していることを示唆している。
論文 参考訳(メタデータ) (2026-05-27T19:57:15Z) - PSR2: A Phase-based Semantic Reasoning Framework for Atomicity Violation Detection via Contract Refinement [9.36682660657815]
PSRtextsuperscript2は、構造経路探索と決定論的意味推論を統合する新しい静的解析フレームワークである。
1,600のコントラクトサンプルの実験では、PSRtextsuperscript2がパターンマッチングベースラインを著しく上回っている。
我々の融合論理は、単一モジュール解析と比較して、偽陽性率を半減する。
論文 参考訳(メタデータ) (2026-04-08T11:46:01Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - Multi-Agent Taint Specification Extraction for Vulnerability Detection [49.27772068704498]
コンテナ分析を使用した静的アプリケーションセキュリティテスト(SAST)ツールは、高品質な脆弱性検出結果を提供するものとして広く見なされている。
本稿では,Large Language Models (LLM) のセマンティック理解と従来の静的プログラム解析を戦略的に組み合わせたマルチエージェントシステムであるSemTaintを提案する。
私たちは、SemTaintを最先端のSASTツールであるCodeQLと統合し、これまでCodeQLで検出できなかった162の脆弱性の106を検出して、その効果を実証しています。
論文 参考訳(メタデータ) (2026-01-15T21:31:51Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - SemAgent: A Semantics Aware Program Repair Agent [14.80363334219173]
SemAgentは、イシュー、コード、実行セマンティクスを利用して完全なパッチを生成する、新しいワークフローベースのプロシージャである。
我々は、(a)実行セマンティクスを活用して関連するコンテキストを検索し、(b)一般化された抽象化を通して問題セマンティクスを理解し、(c)この抽象化のコンテキスト内でコードセマンティクスを分離する、という新しいパイプラインを通してこれを実現する。
提案手法は,SWEBench-Liteベンチマークで44.66%の解率を達成し,ワークフローベースのアプローチを全て上回り,ベースラインと比較して7.66%の絶対的な改善を実現している。
論文 参考訳(メタデータ) (2025-06-19T23:27:58Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z) - Fine-Grained 1-Day Vulnerability Detection in Binaries via Patch Code Localization [12.73365645156957]
バイナリの1日間の脆弱性は、ソフトウェアセキュリティに対する大きな脅威になっている。
パッチの有無テストは 脆弱性を検出する効果的な方法の1つです
パッチコードとそのコンテキストから安定な値を利用するPLocatorという新しい手法を提案する。
論文 参考訳(メタデータ) (2025-01-29T04:35:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。