論文の概要: An Exploration of Agentic Information Fusion for Test Maintenance Prediction
- arxiv url: http://arxiv.org/abs/2607.04786v1
- Date: Mon, 06 Jul 2026 08:20:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.08655
- Title: An Exploration of Agentic Information Fusion for Test Maintenance Prediction
- Title(参考訳): 試験保守予測のためのエージェント情報融合の探索
- Abstract要約: MAST(Multi-agent framework)は、本番コードの変更後、どのテストケースがメンテナンスを必要とするかを予測するマルチエージェントフレームワークである。
我々は Ericsson AB の 21 の産業用 Java リポジトリ上で MAST を評価した。
- 参考スコア(独自算出の注目度): 1.6778164862407765
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Test maintenance is a critical, yet costly, activity - particularly as codebases rapidly evolve. To assist, we present MAST, a multi-agent framework that predicts which test cases require maintenance following changes to the production code. This identification task is necessary as a precondition to any subsequent maintenance activities, but remains challenging due to the complex relationships between production and test code. MAST advances the state-of-the-art by integrating multiple analyses -- including static, lexical, and semantic analyses - through an intelligent fusion and post-check procedure and by focusing on a realistic use and evaluation setting - i.e., standardized input formats, repository-level analyses, and the ability to infer relations between test and production artifacts rather than assuming a pre-existing mapping. We evaluated MAST on 21 industrial Java repositories from Ericsson AB, considering situations where test maintenance both was and was not required in the ground truth. MAST yielded superior precision to a state-of-the-art baseline - resulting in a higher accuracy, F1, and F2 score - with only some loss in recall. Our ablation study demonstrates the value of each analysis in producing the final recommendations. MAST illustrates the potential of multi-agent systems that can fuse multiple information sources when performing software testing tasks.
- Abstract(参考訳): 特にコードベースが急速に進化するにつれて、テストのメンテナンスは重要な作業になりますが、コストがかかります。
MAST(Multi-agent framework)は、本番コードの変更後、どのテストケースがメンテナンスを必要とするかを予測する。
この識別タスクは、その後のメンテナンス活動の前提条件として必要だが、生産とテストコードの間の複雑な関係のため、依然として困難である。
MASTは、インテリジェントな融合およびポストチェック手順を通じて、静的、語彙、セマンティック分析を含む複数の分析を統合し、現実的な使用と評価設定(つまり、標準化された入力形式、リポジトリレベルの分析、既存のマッピングを仮定するのではなく、テストとプロダクションの成果物の関係を推測する能力)に焦点を当てることによって、最先端の技術の進歩を図っている。
我々はEricsson ABから21の産業用Javaリポジトリ上でMASTを評価した。
MASTは最先端のベースラインに優れた精度を与え、より高い精度、F1、F2のスコアを得たが、リコールの損失はわずかであった。
我々のアブレーション研究は、最終レコメンデーションの作成における各分析の価値を実証している。
MASTは、ソフトウェアテストタスクを実行する際に複数の情報ソースを融合できるマルチエージェントシステムの可能性を説明している。
関連論文リスト
- Towards Autonomous and Auditable Medical Imaging Model Development [53.326510777116766]
本稿では,医療画像モデル開発のための自律型マルチエージェントフレームワークAMIDを紹介する。
AMIDが最初に提案するData-Conditioned Method Planningは、タスクレベルの粗い検索空間を、実行可能で並列化可能なメソッドレーンに洗練する。
次に検証誘導二段階最適化(Verification-Guided Two-Stage Optimization)を開発し、様々な手法レーンの広範な早期探索から、有望な候補の選択的利用へと移行した。
論文 参考訳(メタデータ) (2026-07-12T00:54:06Z) - FP-Predictor - False Positive Prediction for Static Analysis Reports [5.4164223824711755]
この研究は、静的アプリケーションセキュリティテスト(SAST)レポートを真で偽陽性と予測するために設計されたグラフ畳み込みネットワーク(GCN)モデルを示す。
このモデルは静的解析結果から構築されたコードプロパティグラフ(CPG)を利用して、コード内の構造的および意味的な関係をキャプチャする。
CryptoAPI-Benchベンチマークの評価では、このモデルの実用性を示し、全体の精度は96.6%に達した。
論文 参考訳(メタデータ) (2026-03-11T09:05:39Z) - AIDABench: AI Data Analytics Benchmark [62.45908988324612]
AIDABenchは、複雑なデータ分析タスクのAIシステムをエンドツーエンドで評価するためのベンチマークである。
AIDABenchは、質問応答、データビジュアライゼーション、ファイル生成という3つのコア機能ディメンションにまたがる600以上の多様なドキュメント分析タスクを含んでいる。
AIDABenchの11の最先端モデルを評価し、プロプライエタリ(Claude Sonnet 4.5、Gemini 3 Pro Previewなど)とオープンソース(Qwen3-Max-2026-01-23-Thinkingなど)の両方を対象とする。
論文 参考訳(メタデータ) (2026-02-27T08:58:05Z) - AgenticRAGTracer: A Hop-Aware Benchmark for Diagnosing Multi-Step Retrieval Reasoning in Agentic RAG [7.139631028105273]
本稿ではエージェントベースのマルチホップ推論のベンチマークである AgenticRAGTracer を紹介する。
主に大きな言語モデルで構築され、ステップバイステップの検証をサポートするように設計されている。
我々のベンチマークは、複数のドメインにまたがり、1,305のデータポイントを含み、既存の主流ベンチマークと重複しない。
論文 参考訳(メタデータ) (2026-02-22T10:55:21Z) - TokaMark: A Comprehensive Benchmark for MAST Tokamak Plasma Models [56.94569090844015]
TokaMarkは、Mega Ampere Spherical Tokamak (MAST)から収集された実実験データに基づいてAIモデルを評価するための構造化ベンチマークである。
TokaMarkは、データ駆動型AIベースのプラズマモデリングの進歩を加速することを目的としている。
論文 参考訳(メタデータ) (2026-02-05T16:49:44Z) - TSAQA: Time Series Analysis Question And Answering Benchmark [85.35545785252309]
時系列データは、金融、医療、交通、環境科学といった分野における重要な応用に不可欠である。
TSAQAはタスクカバレッジを拡大し、多様な時間的分析能力を評価するために設計された新しい統合ベンチマークである。
論文 参考訳(メタデータ) (2026-01-30T17:28:56Z) - AI-Driven Tools in Modern Software Quality Assurance: An Assessment of Benefits, Challenges, and Future Directions [0.0]
この研究は、現代のAI指向ツールを品質保証プロセスに統合するメリット、課題、および展望を評価することを目的としている。
この研究は、AIがQAに変革をもたらす可能性を実証しているが、これらの技術を実装するための戦略的アプローチの重要性を強調している。
論文 参考訳(メタデータ) (2025-06-19T20:22:47Z) - Training Language Models to Generate Quality Code with Program Analysis Feedback [66.0854002147103]
大規模言語モデル(LLM)によるコード生成は、ますます本番環境で採用されているが、コード品質の保証には失敗している。
実運用品質のコードを生成するためにLLMにインセンティブを与える強化学習フレームワークであるREALを提案する。
論文 参考訳(メタデータ) (2025-05-28T17:57:47Z) - Requirements-Driven Automated Software Testing: A Systematic Review [12.953746641112518]
この体系的な文献は、要求入力フォーマット、変換技術、生成されたテストアーティファクト、評価方法、一般的な制限の現状を批判的に検証する。
本研究は,機能要件,モデルベース仕様,自然言語フォーマットの優位性に注目した。
テストケース、構造化されたテキスト形式、要求カバレッジは一般的だが、完全な自動化は依然として稀である。
論文 参考訳(メタデータ) (2025-02-25T23:13:09Z) - AutoPT: How Far Are We from the End2End Automated Web Penetration Testing? [54.65079443902714]
LLMによって駆動されるPSMの原理に基づく自動浸透試験エージェントであるAutoPTを紹介する。
以上の結果から, AutoPT は GPT-4o ミニモデル上でのベースラインフレームワーク ReAct よりも優れていた。
論文 参考訳(メタデータ) (2024-11-02T13:24:30Z) - Exploring the Integration of Large Language Models in Industrial Test Maintenance Processes [3.9060897267786157]
本研究では,大規模言語モデル(LLM)の機能と応用について検討する。
ソースコードの変更後、どのテストがメンテナンスを必要とするかを予測できるマルチエージェントアーキテクチャを提案し、実証する。
論文 参考訳(メタデータ) (2024-09-10T10:55:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。