論文の概要: BreakGuard: Towards Detecting Dependency Breaking Changes with LLM-Generated Tests
- arxiv url: http://arxiv.org/abs/2608.20167v1
- Date: Thu, 20 Aug 2026 15:22:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.625513
- Title: BreakGuard: Towards Detecting Dependency Breaking Changes with LLM-Generated Tests
- Title(参考訳): BreakGuard: LLM生成テストによる依存性のブレークスルーの検出
- Abstract要約: BreakGuardは、クライアントの破壊的な変更を検出するテストスイートを生成する。
BUMPデータセットからの89個の実世界の破壊的変化に対する我々のアプローチを評価する。
- 参考スコア(独自算出の注目度): 3.299192940933114
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Open-source libraries play an important role in software development by providing reusable features that expedite the development process. As libraries evolve, they release new versions that add features, fix bugs, or apply security patches. In this process, they may break the contract established with their clients by introducing breaking changes (BCs) that alter the runtime behavior and break client applications. Client-side test suites often fail to detect these BCs because of limited library coverage that does not exercise all library methods used in the client's codebase. We propose BreakGuard, an approach that generates a test suite to detect breaking changes in clients. BreakGuard statically extracts every client method (focal method) that invokes the target library method (call site), then generates tests per focal method. A test detects a BC if it passes on the pre-breaking version and fails on the breaking version. We evaluate our approach on 89 real-world breaking changes from the BUMP dataset, using 3 LLMs (GPT4o, Qwen3-coder-480B, GPT-OSS-120B) and three context levels: minimal, method, and class. Using the best-performing configuration, BreakGuard detects 30.3% of breaking changes (27 of 89) at a mean cost of roughly $0.90 USD per detected breaking change. We successfully detected BCs from different library categories (e.g., JSON libraries, logging, parsing), but we find LLM-generated tests to be more reliable for detecting crash-type breaking changes as opposed to behavioural BCs.
- Abstract(参考訳): オープンソースライブラリは、開発プロセスを高速化する再利用可能な機能を提供することによって、ソフトウェア開発において重要な役割を担います。
ライブラリが進化するにつれて、機能の追加、バグ修正、セキュリティパッチの適用といった新しいバージョンがリリースされた。
このプロセスでは、ランタイムの振る舞いを変え、クライアントアプリケーションを壊すような破壊的な変更(BC)を導入することで、クライアントと確立した契約を破るかもしれません。
クライアントサイドテストスイートは、クライアントのコードベースで使用されるすべてのライブラリメソッドを行使しない、限られたライブラリカバレッジのため、これらのBCを検出することができないことが多い。
クライアントの破壊的な変更を検出するテストスイートを生成するアプローチであるBreakGuardを提案する。
BreakGuardは、ターゲットライブラリメソッド(呼び出しサイト)を呼び出すすべてのクライアントメソッド(フォーカスメソッド)を静的に抽出し、フォーカスメソッド毎にテストを生成する。
テストは、事前破りバージョンをパスし、破りバージョンをフェールした場合、BCを検出する。
GPT4o, Qwen3-coder-480B, GPT-OSS-120B)と3つのコンテキストレベル(最小値, メソッド値, クラス値)を用いて, BUMPデータセットから89個の実世界の破壊的変化を評価する。
最高のパフォーマンス設定を使用すると、BreakGuardは30.3%の破壊的な変更(89点中27点)を、検出された破壊的な変更に対して平均で0.90米ドルのコストで検出する。
異なるライブラリカテゴリ(例えば、JSONライブラリ、ロギング、パース)からBCを検出しましたが、LCMが生成したテストは、動作のBCとは対照的に、クラッシュタイプの破壊的な変更を検出するのに、より信頼性が高いことが分かりました。
関連論文リスト
- ExecCritic: Learn to Test, Test to Improve for Coding Agents [68.42713285082912]
実行時のフィードバックは、コーディングエージェントを正しいリポジトリの修復に導くことができますが、テストが問題によって要求された振る舞いをキャプチャした場合のみです。
ExecCriticを導入し、テスト-検証-修正足場と、その中のトレーニングエージェントのためのロール固有の強化学習レシピを組み合わせる。
テストエージェントが独立してリポジトリネイティブなテストを生成し、フェイルクローズされたハーネスがそれらを調整して凍結し、リカバリエージェントがテストを変更することなく、ソースコードを実行フィードバックから修正する。
論文 参考訳(メタデータ) (2026-09-08T17:53:37Z) - LMSM: LLM Security Framework Inspired by Linux Security Modules [56.93644694627783]
大規模言語モデル(LLM)は階層化されたディフェンスでデプロイされることが多いが、悪意のあるプロンプトはそれらをバイパスすることができる。
我々は,Language Model Security Modules (LMSM) という,Linux Security Modules (LSM) の背後にある分離を LLM サービスに適応させるセキュリティフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-26T12:13:05Z) - AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents [83.37969790806069]
LLMエージェントのエラーは、エラーが表面化するステップが原因ではないことが多いため、デバッグが難しい。
Agent DebuggerXはオープンソースのフレームワークで、デバッグをDe Detect, Attribute, Recover, Rerunのクローズドループとして整理する。
コアとなるDeep Debuggerは、グローバルな軌跡理解を通じてマルチターン根本原因診断を行う。
論文 参考訳(メタデータ) (2026-07-21T06:21:13Z) - ATTAIN: Automated Exploit Failure Analysis through Trace-Driven Diff Analysis [9.619949003948392]
ATTAINはトレース駆動の差分分析フレームワークで、進化を続けるライブラリバージョン間の脆弱性の存在を評価する。
ATTAINのF1スコアは93.24%で、コミットベースの手法であるV-SZZとLLM4SZをそれぞれ116.28%、LLM4SZを33.30%上回る。
論文 参考訳(メタデータ) (2026-06-08T05:49:50Z) - Correct Code, Vulnerable Dependencies: A Large Scale Measurement Study of LLM-Specified Library Versions [52.50730821321986]
大規模言語モデル(LLM)におけるバージョンレベルのリスクの大規模評価を初めて行った。
我々は1000のStack OverflowプログラミングタスクのベンチマークであるPinTrace上で10のLLMを評価した。
LLM バージョン選択は LLM ベース開発における第1級, 以前は見落とされたリスクサーフェスとして確認された。
論文 参考訳(メタデータ) (2026-05-07T13:52:59Z) - Recursive language models for jailbreak detection: a procedural defense for tool-augmented agents [0.0]
Recursive Language Models (RLM) に基づくエンドツーエンドのジェイルブレイク検出フレームワーク RLM-JB を提案する。
RLM-JBは、検出をワンショット分類ではなく手順として扱う。
AutoDANスタイルの逆入力では、RLM-JBは3つのLLMバックエンド間で高い検出効率を実現する。
論文 参考訳(メタデータ) (2026-02-18T15:07:09Z) - InfCode: Adversarial Iterative Refinement of Tests and Patches for Reliable Software Issue Resolution [31.874379525390967]
InfCodeは、リポジトリレベルの自動イシュー解決のための、対向的なマルチエージェントフレームワークである。
InfCodeは、テストパッチジェネレータとコードパッチジェネレータの間の逆インタラクションを通じて、テストとパッチの両方を反復的に洗練する。
DeepSeek-V3やClaude 4.5 Sonnetといったモデルを用いたSWE-bench LiteとSWE-benchの検証実験は、InfCodeが一貫して強力なベースラインを上回っていることを示している。
論文 参考訳(メタデータ) (2025-11-20T03:04:21Z) - ImpossibleBench: Measuring LLMs' Propensity of Exploiting Test Cases [58.411135609139855]
タスク完了のための「ショートカット」は、大規模言語モデルの信頼性評価と展開に重大なリスクをもたらす。
我々は,LLMエージェントがテストケースを利用するための正当性を測定するベンチマークフレームワークであるImpossibleBenchを紹介する。
実践的なフレームワークとして、ImpossibleBenchは単なる評価ではなく、汎用的なツールである。
論文 参考訳(メタデータ) (2025-10-23T06:58:32Z) - Latte: Collaborative Test-Time Adaptation of Vision-Language Models in Federated Learning [66.35456997311742]
事前学習された視覚言語モデルによるテスト時間適応は、テスト中の分散シフトに対処するために注目が集まっている。
既存のテスト時間適応法は通常、豊富なデータを持つ単一のドメイン用に設計されている。
本稿では,各クライアントがローカルメモリを保守し,それぞれの履歴テストデータから埋め込みを格納する新しいフレームワークであるLatteを提案する。
論文 参考訳(メタデータ) (2025-07-29T04:27:29Z) - Client--Library Compatibility Testing with API Interaction Snapshots [6.2272693929051295]
動作の破壊的変更(BBC)は、コンパイル時に検出されることなく、クライアントアプリケーションを静かに破壊することができる。
クライアント側の従来の回帰テストは、しばしばそのようなBBCを検出するのに失敗する。
本稿では,既存のクライアントテストを活用するクライアント-ライブラリ互換性テストに対する新しいアプローチを提案する。
論文 参考訳(メタデータ) (2025-07-28T13:22:19Z) - AssertFlip: Reproducing Bugs via Inversion of LLM-Generated Passing Tests [0.7564784873669823]
本稿では,大規模な言語モデル(LLM)を用いたバグ再現性テスト(BRT)の自動生成手法であるAssertFlipを紹介する。
AssertFlipはまず、バグ発生時のパステストを生成し、バグ発生時にそのテストがフェールする。
以上の結果から,AssertFlipは,BRTのベンチマークであるSWT-Benchのリーダボードにおいて,すべての既知技術よりも優れていることがわかった。
論文 参考訳(メタデータ) (2025-07-23T14:19:55Z) - STAMP: Outlier-Aware Test-Time Adaptation with Stable Memory Replay [76.06127233986663]
テスト時間適応(TTA)は、トレーニングデータとテストデータの間の分散シフトに、未ラベルのデータのみを用いて対処することを目的としている。
本稿では,サンプル認識とオフリエ拒絶の両方を行う問題に注意を払っている。
本稿では,STAble Memory rePlay (STAMP) と呼ばれる新しい手法を提案する。
論文 参考訳(メタデータ) (2024-07-22T16:25:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。