論文の概要: PAIChecker: Uncovering and Checking PR-Issue Misalignment in SWE-Bench-Like Benchmarks
- arxiv url: http://arxiv.org/abs/2607.28587v1
- Date: Thu, 30 Jul 2026 17:42:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.704388
- Title: PAIChecker: Uncovering and Checking PR-Issue Misalignment in SWE-Bench-Like Benchmarks
- Title(参考訳): PAIChecker: SWE-BenchライクなベンチマークでPR-Issueのミスを発見してチェックする
- Abstract要約: 本稿では,SWEベンチマークにおけるPR-IssueミスアライメントをチェックするマルチエージェントシステムPAICheckerを提案する。
SWE-GymとSWE-bench Multilingualの実験により、PAICheckerは4つのLLMバックボーンで最高の性能を発揮することが示された。
- 参考スコア(独自算出の注目度): 13.241944796427118
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: SWE-bench-like benchmarks are widely used for evaluating LLM's issue resolution capability. They typically follow a common construction pipeline: each PR (Pull Request) is paired with its linked issue by extracting issue references from the PR description; the issue description is used as the problem statement, and the PR patch serves as the test oracle. However, due to the inherent complexity of developing and maintaining large repositories, such PR-Issue pairings are often misaligned in practice. In this work, we systematically study SWE-bench Verified instances, finding that 13.6% exhibit misalignment across five patterns in eleven fine-grained scenarios. To enable reliable and scalable construction of those benchmarks in the future, we propose PAIChecker, a multi-agent system for checking PR-Issue misalignment in SWE-bench-like benchmarks. Specifically, PAIChecker adopts a three-phase design that combines specific pattern identification, cross-agent label synthesis, and code-level validation, thereby enabling more accurate, generalizable, and progressively verified detection. Experiments on SWE-Gym and SWE-bench Multilingual show that PAIchecker achieves the best performance across all four LLM backbones, reaching up to 92.12% and 91.67% binary accuracy, respectively.
- Abstract(参考訳): SWEベンチのようなベンチマークは、LLMの課題解決能力を評価するために広く使われている。
各PR(Pull Request)は、PR記述からイシュー参照を抽出することで、そのリンクされたイシューとペアリングされる。
しかし、大規模なリポジトリの開発とメンテナンスが本質的に複雑であるため、PR-Issueペアリングは実際は不整合であることが多い。
本研究では、SWE-bench Verifiedインスタンスを体系的に研究し、13.6%が11のきめ細かいシナリオにおいて5つのパターンにまたがって不整合を示すことを発見した。
将来,これらのベンチマークの信頼性と拡張性を実現するために,SWEベンチマークにおけるPR-IssueミスアライメントをチェックするマルチエージェントシステムPAICheckerを提案する。
具体的には、PAICheckerは、特定のパターン識別、クロスエージェントラベル合成、コードレベルのバリデーションを組み合わせた3相設計を採用し、より正確で、一般化可能で、段階的に検出を可能にする。
SWE-GymとSWE-bench Multilingualの実験により、PAIcheckerは4つのLLMバックボーンで最高のパフォーマンスを達成し、それぞれ92.12%と91.67%のバイナリ精度に達した。
関連論文リスト
- Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents [60.650808962786364]
外部判断や選択時間テストの実行なしに,ネイティブなMoEルータトレースがステアリングと選択をガイドできるかどうかを検討する。
我々の分析は、ルーティングが堅牢な行動的役割シグナルを提供することを示している。トークン・グラニュラ・リードアウトと決定整合比較セットは、ルーティングを効果的に制御する。
オープンウェイトスパースMOEエージェントを用いたSWEベンチ検証を行い,評価を行った。
論文 参考訳(メタデータ) (2026-08-23T03:07:03Z) - MASTE: A Multi-Agent Pipeline for Zero-Shot Aspect Sentiment Triplet Extraction [10.231323606041386]
Aspect Sentiment Triplet extract (ASTE) は、あるレビュー文から三重項(アスペクト、意見、感情)を共同で識別する必要がある。
ゼロショット・アスペクト・センチメント・トリプルト抽出のためのマルチエージェントパイプラインであるMASTEを提案する。
論文 参考訳(メタデータ) (2026-07-09T03:20:54Z) - DeepSWE: Measuring Frontier Coding Agents on Original, Long-Horizon Engineering Tasks [1.7623000586936592]
DeepSWEは、コーディングエージェントを評価するための、113のオリジナルで長期のソフトウェアエンジニアリングタスクのベンチマークである。
タスクは91のアクティブなオープンソースリポジトリと5つの言語でスクラッチから書かれており、上流にコントリビュートされることはない。
SWE-Bench Proのプロンプトの約半分の長さにもかかわらず、DeepSWEのプロンプトは参照ソリューションが5.5倍のコードに触れるタスクを記述する。
論文 参考訳(メタデータ) (2026-07-08T21:45:34Z) - FineVerify: Scaling Test-Time Compute with Fine-Grained Self-Verification for Agentic Search [88.16262636915975]
FineVerifyはエージェント検索のためのきめ細かい自己検証フレームワークである。
各質問をチェック可能なサブクエストに分解し、サンプル候補を検証し、最も高い集計スコアの候補を選択する。
FineVerifyは、標準のスケーリングベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-30T10:21:20Z) - BenchBench: Benchmarking Automated Benchmark Generation [10.44497524694021]
BenchBenchは、自動ベンチマーク生成をベンチマークするためのパイプラインとデータセットである。
我々は16.7Kアイテムを生成し、15Kコアアイテムをポストフィルタに保持し、152Kグレードのモデル-イテム応答を生成する。
論文 参考訳(メタデータ) (2026-03-21T13:05:32Z) - REFINE: Enhancing Program Repair Agents through Context-Aware Patch Refinement [12.995571513415905]
大規模言語モデル(LLM)は、最近、自動プログラム修復(APR)に強い可能性を示している。
LLMは、コードコンテキストの限定的な理解と不完全なテストスイートへの過度な信頼のために、正しい修正を作成するのに苦労することが多い。
本稿では,ドラフトパッチを正しいものに体系的に変換する新しいパッチリファインメントフレームワークRefineを提案する。
論文 参考訳(メタデータ) (2025-10-04T00:34:32Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - Factcheck-Bench: Fine-Grained Evaluation Benchmark for Automatic Fact-checkers [121.53749383203792]
本稿では,大規模言語モデル (LLM) 生成応答の事実性に注釈を付けるための総合的なエンドツーエンドソリューションを提案する。
オープンドメインの文書レベルの事実性ベンチマークを,クレーム,文,文書の3段階の粒度で構築する。
予備実験によると、FacTool、FactScore、Perplexityは虚偽の主張を識別するのに苦労している。
論文 参考訳(メタデータ) (2023-11-15T14:41:57Z) - Enhancing Large Language Models in Coding Through Multi-Perspective Self-Consistency [127.97467912117652]
大規模言語モデル(LLM)は、コード生成において顕著な能力を示した。
しかし、単一の試みで正しいソリューションを生成することは依然として課題である。
本稿では,MPSC(Multi-Perspective Self-Consistency)フレームワークを提案する。
論文 参考訳(メタデータ) (2023-09-29T14:23:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。