論文の概要: SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?
- arxiv url: http://arxiv.org/abs/2608.19799v1
- Date: Thu, 20 Aug 2026 08:53:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.514438
- Title: SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?
- Title(参考訳): SWEベンチサイエンス: コーディングエージェントは科学の工学的課題を解決できるか?
- Authors: Zhipeng Xu, Jiahao Lu, Yining Zheng, Yuxin Wang, Xipeng Qiu,
- Abstract要約: SWE-bench Scienceは、20の科学ドメインにわたる98のGitHubリポジトリから119のタスクからなる、科学ソフトウェアエンジニアリングのためのリポジトリレベルのベンチマークである。
科学的知識や抽象化の欠如、誤った調査や表面レベルの修復、不完全な修復のカバレッジやシステム統合、そして我々の分析で観察されたケースを超えて科学的知識を一般化する失敗の4つの失敗メカニズムを特定します。
- 参考スコア(独自算出の注目度): 60.11366724565423
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Software increasingly functions as part of the scientific instrument itself, making failures in scientific code capable of compromising not only program behavior but also the evidence underlying scientific conclusions. Yet existing evaluations of coding agents largely emphasize aggregate task success, providing limited insight into why agents fail when repairing scientific software. We introduce \textbf{SWE-bench Science}, a repository-level benchmark for scientific software engineering comprising 119 tasks from 98 GitHub repositories across 20 scientific domains. Each task is organized into one of three paradigms: Issue-driven, Expert-exploratory, and Engineering-integration. Even the best-performing agent, \textbf{Claude Code with Opus-5 (max), achieves a pass@1 below 50\%}, highlighting the substantial challenges posed by scientific software engineering. We identify four recurring failure mechanisms: deficits in scientific knowledge or abstraction, misguided exploration or surface-level repair, incomplete repair coverage or system integration, and failures to generalize scientific knowledge beyond observed cases in our analysis. We further conduct a paired ablation that removes explicit scientific guidance while preserving the repository and executable engineering context. The results show that scientific knowledge is not uniformly beneficial: well-grounded information can constrain repair and improve average performance and token efficiency, whereas poorly aligned guidance can induce anchoring and does not necessarily improve exact repair success. Together, SWE-bench Science provides a broad testbed for studying both the capabilities and failure mechanisms of coding agents in scientific software engineering.
- Abstract(参考訳): ソフトウェアは科学機器自体の一部として機能し、プログラムの振る舞いだけでなく、科学的結論に基づく証拠を妥協できる科学コードで失敗する。
しかし、既存のコーディングエージェントの評価では、集約されたタスクの成功が強調されており、なぜエージェントが科学ソフトウェアを修復する際に失敗するのかについての洞察が限られている。
これは20の科学領域にわたる98のGitHubリポジトリから119のタスクからなる科学ソフトウェアエンジニアリングのためのリポジトリレベルのベンチマークです。
各タスクは、イシュー駆動、エキスパート探索、エンジニアリング統合の3つのパラダイムの1つに分類される。
最高のパフォーマンスエージェントである \textbf{Claude Code with Opus-5 (max) でさえ、科学ソフトウェア工学がもたらす重大な課題を浮き彫りにしたパス@1を達成している。
科学的知識や抽象化の欠如、誤った調査や表面レベルの修復、不完全な修復のカバレッジやシステム統合、そして我々の分析で観察されたケースを超えて科学的知識を一般化する失敗の4つの失敗メカニズムを特定します。
さらに、リポジトリと実行可能なエンジニアリングコンテキストを維持しながら、明確な科学的ガイダンスを除去するペアアブレーションを実施します。
その結果、科学的知識は均一に有用ではないことが明らかとなった: 十分な情報により、修復を制限し、平均性能とトークン効率を向上することができる一方、整列性に乏しいガイダンスは、アンカーを誘導し、必ずしも正確な修理を成功させるとは限らない。
SWE-bench Scienceは、科学ソフトウェア工学におけるコーディングエージェントの能力と失敗のメカニズムを研究するための幅広いテストベッドを提供する。
関連論文リスト
- SCICONVBENCH: Benchmarking LLMs on Multi-Turn Clarification for Task Formulation in Computational Science [3.9311288356229057]
大規模言語モデル(LLM)は、科学的なAIとしてますます多くデプロイされている。
本稿では,SCICONVBENCHを科学タスクの定式化におけるマルチターン明確化のベンチマークとして紹介する。
我々のベンチマークは、構造化されたタスクとルーブリックベースの評価フレームワークをペアリングする。
論文 参考訳(メタデータ) (2026-05-18T16:34:45Z) - SciEvalKit: An Open-source Evaluation Toolkit for Scientific General Intelligence [99.30934038146965]
SciEvalKitは、科学知能のコア能力に焦点を当てている。
物理学、化学から天文学、材料科学まで6つの主要な科学領域をサポートしている。
このツールキットはオープンソースで、コミュニティ主導の開発とAI4Scienceの進歩を促進するために積極的にメンテナンスされている。
論文 参考訳(メタデータ) (2025-12-26T17:36:02Z) - AInsteinBench: Benchmarking Coding Agents on Scientific Repositories [33.48206557020983]
AInsteinBenchは、大規模言語モデル(LLM)エージェントが科学計算開発エージェントとして動作するかどうかを評価するための大規模なベンチマークである。
AInsteinBenchは、表面レベルのコード生成を超えて、計算科学研究に必要なコア能力に移行するモデルの能力を測定する。
論文 参考訳(メタデータ) (2025-12-24T08:11:11Z) - Bohrium + SciMaster: Building the Infrastructure and Ecosystem for Agentic Science at Scale [82.20980951765891]
エージェントサイエンスのスケーリングにはインフラストラクチャ・アンド・エコシステムアプローチが必要である,と我々は主張する。
BohriumはAI4S資産のマネージドでトレース可能なハブとして機能し、多様な科学データ、ソフトウェア、計算、実験室のシステムをエージェント対応の能力に変換する。
SciMasterはこれらの機能を長い水平科学に編成し、科学エージェントを合成して実行することができる。
論文 参考訳(メタデータ) (2025-12-23T16:04:41Z) - NewtonBench: Benchmarking Generalizable Scientific Law Discovery in LLM Agents [65.85967483058705]
科学法発見のための強力なツールとして、大規模な言語モデルが登場している。
このタスクの既存のベンチマークは、基本的な方法論のトリレンマに悩まされている。
12の物理領域にわたる324の科学法発見タスクからなるベンチマークであるNewtonBenchを紹介する。
論文 参考訳(メタデータ) (2025-10-08T16:12:11Z) - ScienceBoard: Evaluating Multimodal Autonomous Agents in Realistic Scientific Workflows [82.07367406991678]
大規模言語モデル(LLM)は自然言語処理を超えてその影響を拡大している。
これらのうち、コンピュータ利用エージェントは、人間がしているようにオペレーティングシステムと対話することができる。
我々はScienceBoardを紹介し、ダイナミックで視覚的にリッチな科学ソフトウェアを特徴とする現実的でマルチドメイン環境を包含する。
論文 参考訳(メタデータ) (2025-05-26T12:27:27Z) - SciCode: A Research Coding Benchmark Curated by Scientists [37.900374175754465]
言語モデル(LM)は、多くの挑戦的なタスクにおいて平均的な人間よりも優れており、挑戦的で高品質で現実的な評価を開発することはますます困難になっている。
このベンチマークには数学、物理学、化学、生物学、材料科学といった問題が含まれています。
クロード3.5-ソネット(Claude3.5-Sonnet)は、最も現実的な環境では、問題の4.6%しか解決できない。
論文 参考訳(メタデータ) (2024-07-18T05:15:24Z) - CLAIMED -- the open source framework for building coarse-grained
operators for accelerated discovery in science [0.0]
CLAIMEDは、科学者が科学演算子を再コンパイルすることによって以前の研究から引き出すのを支援することで、再利用可能な演算子とスケーラブルな科学的不可知性を構築するためのフレームワークである。
CLAIMEDはプログラミング言語、科学ライブラリ、実行環境である。
論文 参考訳(メタデータ) (2023-07-12T11:54:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。