論文の概要: CompMat-Bench: Benchmarking AI Agents for Computational Materials Science
- arxiv url: http://arxiv.org/abs/2610.00636v1
- Date: Wed, 30 Sep 2026 19:37:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.732887
- Title: CompMat-Bench: Benchmarking AI Agents for Computational Materials Science
- Title(参考訳): CompMat-Bench: 計算材料科学のためのAIエージェントのベンチマーク
- Abstract要約: CompMat-Benchは、計算材料研究から派生した94のタスクのベンチマークである。
我々は、事前に研究手順を再現し、高価なシミュレーションのための入力の準備と出力の分析を行うエージェントを評価する。
ベンチマークは4つの評価条件をサポートする: 単一のタスクと関連するタスクで構成され、それぞれが完全なまたは少ない方法論的ガイダンスを持つ。
- 参考スコア(独自算出の注目度): 3.6785856400419465
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Evaluating AI agents on scientific research tasks is constrained by the time and resources required for the underlying experiments or calculations. In computational materials research, repeating the same expensive simulations across agents and trials can make evaluation impractical. We introduce CompMat-Bench, a benchmark of 94 tasks derived from recently published computational materials studies, each asking agents to complete a step toward achieving the study's scientific goal. We reproduce the research steps in advance and assess agents on preparing inputs and analyzing outputs for expensive simulations, so expensive simulations can be avoided during evaluation. The reproduced inputs and results serve as ground truth for grading agents with fixed rules, without an LLM judge. The benchmark supports four evaluation conditions: single tasks and workflows composed of related tasks, each with full or reduced methodological guidance. With full guidance on single tasks, agents based on three LLMs demonstrate the ability to complete individual materials research steps, with pass rates of 66.0-90.4% across 94 tasks. Both longer workflows and reduced guidance can limit agent performance, but in different ways for different agents: they lower the pass rates of the weaker agents, whereas the strongest agent falls only when a long workflow is combined with reduced guidance. Failure analysis attributes most failures to scientific errors rather than to errors in software usage. CompMat-Bench provides a basis for comparing agents on the steps of real materials research and for analyzing agent failure modes.
- Abstract(参考訳): 科学研究タスクにおけるAIエージェントの評価は、基礎となる実験や計算に必要な時間とリソースによって制約される。
計算機材料研究において、エージェントとトライアルにまたがる同じ高価なシミュレーションを繰り返すことは、評価を非現実的にすることができる。
我々は、最近発表された計算材料研究から得られた94のタスクのベンチマークであるCompMat-Benchを紹介し、各エージェントに研究の科学的目標を達成するためのステップを完了させるよう依頼する。
我々は,先行して研究の段階を再現し,高価なシミュレーションのための入力の作成と出力の分析を行うエージェントを評価するので,評価中に高価なシミュレーションを避けることができる。
再現された入力と結果は、LSM審査員なしで一定の規則でグレーディングエージェントの基底真理として機能する。
ベンチマークは4つの評価条件をサポートする: 単一のタスクと関連するタスクからなるワークフロー。
単一のタスクに関する完全なガイダンスにより、3つのLSMに基づくエージェントは、94タスクで66.0-90.4%のパスレートで、個々の材料研究ステップを完了できることを示した。
より長いワークフローと低いガイダンスの両方がエージェントのパフォーマンスを制限するが、異なるエージェントに対して異なる方法で、より弱いエージェントのパスレートを下げる。
フェール解析は、ほとんどの失敗は、ソフトウェア使用時のエラーよりも科学的エラーによるものである。
CompMat-Benchは、実際の材料研究の段階におけるエージェントの比較と、エージェント故障モードの分析の基盤を提供する。
関連論文リスト
- Benchmarking AI Agents for Addressing Scientific Challenges Across Scales [118.2204632627895]
SciAgentArenaは、現実世界の科学研究シナリオでAIエージェントを評価するための体系的なベンチマークである。
ステップワイズ検証を備えた約200のタスクと、多様なAIエージェントを評価するためのインタラクティブでエージェントに依存しない環境で構成される。
タスク構造や評価基準が明確である場合, 現状のエージェントはデータ分析に効果的に貢献できることがわかった。
論文 参考訳(メタデータ) (2026-06-10T22:55:30Z) - Collider-Bench: Benchmarking AI Agents with Particle Physics Analysis Reproduction [0.02446672595462589]
我々は,LHC(Large Hadron Collider)から,公開論文とオープンサイエンスソフトウェアのみを用いて,言語モデルエージェントが実験分析を再現できるかどうかを評価するベンチマークであるCollind-Benchを紹介する。
したがってエージェントは、これらのギャップを埋めるために、物理的推論、ドメイン知識、試行錯誤に頼らなければならない。
以上の結果から, 平均的なエージェントが, ループ内解法を確実に打ち負かすことは不可能であることが示唆された。
論文 参考訳(メタデータ) (2026-05-13T18:00:00Z) - Can Coding Agents Reproduce Findings in Computational Materials Science? [49.254975563645786]
本稿では,大規模言語モデルの科学的主張を再現する能力を評価するためのベンチマークであるAutoMatを紹介する。
課題を専門とする専門家と緊密に連携することで、実際の材料科学論文からの一連の主張をキュレートし、コーディングエージェントがエンドツーエンドのワークフローを回復し実行できるかどうかを検証します。
結果、現在のLSMベースのエージェントはAutoMatの全体的な成功率を低くし、最も優れた設定は54.1%に過ぎなかった。
論文 参考訳(メタデータ) (2026-05-01T17:42:12Z) - Agent psychometrics: Task-level performance prediction in agentic coding benchmarks [24.348135523715815]
本稿では,エージェントプログラミング体制に合わせて,個々のタスクにおける成功や失敗を予測する枠組みを提案する。
我々のアプローチは、イシューステートメント、リポジトリコンテキスト、ソリューション、テストケースなど、タスクから抽出された豊富な機能を備えたアイテム応答理論(IRT)を拡張します。
論文 参考訳(メタデータ) (2026-04-01T07:59:59Z) - AIRS-Bench: a Suite of Tasks for Frontier AI Research Science Agents [49.67355440164857]
AIRS-Benchは、最先端の機械学習論文から得られた20のタスクからなるスイートである。
Airs-Benchタスクは、研究ライフサイクル全体のエージェント能力を評価する。
本稿では,AIRS-Benchタスク定義と評価コードをオープンソースとして公開し,自律科学研究のさらなる発展を促す。
論文 参考訳(メタデータ) (2026-02-06T16:45:02Z) - Benchmarking LLM Agents for Wealth-Management Workflows [0.0]
この論文はTheAgentCompanyを金融に焦点を当てた環境に拡張している。
本研究は、汎用LLMエージェントが、精密かつ経済的に代表的富管理タスクを完了できるかどうかを調査する。
論文 参考訳(メタデータ) (2025-12-01T21:56:21Z) - AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress [71.02263260394261]
大規模言語モデル(LLM)は、マルチターン意思決定タスクにおいて依然として課題に直面している。
プロセス報酬モデル(PRM)を構築し、各意思決定を評価し、エージェントの意思決定プロセスを導く。
AgentPRMは、シーケンシャルな決定と最終的な目標への貢献の間の相互依存の両方をキャプチャする。
論文 参考訳(メタデータ) (2025-11-11T14:57:54Z) - AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite [75.58737079136942]
本稿では,AstaBenchについて紹介する。AstaBenchは,科学的研究を行うためのエージェント能力の総合的な測定を行うスイートである。
私たちのスイートには、プロダクショングレードの検索ツールを備えた、最初の科学研究環境が付属しています。
22のエージェントクラスで57のエージェントを評価したところ,いくつかの興味深い結果が得られた。
論文 参考訳(メタデータ) (2025-10-24T17:10:26Z) - MLAgentBench: Evaluating Language Agents on Machine Learning Experimentation [96.71370747681078]
我々は,CIFAR-10におけるモデル性能の改善から,BabyLMのような最近の研究課題まで,13のタスクからなるMLAgentBenchを紹介した。
各タスクに対して、エージェントはファイルの読み書き、コードの実行、出力の検査などのアクションを実行することができる。
我々は、Claude v1.0、Claude v2.1、Claude v3 Opus、GPT-4、GPT-4-turbo、Gemini-Pro、Mixtralに基づいてベンチマークエージェントをベンチマークし、Claude v3 Opusエージェントが成功率の点で最高であることを示す。
論文 参考訳(メタデータ) (2023-10-05T04:06:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。