論文の概要: FrontierChallenge: Evaluating Scientific Workflow Completion
- arxiv url: http://arxiv.org/abs/2608.24979v1
- Date: Tue, 25 Aug 2026 16:50:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.340586
- Title: FrontierChallenge: Evaluating Scientific Workflow Completion
- Title(参考訳): FrontierChallenge: 科学的ワークフローの完了を評価する
- Abstract要約: 私たちは300のエンドツーエンドの科学的成果物からなるクロスドメインベンチマークであるFrontierChallengeを紹介します。
量子化学、分子動力学、材料特性評価、分析化学、生命科学、電気化学・環境学にまたがる97の課題を公表し評価する。
高い部分的なスコアも自信のある完成のクレームも、科学的タスクが完全に納品されたことを確実に示さないことが分かりました。
- 参考スコア(独自算出の注目度): 59.601983661596286
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Scientific agents increasingly analyze data, execute code, and produce research artifacts, yet most benchmarks emphasize final answers, isolated programs, or a single domain. We introduce FrontierChallenge, a cross-domain benchmark comprising 300 end-to-end scientific workflows. In this paper, we release and evaluate 97 of these tasks, spanning quantum chemistry, molecular dynamics, materials characterization, analytical chemistry, life science, and electrochemistry/environment. Each task provides fixed inputs and specifies a bundle of required scientific deliverables. We evaluate twelve frontier models with three agent scaffolds. Pass Rate measures the fraction of tasks satisfying the full-completion criterion, while Avg. Score captures partial progress. Each of the best-performing configurations completed only 20 of the 97 released tasks, yielding a Pass Rate of 20.6%. Partial progress translated especially poorly into complete delivery in analytical chemistry and electrochemistry/environment: Avg. Scores reached 87.6 and 94.9, but the highest Pass Rates were only 4% and 0%. Among non-passing Claude Code trajectories, 75.5% still ended with language claiming completion. These findings show that neither high partial scores nor confident claims of completion reliably indicate that a scientific task has been fully delivered, highlighting the need to evaluate end-to-end workflow execution and the completeness of scientific deliverables together.
- Abstract(参考訳): 科学エージェントはデータを分析し、コードを実行し、研究成果物を生成する。
我々は300のエンドツーエンドの科学ワークフローからなるクロスドメインベンチマークであるFrontierChallengeを紹介した。
本稿では, 量子化学, 分子動力学, 材料特性, 分析化学, 生命科学, 電気化学・環境科学など, 97の課題を公表し, 評価する。
各タスクは、固定された入力を提供し、必要な科学的な成果物の束を指定する。
我々は3つのエージェント足場を持つ12のフロンティアモデルを評価する。
Pass Rateは完全なコンプリート基準を満たすタスクのごく一部を計測するが、Avgはそうである。
スコアは部分的な進歩を捉えます。
最高性能の97個のタスクのうち20個のみが完了し、パスレートは20.6%となった。
分析化学および電気化学/環境学における部分的な進歩は特に不十分であった。
スコアは87.6と94.9に達したが、最高パスレートは4%と0%だった。
通過しないクロード・コードの軌跡の中で、75.5%はまだ完成を主張する言語で終わっている。
これらの結果から, 高い部分的スコアや確実な完成のクレームは, 科学的タスクが完了したことを確実に示さず, エンドツーエンドのワークフロー実行と科学的成果の完全性を評価する必要性を強調した。
関連論文リスト
- SCIRIGOR:Evaluating Open-Ended Scientific Analysis Beyond Final Scores [11.097584790037454]
我々は,エビデンスを基盤としたマルチモーダルな科学分析を定式化し,エージェントが実行可能分析と同一実行時の結果と視覚化によって支持されるクレームを生成することを要求した。
SciRIGORは6つの領域と17のサブフィールドにまたがる科学論文から100のケースをまとめた評価フレームワークとベンチマークである。
完全ベンチマークでは、主張はほぼ同じ率(91.8%対91.0%)で忠実で不信な結果に同意するが、ソフトエビデンスチェーンスコアでは62.6%、厳密な全チェーン成功では18.0%を超えない。
論文 参考訳(メタデータ) (2026-09-05T17:29:15Z) - Efficient Test-Time Adaptation through Human-AI Interaction [112.5131603022122]
我々は,ヒト-エージェント間相互作用(TAHI)によるテスト時間適応を提案する。
エージェントを2つの高ユーティリティドメイン(書き込みと視覚的創造)の30人に適応させ、合計600のタスクをこなします。
エージェントは10タスク以内の単独作業の成功率を4.5-20.9%向上させる。
論文 参考訳(メタデータ) (2026-09-03T17:33:18Z) - BixBench3: Benchmarking AI agents on research-study-scale computational biology tasks [1.1546532378724035]
Bix3は、AIエージェントの能力を測定し、生物学的データを科学的結果に処理するベンチマークである。
スコアはGemini 3.1 Flash Liteの0.00からGPT 5.6 Solの0.48まで。
エージェントは平均で6.8時間トークンを使用し、各タスクは102百万ドル、43ドルを完了し、24時間かかる最長の試行は43ドルである。
論文 参考訳(メタデータ) (2026-08-26T01:45:55Z) - EarthVerse: Benchmarking Scientific Agents Across Dynamic Earth Systems and Natural Hazards [73.12811119273206]
我々は,包括的調査を通じて科学的エージェントを評価するベンチマークであるEarthVerseを紹介する。
エージェントは異種イベントパッケージを検査し、互換性のあるエビデンスを選択し、透過的な計算を実行し、ソース差を調整し、最終回答で証明を保存する。
システム全体では、平均回答ユニットの精度は84.65%であり、最も高いStrict@95は34.81%である。
論文 参考訳(メタデータ) (2026-08-24T17:29:16Z) - CAi Copilot: Reducing Operational Workload in Molecular Design through Intent-Driven Agentic Workflows [13.08147687719993]
初期分子設計は分子生成のタスクではない。
研究者は幅広い目標を設計戦略に転換し、候補を洗練させ、多くの特性を評価し、合成と試験の前に証拠を収集する。
AIメソッドは、分子を生成し、いくつかの目標を最適化し、特性を予測し、ドック化合物を合成する。
本稿では,3つの連結層を持つ専門家指向エージェントであるCAi Copilotを紹介する。
論文 参考訳(メタデータ) (2026-08-07T08:36:59Z) - ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research [142.29356526274387]
我々は自律的な科学的研究を評価するためのベンチマークであるResearchClawBenchを紹介する。
各タスクは、実際の論文に基づき、関連する文献や生データを提供し、評価中に対象の論文を隠蔽する。
論文 参考訳(メタデータ) (2026-05-28T16:27:40Z) - ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence [57.37494162084001]
チェーン・オブ・エビデンス(Chain-of-Evidence, CoE)は、すべてのクレームがエビデンス・ソースにトレース可能であることを要求する検証可能なフレームワークである。
CoE Auditはポストホック監査であり、スコア検証、仕様違反、参照検証、メソッドコードアライメントという4つの整合性チェックが全システムに均一に適用される。
論文 参考訳(メタデータ) (2026-05-25T21:30:27Z) - EnactToM: An Evolving Benchmark for Functional Theory of Mind in Embodied Agents [75.01735520608075]
既存のベンチマークは、直観的信念を問うことで、主にリテラル・オブ・マインド(ToM)をテストする。
EnactToMは, 3D 家庭で設定された300個のマルチエージェントタスクの進化ベンチマークである。
ハードスプリットでは、7つの評価されたフロンティアモデルすべてが機能的なタスク完了時に0.0%のPass3を獲得し、リテラルな信念プローブでは平均45.0%であった。
論文 参考訳(メタデータ) (2026-05-11T00:04:19Z) - BioResearcher: Scenario-Guided Multi-Agent for Translational Medicine [1.497336135403194]
Ingenix BioResearcherはシナリオ誘導型マルチエージェントシステムで、クエリをバージョン管理されたリサーチプレイブックにマップする。
バイオリサーバーは, 単位レベルの能力, オープンエンドなバイオメディカル推論, エンドツーエンドの臨床発見にわたって評価した。
論文 参考訳(メタデータ) (2026-05-07T10:33:43Z) - COMPOSITE-Stem [32.17652486099204]
COMPOSITE-STEMは、物理学、生物学、化学、数学における70の専門的なタスクのベンチマークである。
我々のベンチマークでは、正確なマッチンググレーティングとクレーターベースのルーリックとアズ・ア・ジャイグリーグレーディングプロトコルを組み合わせる。
トップパフォーマンスモデルは21%を実現し、ComposITE-STEMが現在のエージェントリーチを超える能力をキャプチャすることを示した。
論文 参考訳(メタデータ) (2026-04-10T19:08:50Z) - PRBench: End-to-end Paper Reproduction in Physics Research [32.672534450424386]
PRBenchは、11のサブフィールドにまたがる30の専門家によるタスクのベンチマークである。
エージェントは、タスク命令と紙の内容のみを提供し、サンドボックス実行環境で動作させる。
PRBench上の符号化エージェントのセットを評価し,科学的推論と実行の重要な側面にわたってそれらの能力を分析する。
論文 参考訳(メタデータ) (2026-03-29T11:44:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。