EarthVerse: Benchmarking Scientific Agents Across Dynamic Earth Systems and Natural Hazards
Abstractの概要
EarthVerseは、動的な地球システムや自然災害に関するマルチソース調査を実行する科学エージェントを評価するために設計されたベンチマークです。19のハザード分類にわたる199件の記録された過去のイベントに基づく405件の再現可能なタスクで構成されており、エージェントは複数ファイルからなるイベントパッケージを探索し、矛盾するデータソースを調整し、計算を実行し、証拠の出所を記録する必要があります。評価フレームワークは、きめ細かな回答ユニットとプロセスルーブリックを組み合わせることで、回答の正確性とそれを裏付ける調査軌跡の両方を評価します。標準化されたプロトコル下で25種類のモデルおよびエージェント構成を評価した結果、証拠の特定、ツールの使用、推論、およびマルチステップの科学的実行における主要な失敗パターンが明らかになりました。
新規性
EarthVerseは、異種混合かつマルチソースのイベントパッケージ全体において、主張と証拠の連鎖を発見、調整、維持するエージェントの能力を評価するエンドツーエンドのベンチマークを導入しています。精選された観測データや指定されたデータレイヤーをあらかじめ提供する既存の地球科学ベンチマークとは異なり、EarthVerseではエージェントが自律的に関連レコードを特定し、マルチソース間の不整合に対処することが求められます。
成果
評価された25のシステム全体で、最高の平均回答ユニット正解率は84.65%に達したものの、最も高いStrict@95信頼性はわずか34.81%にとどまり、部分的なステップの能力と完全な調査完了との間に大きなギャップがあることが浮き彫りになりました。制御された介入実験により証拠の特定が主要な性能ボトルネックであることが特定され、関連ファイルおよび証拠マップのオラクルを提供した場合にのみ統計的に有意なCoreスコアの向上(それぞれ+14.72ポイントおよび+11.34ポイント)が得られました。
論文の注目点
- EarthVerseは、19のハザード分類にわたる199件の実ハザードイベントに基づく、405件のパッケージスコープの再現可能な調査タスクからなるベンチマークを確立しています。
- この評価フレームワークは、厳格なツールパスを強制することなく主張と証拠の一貫性を評価するため、きめ細かな科学的回答ユニットと調査軌跡を統合してスコアリングします。
- 25のシステムにわたる実証結果は、現在のモデルが個別のサブタスクを頻繁に解決できる一方でエンドツーエンドの信頼性には苦慮しており、証拠の特定が主要なボトルネックとなっていることを示しています。