論文の概要: PHREEQC-MCQ-200: A Diagnostic Benchmark for Tool-Augmented Scientific Simulator Agents
- arxiv url: http://arxiv.org/abs/2607.00436v1
- Date: Wed, 01 Jul 2026 04:51:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.72035
- Title: PHREEQC-MCQ-200: A Diagnostic Benchmark for Tool-Augmented Scientific Simulator Agents
- Title(参考訳): PHREEQC-MCQ-200:ツール強化型科学シミュレータの診断ベンチマーク
- Abstract要約: 決定論的水-地球化学シミュレーションにおけるツール強化剤の評価のためのベンチマークであるPHREEQC-MCQ-200を紹介する。
シミュレーションアクセスは,多くの科学計算タスクにおいて,グラウンドド実行が必須であることを確認し,アグリゲート精度を大幅に向上することを示す。
科学的エージェントの評価は, 精度だけでなく, アイテムレベルの保持, 出力アクセス感度, 軌道障害, 計算チェーンの故障箇所を報告すべきである。
- 参考スコア(独自算出の注目度): 6.42941089713711
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model agents are increasingly connected to scientific software, yet it remains unclear when tool access makes scientific computation more reliable rather than merely more complex. We introduce PHREEQC-MCQ-200, a benchmark for evaluating tool-augmented agents on deterministic aqueous-geochemistry simulations. The benchmark contains 200 multiple-choice questions derived from 21 validated PHREEQC scenarios, requiring agents to construct simulator inputs, execute PHREEQC, inspect structured outputs, and commit to final answers. Across multiple frontier and mid-tier model families, simulator access substantially improves aggregate accuracy, confirming that grounded execution is necessary for many scientific-computation tasks. However, the gains are not monotonic: tool-augmented agents also lose items they answered correctly without tools, revealing regressions that average accuracy alone hides. We further show that output-access protocol matters. A table-of-contents interface can reduce token cost while preserving or improving accuracy for stronger models, but it degrades performance for mid-tier models that cannot reliably navigate structured simulator outputs. PHREEQC-MCQ-200 therefore frames scientific tool use as an end-to-end diagnostic problem rather than a simple tool-calling capability. We argue that evaluations of scientific agents should report not only accuracy, but also item-level retention, output-access sensitivity, trajectory failures, and where the computation chain breaks.
- Abstract(参考訳): 大規模言語モデルエージェントは、科学ソフトウェアにますます結びついているが、ツールアクセスが科学計算をより複雑にするのではなく、より信頼性の高いものにするかどうかは不明だ。
決定論的水-地球化学シミュレーションにおけるツール強化剤の評価のためのベンチマークであるPHREEQC-MCQ-200を紹介する。
ベンチマークには、21の検証済みPHREEQCシナリオから派生した200の多重選択質問が含まれており、エージェントはシミュレータ入力を構築し、PHREEQCを実行し、構造化された出力を検査し、最終的な回答をコミットする必要がある。
複数のフロンティアとミドル層モデルファミリにまたがって、シミュレータアクセスは集約精度を大幅に向上させ、多くの科学計算タスクに基底実行が必要であることを確認する。
ツール拡張されたエージェントは、ツールなしで正解したアイテムを失い、平均的精度だけで隠されるレグレッションを明らかにします。
さらに,出力アクセスプロトコルが重要であることを示す。
テーブル・オブ・コンテントインタフェースは、より強力なモデルの保存や精度の向上をしながらトークンコストを削減することができるが、構造化されたシミュレータ出力を確実にナビゲートできない中間層のモデルの性能を低下させる。
したがってPHREEQC-MCQ-200は、単純なツールコール機能ではなく、エンドツーエンドの診断問題として科学ツールを使用する。
科学的エージェントの評価は, 精度だけでなく, アイテムレベルの保持, 出力アクセス感度, 軌道障害, 計算チェーンの故障箇所を報告すべきである。
関連論文リスト
- Collider-Bench: Benchmarking AI Agents with Particle Physics Analysis Reproduction [0.02446672595462589]
我々は,LHC(Large Hadron Collider)から,公開論文とオープンサイエンスソフトウェアのみを用いて,言語モデルエージェントが実験分析を再現できるかどうかを評価するベンチマークであるCollind-Benchを紹介する。
したがってエージェントは、これらのギャップを埋めるために、物理的推論、ドメイン知識、試行錯誤に頼らなければならない。
以上の結果から, 平均的なエージェントが, ループ内解法を確実に打ち負かすことは不可能であることが示唆された。
論文 参考訳(メタデータ) (2026-05-13T18:00:00Z) - MDGYM: Benchmarking AI Agents on Molecular Simulations [25.37963706902467]
LAMMPSとGROMACSにまたがる169のMDシミュレーションのベンチマークであるMDGYMを紹介する。
私たちは、Claude Code、Codex、OpenHandsの3つのエージェントフレームワークを4つのLCMで評価しました。
これらの障害モードは、一般的なソフトウェアエンジニアリングベンチマークで観察されたものとは定性的に異なり、流動的なコード生成が基礎となる物理的推論に移行しないことを示している。
論文 参考訳(メタデータ) (2026-05-09T13:21:51Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - Can Coding Agents Reproduce Findings in Computational Materials Science? [49.254975563645786]
本稿では,大規模言語モデルの科学的主張を再現する能力を評価するためのベンチマークであるAutoMatを紹介する。
課題を専門とする専門家と緊密に連携することで、実際の材料科学論文からの一連の主張をキュレートし、コーディングエージェントがエンドツーエンドのワークフローを回復し実行できるかどうかを検証します。
結果、現在のLSMベースのエージェントはAutoMatの全体的な成功率を低くし、最も優れた設定は54.1%に過ぎなかった。
論文 参考訳(メタデータ) (2026-05-01T17:42:12Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - GENIUS: An Agentic AI Framework for Autonomous Design and Execution of Simulation Protocols [32.505127447635864]
GENIUSは、スマート量子ESPRESSO知識グラフと有限状態エラー回復マシンによって管理される大規模言語モデルの階層構造を融合するAIエージェントワークフローである。
GENIUSは、フリーフォームの人為的なプロンプトを検証済みの入力ファイルに変換し、295の多様なベンチマークの80%の$approxで実行し、76%が自律的に修復され、成功は指数関数的に7%のベースラインに崩壊する。
このフレームワークは、プロトコル生成、検証、修復をインテリジェントに自動化して電子構造DFTシミュレーションを民主化し、大規模なスクリーニングとICME設計ループを世界中の学界や業界に開放する。
論文 参考訳(メタデータ) (2025-12-06T11:28:35Z) - MEDIC: a network for monitoring data quality in collider experiments [0.0]
データ品質モニタリング(DQM)は、粒子物理学実験の重要なコンポーネントである。
本研究では,DQMに対するシミュレーション駆動型アプローチを提案し,データ品質方法論の研究と開発を可能にした。
本稿では,検出動作の学習とDQMタスクの実行を目的としたニューラルネットワークであるMEDICを紹介する。
論文 参考訳(メタデータ) (2025-11-22T19:53:24Z) - ToolMind Technical Report: A Large-Scale, Reasoning-Enhanced Tool-Use Dataset [43.45582911794623]
我々は,160kの合成データインスタンスを備えた高品質なツールエージェントデータセットであるToolMindを紹介した。
我々は, 高精度なターンレベルのフィルタリングを用いて, 誤りや不適切なステップを除去する。
ToolMindで微調整されたモデルは、いくつかのベンチマークでベースラインよりも大幅に改善されている。
論文 参考訳(メタデータ) (2025-11-12T13:01:23Z) - How Can Input Reformulation Improve Tool Usage Accuracy in a Complex Dynamic Environment? A Study on $τ$-bench [58.114899897566964]
マルチターンの会話環境では、大きな言語モデル(LLM)は、一貫性のある推論とドメイン固有のポリシーへの固執にしばしば苦労する。
本稿では,関連するドメインルールを付加したユーザクエリを自動的に再構成するIRMA(Input-Reformulation Multi-Agent)フレームワークを提案する。
IRMAはReAct、Function Calling、Self-Reflectionをそれぞれ16.1%、12.7%、19.1%で大きく上回っている。
論文 参考訳(メタデータ) (2025-08-28T15:57:33Z) - MCPVerse: An Expansive, Real-World Benchmark for Agentic Tool Use [72.53177559476704]
我々はエージェントツールの使用を評価するための実世界のベンチマークであるMCPVerseを紹介する。
MCPVerseは550以上の実世界の実行可能なツールを統合し、140kトークンを超える前例のないアクション空間を作成する。
私たちは最先端のLSMを3つのモード(Oracle、Standard、Max-Scale)でベンチマークしました。
論文 参考訳(メタデータ) (2025-08-22T09:47:53Z) - The Power of Resets in Online Reinforcement Learning [73.64852266145387]
ローカルシミュレータアクセス(あるいはローカルプランニング)を用いたオンライン強化学習を通してシミュレータのパワーを探求する。
カバー性が低いMPPは,Qstar$-realizabilityのみのサンプル効率で学習可能であることを示す。
ローカルシミュレーターアクセス下では, 悪名高いExogenous Block MDP問題が抽出可能であることを示す。
論文 参考訳(メタデータ) (2024-04-23T18:09:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。