論文の概要: When Does AI for PDEs Yield Scientific Evidence?
- arxiv url: http://arxiv.org/abs/2608.22504v1
- Date: Sun, 23 Aug 2026 16:47:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.779845
- Title: When Does AI for PDEs Yield Scientific Evidence?
- Title(参考訳): PDEのためのAIはいつ科学的証拠を得るのか?
- Authors: Wenshuo Wang,
- Abstract要約: 我々は、広く使われているPDEシミュレーションベンチマークと、PDE逆問題に対する包括的なベンチマークを拡張して、モデル出力が特定の科学的クレームをサポートするかどうかを評価できるようにする。
以上の結果から,数値的精度と明らかなサポートは,モデルが異なるランク付けが可能であり,いつ,なぜそうなるのかを説明でき,既存のベンチマークでは,科学的関心の主張に対するより弱い支持を提供する手法が好まれることが示された。
- 参考スコア(独自算出の注目度): 3.0001636668817597
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing AI-for-PDE benchmarks primarily assess models in terms of predictive or approximation accuracy. In physics research, however, AI outputs often serve as evidence for scientific claims. These two objectives are not equivalent: the former measures an output's agreement with a reference target or satisfaction of governing constraints; the latter asks whether, given a specified object of study, scientific claim, assumptions, and evidence standard, the output provides sufficient evidence for that claim. To bridge this gap, we extend a widely used PDE-simulation benchmark and a comprehensive benchmark for PDE inverse problems to enable, for the first time in AI for PDEs, evaluation of whether and to what extent model outputs support specified scientific claims. Our results show that numerical accuracy and evidential support can rank models differently, explain when and why they do so, and reveal that existing benchmarks can favor methods whose outputs provide weaker support for the scientific claims of interest. Together, we formalize, empirically demonstrate, and explain this evaluation--use mismatch in AI for PDEs.
- Abstract(参考訳): 既存のAI-for-PDEベンチマークは、主に予測または近似精度の観点からモデルを評価する。
しかし物理学研究において、AIの出力は科学的な主張の証拠として用いられることが多い。
これらの2つの目的は等価ではない: 前者は、基準目標との出力の合意を測り、後者は、特定の研究対象、科学的な主張、仮定、証拠標準が与えられた場合、その主張に対する十分な証拠を提供するかどうかを問う。
このギャップを埋めるために、広く使われているPDEシミュレーションベンチマークとPDE逆問題に対する包括的なベンチマークを拡張し、PDEのAIにおいて初めて、モデル出力が特定の科学的クレームをサポートするかどうかの評価を行う。
以上の結果から,数値的精度と明らかなサポートは,モデルが異なるランク付けが可能であり,いつ,なぜそうなるのかを説明でき,既存のベンチマークでは,科学的関心の主張に対するより弱い支持を提供する手法が好まれることが示された。
共に、PDEのためのAIにおけるこの評価-使用ミスマッチを形式化し、実証し、説明する。
関連論文リスト
- On the post-hoc Evaluation of PDE Discovery: A Multifaceted Challenge of Scientific Advancement [4.713325456998526]
偏微分方程式 (Partial differential equation, PDE) は、物理系の法則をデータから特定することを目的としている。
検出されたPDEのポストホック評価は、特に多面体化の難しさを高める。
我々はPDE評価指標の最初の分類法を提案する。
論文 参考訳(メタデータ) (2026-07-26T16:58:42Z) - Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery [95.44432473367836]
大規模言語モデル(LLM)は、事前に特定された質問に答える能力に優れるが、未解決の未解決段階をナビゲートする能力はほとんど測定されていない。
仮説探索(PHD)を導入し,不確定な証拠から,仮説空間を自律的に構築することをモデルに求める。
本稿では,6つの科学的・分析的領域にわたる988ケースのベンチマークであるHypoArenaと,オープンエンド仮説セットの評価フレームワークであるHypoEvalを紹介する。
論文 参考訳(メタデータ) (2026-07-17T08:56:43Z) - EG-VQA: Benchmarking Verifiable Video Question Answering with Grounded Temporal Evidence [48.314554375516366]
本稿では,Evidence-Grounded Video Question Answering Benchmark (EG-VQA)を紹介する。
EG-VQAは2,067本の動画と11,838本のQAペアで構成されている。
強力なプロプライエタリモデルでさえ、予測を正確に下ろすのに苦労しています。
我々は,明示的な監督によって訓練されたエビデンス基底推論モデルEG-Reasonerを提案する。
論文 参考訳(メタデータ) (2026-06-23T16:49:28Z) - Position: Anthropomorphic Misalignment Research Needs Stronger Evidence [52.76826423649968]
概念的曖昧さ,非ロバストデータセット,実験設計,不十分な因果的介入が,モデル行動の過度な解釈につながることを示す。
本研究の目的は,AMRの方法論的厳密性向上に寄与する明らかな考察のガイダンスを提供することである。
論文 参考訳(メタデータ) (2026-05-29T16:38:53Z) - SciIF: Benchmarking Scientific Instruction Following Towards Rigorous Scientific Intelligence [60.202862987441684]
科学的妥当性を確立する制約に厳格に固執しながら、問題を解決する能力。
具体的には,大学レベルの問題と制約の固定されたカタログをペアにすることで,この能力を評価するマルチディシプリンのベンチマークであるSciIFを紹介する。
SciIFは、解の正当性と多拘束性の両方を測定することにより、構成的推論失敗のきめ細かい診断を可能にする。
論文 参考訳(メタデータ) (2026-01-08T09:45:58Z) - What Does Your Benchmark Really Measure? A Framework for Robust Inference of AI Capabilities [0.773472615056109]
ベンチマークデータに対する生成モデルの評価は今や至るところで行われている。
しかし、懐疑論の高まりはその信頼性を取り巻く。
報告された正確さがモデルの性能を真に反映しているとどうやってわかるのか?
このステップは、推論として評価するための原則的なフレームワークを提案することで明確化します。
論文 参考訳(メタデータ) (2025-09-23T21:29:04Z) - Evaluating Uncertainty Quantification approaches for Neural PDEs in
scientific applications [0.0]
この研究は、科学応用におけるフォワード問題と逆問題の両方に対する様々な不確実量化(UQ)アプローチを評価する。
具体的には,ハミルトン・モンテカルロ (HMC) やモンテカルロ・ドロップアウト (MCD) などのベイズ法の有効性を検討する。
この結果から,ニューラルPDEは流れ系を効果的に再構築し,関連する未知パラメータを予測できることが示唆された。
論文 参考訳(メタデータ) (2023-11-08T04:52:20Z) - Goodhart's Law Applies to NLP's Explanation Benchmarks [57.26445915212884]
ERASER(Comprehensiveness and sufficiency)メトリクスとEVAL-X(EVAL-X)メトリクスの2つのセットを批判的に検討する。
実験結果の予測や説明を変えることなく,モデル全体の包括性と充足率を劇的に向上させることができることを示す。
我々の結果は、現在のメトリクスが説明可能性の研究をガイドする能力に疑問を呈し、これらのメトリクスが正確に捉えるものを再評価する必要性を強調します。
論文 参考訳(メタデータ) (2023-08-28T03:03:03Z) - APIK: Active Physics-Informed Kriging Model with Partial Differential
Equations [6.918364447822299]
本稿では,PDEポイントの集合を介してPDE情報を導入し,標準クリグ法と同様の後方予測を行うPDE Informed Kriging Model (PIK)を提案する。
学習性能をさらに向上させるために,PDEポイントをデザインし,PIKモデルと測定データに基づいたPDE情報を活用するアクティブPIKフレームワーク(APIK)を提案する。
論文 参考訳(メタデータ) (2020-12-22T02:31:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。