論文の概要: Can LLMs Discover Scientific Laws in Real and Parallel Worlds?
- arxiv url: http://arxiv.org/abs/2609.01552v1
- Date: Tue, 01 Sep 2026 17:17:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.89074
- Title: Can LLMs Discover Scientific Laws in Real and Parallel Worlds?
- Title(参考訳): LLMは現実と並列の世界で科学的法則を発見できるのか?
- Authors: Yiming Huang, Ziche Liu, Zhuohang Wu, Yiqian Wang, Junxia Cui, Xinkai Zou, Linjun Mao, Nan Huang, Naicheng Yu, Kaijie Zhu, Yue Ma, Kun Zhou, Letian Peng, Jingbo Shang,
- Abstract要約: SCILAWS-BENCHは、公表された研究と実際の科学データから構築された科学法発見のためのベンチマークである。
381の科学論文から118の問題を抽出し、291の法則と6つの科学分野にわたる800万の実際のデータポイントをカバーしている。
予測適合性は、科学的妥当性から分岐し、モデルが公表された公式を再現するか、移動するかを記憶する形に変化し、我々のベスト・オブ・N研究は選択ボトルネックを明らかにした。
- 参考スコア(独自算出の注目度): 58.76147897928744
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Scientific equation discovery has long been central to scientific progress, proceeding through iterative cycles of hypothesis generation, observational testing, and refinement under scientific constraints. As LLM capabilities advance and their role in AI for Science expands, it remains an open problem whether they can genuinely discover scientific laws and how this ability should be evaluated. Existing evaluations, however, often either simplify discovery through synthetic settings or reuse published targets that may already be familiar to LLMs. We therefore introduce SCILAWS-BENCH, a benchmark for scientific law discovery built from published research and real scientific data. It comprises 118 problems drawn from 381 scientific papers, covering 291 candidate laws and roughly 8M real data points across six scientific disciplines. Each problem is instantiated in two complementary settings: (1) SCILAWS-REAL asks models to propose laws from fixed real observations and evaluates held-out predictive fit and scientific validity derived from the source literature, and (2) SCILAWS-PARALLEL asks models to actively query residual-calibrated worlds and recover synthesized hidden laws derived from published forms. This two-setting task design preserves each problem's scientific context while separately evaluating fixed-record law discovery and active recovery of a newly synthesized hidden law. We find that predictive fit can diverge from scientific validity, memorization shapes whether models reproduce or move beyond published formulas, and our best-of-N study reveals a selection bottleneck. Our work provides a paper-grounded benchmark and new empirical perspectives for evaluating AI for scientific discovery. Project page: https://yiyihum.github.io/SciLaws-Bench
- Abstract(参考訳): 科学的方程式の発見は長い間科学的進歩の中心であり、仮説の生成、観察試験、科学的制約の下での洗練を繰り返してきた。
LLMの能力が進歩し、AI for Scienceにおけるその役割が拡大するにつれ、科学法則を真に発見できるかどうか、その能力がどのように評価されるべきなのかは、未解決の問題のままである。
しかし、既存の評価は、しばしば合成設定による発見を単純化するか、既にLLMに精通している可能性のある公開ターゲットを再利用する。
SCILAWS-BENCHは、公表された研究と実際の科学データから構築された科学法発見のためのベンチマークである。
381の科学論文から118の問題を抽出し、291の法則と6つの科学分野にわたる800万の実際のデータポイントをカバーしている。
1 SCILAWS-REAL は、固定された実測から法則を提示するようモデルに求め、元の文献から得られた予測適合性および科学的妥当性を評価し、(2) SCILAWS-PARALLEL は、残差校正された世界を積極的にクエリし、出版された形式から合成された隠れた法則を復元するようモデルに求める。
この2つのタスクデザインは、各問題の科学的文脈を保存しつつ、新たに合成された隠れた法律の固定記録法発見とアクティブリカバリを別々に評価する。
予測適合性は、科学的妥当性から分岐し、モデルが公表された公式を再現するか、移動するかを記憶する形に変化し、我々のベスト・オブ・N研究は選択ボトルネックを明らかにした。
我々の研究は、科学的な発見のためにAIを評価するための、ペーパーグラウンドのベンチマークと、新しい実証的な視点を提供する。
プロジェクトページ:https://yiihum.github.io/SciLaws-Bench
関連論文リスト
- Probing Scientific General Intelligence of LLMs with Scientist-Aligned Workflows [203.3527268311731]
PIM(Practical Inquiry Model)に基づく運用SGI定義を提案する。
深層研究、アイデア生成、ドライ/ウェット実験、実験推論の4つのタスクを通じて運用しています。
私たちのPIMによる定義、ワークフロー中心のベンチマーク、実証的な洞察は、真に科学的な発見に参加するAIシステムの基盤を確立します。
論文 参考訳(メタデータ) (2025-12-18T12:44:36Z) - Advancing the Scientific Method with Large Language Models: From Hypothesis to Discovery [35.888956949646]
大規模言語モデル (LLM) は科学的方法を変えて科学的研究を変革している。
LLMは、特に化学や生物学において、実験的な設計、データ分析、生産性の向上に関与している。
AI駆動科学への移行は、創造性、監視、責任に関する倫理的な疑問を提起する。
論文 参考訳(メタデータ) (2025-05-22T10:05:48Z) - BoxingGym: Benchmarking Progress in Automated Experimental Design and Model Discovery [32.395366135636046]
実験的な設計とモデル発見を評価するための10環境のベンチマークであるBoxingGymを紹介する。
予測情報ゲイン(EIG)は,実験が生成モデルのパラメータの不確実性をどの程度低減するかを測定する情報理論量である。
GPT-4oのような現在のLLMは、実験的な設計とモデル発見の両方に苦戦している。
論文 参考訳(メタデータ) (2025-01-02T21:15:57Z) - A Comprehensive Survey of Scientific Large Language Models and Their Applications in Scientific Discovery [68.48094108571432]
大規模言語モデル(LLM)は、テキストやその他のデータ処理方法に革命をもたらした。
我々は,科学LLM間のクロスフィールドおよびクロスモーダル接続を明らかにすることで,研究ランドスケープのより総合的なビューを提供することを目指している。
論文 参考訳(メタデータ) (2024-06-16T08:03:24Z) - Large Language Models are Zero Shot Hypothesis Proposers [17.612235393984744]
大規模言語モデル(LLM)は、情報障壁を断ち切ることを約束する、グローバルかつ学際的な知識の豊富なものである。
バイオメディカル文献から背景知識と仮説ペアからなるデータセットを構築した。
ゼロショット, 少数ショット, 微調整設定において, 最上位モデルの仮説生成能力を評価する。
論文 参考訳(メタデータ) (2023-11-10T10:03:49Z) - Can Large Language Models Discern Evidence for Scientific Hypotheses? Case Studies in the Social Sciences [3.9985385067438344]
強い仮説は、既存の証拠に基づく最良の推理であり、関連する文献の包括的な見解によって知らされる。
毎年発行される科学論文の数が指数関数的に増加すると、ある仮説に関連する証拠の手作業による集約と合成は困難である。
我々は,社会科学における研究のコミュニティ主導のアノテーションを用いた科学的仮説の課題のための新しいデータセットを共有する。
論文 参考訳(メタデータ) (2023-09-07T04:15:17Z) - Large Language Models for Automated Open-domain Scientific Hypotheses Discovery [50.40483334131271]
本研究は,社会科学の学術的仮説発見のための最初のデータセットを提案する。
従来のデータセットとは異なり、新しいデータセットには、(1)オープンドメインデータ(RAW Webコーパス)を観察として使用すること、(2)人間性にさらに新しい仮説を提案することが必要である。
パフォーマンス向上のための3つのフィードバック機構を含む,タスクのためのマルチモジュールフレームワークが開発されている。
論文 参考訳(メタデータ) (2023-09-06T05:19:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。