論文の概要: From Scientific Observations to Mechanisms: Benchmarking Hypothesis Generation by AI Scientists
- arxiv url: http://arxiv.org/abs/2610.05197v1
- Date: Sun, 04 Oct 2026 13:10:47 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:34:42.334954
- Title: From Scientific Observations to Mechanisms: Benchmarking Hypothesis Generation by AI Scientists
- Title(参考訳): 科学的観察からメカニズムへ:AI科学者による仮説生成のベンチマーク
- Abstract要約: MechHypoBenchは、AIエージェントとAI科学者が経験データから機械的仮説を生成できるかどうかを評価するためのベンチマークである。
14の科学分野から得られた紙由来のメカニズムと、1798万のレコードを含む実世界のデータセットを組み合わせる。
本研究では, 既知条件下での結果を通じて, 開形式力学仮説を評価するための評価フレームワークを開発する。
- 参考スコア(独自算出の注目度): 32.00874895246519
- License:
- Abstract: Data-driven mechanistic hypotheses are essential to scientific discovery because they explain how underlying processes produce observed phenomena. AI agents and AI scientists increasingly support scientific data analysis. However, their ability to turn empirical findings into mechanistic hypotheses remains insufficiently examined. To address this gap, we introduce MechHypoBench, the first benchmark for evaluating whether AI agents and AI scientists can generate such hypotheses from empirical data. It combines paper-derived mechanisms from 14 scientific fields with real-world datasets containing 17.98 million records. The construction retains the observational complexity of empirical data while providing a specified underlying mechanism. Agents analyze the observations and propose open-form hypotheses. We develop an evaluation framework that assesses open-form mechanistic hypotheses through their consequences under withheld conditions. Experiments with general agents and AI scientists reveal a substantial gap between generated hypotheses and the underlying mechanisms.
- Abstract(参考訳): データ駆動力学仮説は、基礎となるプロセスが観測された現象をいかに生み出すかを説明するため、科学的発見に不可欠である。
AIエージェントとAI科学者は、科学データ分析をますます支援している。
しかし, 経験的知見を機械的仮説に変換する能力は, 十分に検証されていない。
このギャップに対処するために、AIエージェントとAI科学者が経験的なデータからそのような仮説を生成できるかどうかを評価する最初のベンチマークであるMechHypoBenchを紹介します。
14の科学分野から得られた紙由来のメカニズムと、1798万のレコードを含む実世界のデータセットを組み合わせる。
この構造は、特定の基盤メカニズムを提供しながら、経験データの観察上の複雑さを保っている。
エージェントは観察を分析し、オープンフォーム仮説を提案する。
本研究では, 既知条件下での結果を通じて, 開形式力学仮説を評価するための評価フレームワークを開発する。
一般エージェントとAI科学者による実験は、生成された仮説と基礎となるメカニズムの間にかなりのギャップがあることを明らかにする。
関連論文リスト
- EurekaBench: Measuring Agentic Ability to Discover New Scientific Insights [47.46722795942494]
EurekaBenchは、AIエージェントが長期実験を行う能力をテストするベンチマークである。
ユーレカベンチには、神経科学、コンピュータ科学、化学、天体物理学、地球物理学、プラズマ物理学にまたがる26のロングホライゾンタスクの専門家による検証済みのセットが含まれている。
我々はこれらのメカニズムを、それらから導出できる科学的知見によって評価する。
論文 参考訳(メタデータ) (2026-09-30T18:00:51Z) - EvoSCM: Scientific Belief Revision Through Causal Model Evolution and Experimentation [68.80901568810616]
EvoSCMは、新しい証拠が収集されるにつれて進化する明確な構造因果モデルを持つ科学エージェントを装備することを目的としている。
EvoSCM onPhysicsはエージェントが実験を通して非標準物理世界の隠れたダイナミクスを明らかにするのに必要なベンチマークである。
論文 参考訳(メタデータ) (2026-09-01T16:55:56Z) - Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence [114.82582862454052]
メカニスト(Mechanist)は、AIを科学機器として利用し、AIインテリジェンスの基礎となるメカニズムを自律的に発見するエージェントシステムである。
Claude Codeや既存のAI科学者システムと比較すると、Mechanistはより価値のあるメカニズムを生み出し、実験をより確実に実行する。
論文 参考訳(メタデータ) (2026-08-12T13:19:42Z) - Toward Auditable AI Scientists: A Hypothesis Evolution Protocol for LLM Agents [0.42970700836450476]
大規模言語モデル(LLM)エージェントは、AIによる科学的発見において、ますます中心的な役割を果たすことが期待されている。
本稿では、仮説生成、評価、進化を明示的で監査可能な操作として提供するエージェントハーネスである仮説進化プロトコル(HEP)を提案する。
材料科学研究タスクにおいて、HEPを組み込んだエージェントは、計画的なエージェントが欠如している仮説-テスト-エビデンス-ビリーフサイクルを運用し、研究課題を一般化し、基礎LLMがより有能になるにつれてプロトコルをより完全に活用する。
論文 参考訳(メタデータ) (2026-07-10T08:39:30Z) - Embodied Science: Closing the Discovery Loop with Agentic Embodied AI [73.54118756665221]
我々は、科学的発見をクローズドループとして再編成し、エージェント推論と物理的実行を密結合するパラダイムであるエンボディド・サイエンスを論じる。
本研究では,実験環境の知覚,科学的知識の推論,身体的介入の実行,その後の探索を促進するための成果の内在化といった,統合された知覚・言語・行動発見(PLAD)フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-20T09:20:12Z) - Virtuous Machines: Towards Artificial General Science [0.0]
ドメインに依存しないエージェント型AIシステムが、科学的なワークフローを独立してナビゲートできることを示します。
このシステムは視覚的作業記憶、精神的な回転、イメージの鮮明さに関する3つの心理学的研究を自律的に設計し実行した。
論文 参考訳(メタデータ) (2025-08-19T00:35:56Z) - BioDSA-1K: Benchmarking Data Science Agents for Biomedical Research [29.469867701731374]
BioDSA-1Kは1029の仮説中心のタスクと1,177の分析計画からなる。
このベンチマークは,(1)仮説決定精度,(2)証拠と結論の整合性,(3)推論過程の正しさ,(4)AI生成解析コードの実行可能性の4つの軸に沿った評価を可能にする。
論文 参考訳(メタデータ) (2025-05-22T01:02:21Z) - Leveraging large language models for nano synthesis mechanism explanation: solid foundations or mere conjectures? [12.874860522120326]
我々は,金ナノ粒子合成のメカニズムに着目した775個の多重選択質問からなるベンチマークを開発した。
そこで我々は,評価基準である信頼度に基づくスコア(cスコア)を提案し,出力ロジットを探索し,正解の正確な確率を導出する。
論文 参考訳(メタデータ) (2024-07-12T02:05:59Z) - Large Language Models for Automated Open-domain Scientific Hypotheses Discovery [50.40483334131271]
本研究は,社会科学の学術的仮説発見のための最初のデータセットを提案する。
従来のデータセットとは異なり、新しいデータセットには、(1)オープンドメインデータ(RAW Webコーパス)を観察として使用すること、(2)人間性にさらに新しい仮説を提案することが必要である。
パフォーマンス向上のための3つのフィードバック機構を含む,タスクのためのマルチモジュールフレームワークが開発されている。
論文 参考訳(メタデータ) (2023-09-06T05:19:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。