論文の概要: Science sandboxes measure the scientific capability of AI agents
- arxiv url: http://arxiv.org/abs/2608.30165v1
- Date: Mon, 31 Aug 2026 02:33:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.201787
- Title: Science sandboxes measure the scientific capability of AI agents
- Title(参考訳): 科学サンドボックスはAIエージェントの科学的能力を測定する
- Abstract要約: AIエージェントでこの能力を研究するためのフレームワークであるScience Sandboxを紹介します。
我々はこの枠組みを、規制ゲノム学のモデルとタンパク質の適合性予測の2つの生物学的設定でインスタンス化する。
特に、彼らの科学的推論は、ルールがよく知られた生物学的先行概念の外に落ちているシステムに遭遇した時に悪化した。
- 参考スコア(独自算出の注目度): 1.1846810006828092
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Scientific progress depends not only on finding solutions, but on learning the rules that explain why they work and using that understanding to design better experiments. We introduce science sandboxes, a framework for studying this capability in AI agents through repeated cycles of experimentation, feedback, and hypothesis revision. Science sandboxes invite an agent to query the natural world in different ways, ranging from "wet" physical experiments, to "damp" predictive models trained on empirical data, to "dry" invented rules. By establishing a common experimental loop and a protocol for evaluating agents within it, science sandboxes allow assessment of both quantitative performance on specific metrics and qualitative scientific reasoning, across a spectrum of empirical verifiability. Here, we instantiate this framework in two biological settings, models of regulatory genomics and protein fitness prediction, and examine the capabilities of frontier agents. Across these settings, we could see when agents successfully optimized a quantitative metric without understanding the rules underlying the system. In particular, their scientific reasoning deteriorated when they encountered systems whose rules fell outside familiar biological priors. By highlighting such failure modes, science sandboxes make the frontier of scientific capability measurable and provide a controlled setting in which to study and ultimately expand it.
- Abstract(参考訳): 科学的進歩は、解決策を見つけることだけでなく、それらがなぜ機能するのかを説明するルールを学び、その理解を使ってより良い実験を設計することにも依存する。
我々は、実験、フィードバック、仮説修正の繰り返しを通じて、AIエージェントでこの能力を研究するためのフレームワークである科学サンドボックスを紹介する。
科学サンドボックスは、エージェントに「湿った」物理実験から「湿った」予測モデル、経験的なデータで訓練された「湿った」予測モデル、発明されたルールを「乾いた」まで、様々な方法で自然界に問い合わせるよう促す。
共通の実験ループとエージェントの評価プロトコルを確立することで、科学サンドボックスは、特定のメトリクスに対する定量的なパフォーマンスと質的な科学的推論の両方を、経験的妥当性のスペクトルにわたって評価することができる。
ここでは,この枠組みを,規制ゲノム学モデルとタンパク質適合度予測モデルという2つの生物学的設定でインスタンス化し,フロンティアエージェントの能力について検討する。
これらの設定全体で、エージェントがシステムの基盤となるルールを理解せずに、定量的な測定値の最適化に成功したことが分かる。
特に、彼らの科学的推論は、ルールがよく知られた生物学的先行概念の外に落ちているシステムに遭遇した時に悪化した。
このような障害モードを強調することで、科学サンドボックスは科学能力のフロンティアを計測可能とし、それを研究し、最終的に拡張するための制御された設定を提供する。
関連論文リスト
- Embodied Science: Closing the Discovery Loop with Agentic Embodied AI [73.54118756665221]
我々は、科学的発見をクローズドループとして再編成し、エージェント推論と物理的実行を密結合するパラダイムであるエンボディド・サイエンスを論じる。
本研究では,実験環境の知覚,科学的知識の推論,身体的介入の実行,その後の探索を促進するための成果の内在化といった,統合された知覚・言語・行動発見(PLAD)フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-20T09:20:12Z) - SciIF: Benchmarking Scientific Instruction Following Towards Rigorous Scientific Intelligence [60.202862987441684]
科学的妥当性を確立する制約に厳格に固執しながら、問題を解決する能力。
具体的には,大学レベルの問題と制約の固定されたカタログをペアにすることで,この能力を評価するマルチディシプリンのベンチマークであるSciIFを紹介する。
SciIFは、解の正当性と多拘束性の両方を測定することにより、構成的推論失敗のきめ細かい診断を可能にする。
論文 参考訳(メタデータ) (2026-01-08T09:45:58Z) - Probing Scientific General Intelligence of LLMs with Scientist-Aligned Workflows [203.3527268311731]
PIM(Practical Inquiry Model)に基づく運用SGI定義を提案する。
深層研究、アイデア生成、ドライ/ウェット実験、実験推論の4つのタスクを通じて運用しています。
私たちのPIMによる定義、ワークフロー中心のベンチマーク、実証的な洞察は、真に科学的な発見に参加するAIシステムの基盤を確立します。
論文 参考訳(メタデータ) (2025-12-18T12:44:36Z) - Autonomous Agents for Scientific Discovery: Orchestrating Scientists, Language, Code, and Physics [82.55776608452017]
大規模言語モデル(LLM)は、人間の科学者、自然言語、コンピュータ言語とコード、物理学との相互作用を編成する柔軟性と汎用性を備えたフレームワークを提供する。
本稿では, LLMを基盤とした科学エージェントの展望と展望と, 科学発見のライフサイクルを変革する上でのその役割について述べる。
オープンな研究課題を特定し、より堅牢で汎用的で適応的な科学エージェントを構築するための有望な方向性を概説する。
論文 参考訳(メタデータ) (2025-10-10T22:26:26Z) - BoxingGym: Benchmarking Progress in Automated Experimental Design and Model Discovery [32.395366135636046]
実験的な設計とモデル発見を評価するための10環境のベンチマークであるBoxingGymを紹介する。
予測情報ゲイン(EIG)は,実験が生成モデルのパラメータの不確実性をどの程度低減するかを測定する情報理論量である。
GPT-4oのような現在のLLMは、実験的な設計とモデル発見の両方に苦戦している。
論文 参考訳(メタデータ) (2025-01-02T21:15:57Z) - LLM and Simulation as Bilevel Optimizers: A New Paradigm to Advance Physical Scientific Discovery [141.39722070734737]
本稿では,大規模言語モデルの知識駆動型抽象推論能力をシミュレーションの計算力で強化することを提案する。
本稿では,2段階最適化フレームワークであるSGA(Scientific Generative Agent)を紹介する。
法発見と分子設計における枠組みの有効性を実証するための実験を行った。
論文 参考訳(メタデータ) (2024-05-16T03:04:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。