論文の概要: Probing Scientific General Intelligence of LLMs with Scientist-Aligned Workflows
- arxiv url: http://arxiv.org/abs/2512.16969v1
- Date: Thu, 18 Dec 2025 12:44:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-12-22 19:25:54.132627
- Title: Probing Scientific General Intelligence of LLMs with Scientist-Aligned Workflows
- Title(参考訳): LLMの科学的総合的知能と科学者のワークフロー
- Abstract要約: PIM(Practical Inquiry Model)に基づく運用SGI定義を提案する。
深層研究、アイデア生成、ドライ/ウェット実験、実験推論の4つのタスクを通じて運用しています。
私たちのPIMによる定義、ワークフロー中心のベンチマーク、実証的な洞察は、真に科学的な発見に参加するAIシステムの基盤を確立します。
- 参考スコア(独自算出の注目度): 203.3527268311731
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Despite advances in scientific AI, a coherent framework for Scientific General Intelligence (SGI)-the ability to autonomously conceive, investigate, and reason across scientific domains-remains lacking. We present an operational SGI definition grounded in the Practical Inquiry Model (PIM: Deliberation, Conception, Action, Perception) and operationalize it via four scientist-aligned tasks: deep research, idea generation, dry/wet experiments, and experimental reasoning. SGI-Bench comprises over 1,000 expert-curated, cross-disciplinary samples inspired by Science's 125 Big Questions, enabling systematic evaluation of state-of-the-art LLMs. Results reveal gaps: low exact match (10--20%) in deep research despite step-level alignment; ideas lacking feasibility and detail; high code executability but low execution result accuracy in dry experiments; low sequence fidelity in wet protocols; and persistent multimodal comparative-reasoning challenges. We further introduce Test-Time Reinforcement Learning (TTRL), which optimizes retrieval-augmented novelty rewards at inference, enhancing hypothesis novelty without reference answer. Together, our PIM-grounded definition, workflow-centric benchmark, and empirical insights establish a foundation for AI systems that genuinely participate in scientific discovery.
- Abstract(参考訳): 科学AIの進歩にもかかわらず、科学汎用知能(SGI)のコヒーレントな枠組みは、科学領域に欠けているものを自律的に認識し、調査し、理由づけする能力である。
本稿では,PIM(Deliberation, Conception, Action, Perception)に基づく運用SGI定義を提案し,深層研究,アイデア生成,乾燥・湿潤実験,実験推論の4つの課題を通じて運用する。
SGI-Benchは、Scienceの125 Big Questionsにインスパイアされた1000以上の専門的な学際的なサンプルで構成されており、最先端のLCMの体系的な評価を可能にしている。
その結果、ステップレベルのアライメントにもかかわらず、ディープリサーチにおける低精度マッチ(10-20%)、実現可能性と詳細性の欠如、高いコード実行性を持つが、ドライ実験では実行結果の精度が低いこと、ウェットプロトコルにおける低シーケンスの忠実さ、永続的なマルチモーダル比較の課題が明らかになった。
さらに,TTRL(Test-Time Reinforcement Learning)を導入し,推論時の新規性報酬の検索を最適化し,参照応答なしで仮説の新規性を高める。
私たちのPIMによる定義、ワークフロー中心のベンチマーク、実証的な洞察とともに、真に科学的な発見に参加するAIシステムの基盤を確立します。
関連論文リスト
- SciExplore: Evaluating Autonomous Agents from Scientific Navigation to Information Integration [46.64739473662869]
LLMとエージェントの科学的情報探索と推論能力を評価するためのベンチマークであるSciExploreを紹介する。
SciExploreは10以上の科学分野にわたる103の専門的なタスクをカバーする4つのタスクタイプで構成されている。
我々はSciExplore上で10以上の最先端のLCMと自律エージェントを評価し、タスクの複雑さが増加し、最も困難な構造化タスクにおいて極めて低い精度で処理性能が著しく低下することを示す。
論文 参考訳(メタデータ) (2026-07-23T05:17:00Z) - PRL-Bench: A Comprehensive Benchmark Evaluating LLMs' Capabilities in Frontier Physics Research [43.71141859083647]
PRL-Benchは、エンドツーエンドの物理研究を実行するためのベンチマークである。
天体物理学、凝縮物質物理学、高エネルギー物理学、量子情報、統計物理学をカバーしている。
ベンチマークの各タスクは、真の科学研究のコア特性を再現するように設計されている。
論文 参考訳(メタデータ) (2026-04-16T16:22:04Z) - Evaluating Large Language Models in Scientific Discovery [91.732562776782]
大規模言語モデル (LLMs) は科学研究にますます応用されてきているが、科学ベンチマークでは非文脈化された知識を探索している。
生物, 化学, 材料, 物理にまたがるLSMを評価するシナリオグラウンドベンチマークを提案する。
このフレームワークは、(i)シナリオタイドアイテムの質問レベル精度と(ii)プロジェクトレベルのパフォーマンスの2つのレベルでモデルを評価する。
論文 参考訳(メタデータ) (2025-12-17T16:20:03Z) - HARPA: A Testability-Driven, Literature-Grounded Framework for Research Ideation [29.9491787481972]
HARPAは科学的文献で実証可能な仮説を生成するためのツールである。
評価の結果,HARPAが生成する仮説駆動型研究提案は,強力なベースラインAI-Researcherと相容れない性能を示した。
ASDエージェント(CodeScientist)でテストすると、HARPAはより成功した実行(40のうち20対11)と少ない障害(16対21対40)を生み出した。
論文 参考訳(メタデータ) (2025-10-01T07:52:19Z) - Demystifying Scientific Problem-Solving in LLMs by Probing Knowledge and Reasoning [53.82037883518254]
SciReasは、科学的推論タスクのための様々なベンチマークスイートである。
次に、科学的タスクにおける推論と知識の異なる役割を研究するための探索フレームワークであるKRUXを提案する。
論文 参考訳(メタデータ) (2025-08-26T17:04:23Z) - Operationalizing Serendipity: Multi-Agent AI Workflows for Enhanced Materials Characterization with Theory-in-the-Loop [0.0]
SciLinkは、材料研究におけるセレンディピティーを運用するために設計された、オープンソースのマルチエージェント人工知能フレームワークである。
実験観察、新規性評価、理論シミュレーションの直接的な自動リンクを生成する。
本稿では,原子分解能およびハイパースペクトルデータへの応用,リアルタイムな人間専門家指導の統合能力,研究ループを閉じる能力について述べる。
論文 参考訳(メタデータ) (2025-08-07T04:59:17Z) - ScienceBoard: Evaluating Multimodal Autonomous Agents in Realistic Scientific Workflows [82.07367406991678]
大規模言語モデル(LLM)は自然言語処理を超えてその影響を拡大している。
これらのうち、コンピュータ利用エージェントは、人間がしているようにオペレーティングシステムと対話することができる。
我々はScienceBoardを紹介し、ダイナミックで視覚的にリッチな科学ソフトウェアを特徴とする現実的でマルチドメイン環境を包含する。
論文 参考訳(メタデータ) (2025-05-26T12:27:27Z) - ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition [67.26124739345332]
大規模言語モデル(LLM)は科学的研究を支援する可能性を示しているが、高品質な研究仮説を発見する能力はいまだ検討されていない。
我々は,LLMを科学的発見のサブタスクのほぼ十分セットで評価するための,最初の大規模ベンチマークを紹介する。
学術論文から重要コンポーネント(研究質問、背景調査、インスピレーション、仮説)を抽出する自動フレームワークを開発する。
論文 参考訳(メタデータ) (2025-03-27T08:09:15Z) - LLM and Simulation as Bilevel Optimizers: A New Paradigm to Advance Physical Scientific Discovery [141.39722070734737]
本稿では,大規模言語モデルの知識駆動型抽象推論能力をシミュレーションの計算力で強化することを提案する。
本稿では,2段階最適化フレームワークであるSGA(Scientific Generative Agent)を紹介する。
法発見と分子設計における枠組みの有効性を実証するための実験を行った。
論文 参考訳(メタデータ) (2024-05-16T03:04:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。