論文の概要: Evidence-Informed LLM Beliefs for Continual Scientific Discovery
- arxiv url: http://arxiv.org/abs/2606.29182v1
- Date: Sun, 28 Jun 2026 04:06:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.827448
- Title: Evidence-Informed LLM Beliefs for Continual Scientific Discovery
- Title(参考訳): 科学的発見のためのエビデンスインフォームドLLMの信条
- Authors: Dhruv Agarwal, Reece Adamson, Andrew McCallum, Peter Clark, Ashish Sabharwal, Bodhisattwa Prasad Majumder,
- Abstract要約: 本稿では,元来の探索手順に対して,信念更新フィルタリングと多様性の2つの相補的な変更を導入する。
従来の発見よりも埋込みベースの検索強化世代は、最終的な後部を最も予測し、37.5%の静的仮定を刺激的であると同定する。
そして、これらの急激な報酬を避けるために検索を修正し、非定常的信念の下では驚くべき仮説を優先順位付けします。
- 参考スコア(独自算出の注目度): 66.36520571709482
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Open-ended scientific discovery with large language models (LLMs) increasingly operates as a long-horizon loop of hypothesis search and verification, where a reward signal guides which hypotheses to test next. A notable recent example is AutoDiscovery, which uses "Bayesian surprise" - the belief shift an LLM undergoes after observing evidence for a hypothesis - as both a discovery metric and a reward for search. We first observe that AutoDiscovery treats surprisal as a static quantity, while surprisal in human reasoning is non-stationary - it is defined relative to beliefs that evolve with experience, a prerequisite for continual scientific discovery. We address this mismatch with evidence-informed LLM beliefs: priors updated with evidence from previous hypotheses to compute non-stationary surprisal for new hypotheses. We compare in-context belief-updating mechanisms and find that embedding-based retrieval-augmented generation over prior discoveries best anticipates eventual posteriors, identifying 37.5% of static surprisals as spurious. We then modify search to avoid these spurious rewards and prioritize hypotheses that remain surprising under non-stationary beliefs. Concretely, we introduce two complementary changes to the original search procedure: belief-update filtering and diversity maximization. Across five discovery domains, our method increases accumulated non-stationary surprisal by 30.62% on average compared to the original search procedure, demonstrating that continual scientific discovery with LLMs requires not only better belief measurement but also search procedures that avoid redundancy and encourage diversity.
- Abstract(参考訳): 大規模言語モデル(LLM)によるオープンエンドの科学的発見は、仮説探索と検証の長い水平ループとして機能し、報酬信号が次にテストする仮説を導く。
有名な最近の例はAutoDiscovery(英語版)で、これは「ベイジアン・サプライズ (Bayesian surprise)」 - LLMが仮説の証拠を観察した後の信念シフトを発見基準と探索報酬の両方として使用している。
最初に、AutoDiscoveryは仮定を静的な量として扱うが、人間による推論の前提は非定常的であり、それは経験とともに進化する信念(連続的な科学的発見の前提条件)に対して定義される。
我々は、このミスマッチを、エビデンスにインフォームドされたLCMの信念で解決する: 以前の仮説から、新しい仮説の非定常仮定を計算するための証拠と共に更新する。
本研究は, 文脈内信念更新機構を比較し, 既往の発見よりも埋込みに基づく検索強化生成が, 最終的な後部を最も予測し, 37.5%の静的仮定が刺激的であることを確認した。
そして、これらの急激な報酬を避けるために検索を修正し、非定常的信念の下では驚くべき仮説を優先順位付けします。
具体的には,従来の探索手順に対して,信念更新フィルタリングと多様性最大化の2つの相補的な変更を導入する。
5つの発見領域にまたがって,本手法は従来の探索法と比較して平均30.62%増加し,LLMを用いた連続的な科学的発見には,より良い信念測定だけでなく,冗長性を避け,多様性を促進するための探索手順も必要であることを示した。
関連論文リスト
- Towards Diverse Scientific Hypothesis Search with Large Language Models [46.83325596046927]
仮説探索をサンプリング問題として定式化し、固定された検証予算の下で多種多様な高品質な仮説を効率的に生成することを目的とする。
分子発見,方程式発見,アルゴリズム発見を含む領域にわたって,我々のアプローチは,同じ検証予算の下で仮説の品質と多様性の両方を一貫して改善する。
論文 参考訳(メタデータ) (2026-06-09T08:52:49Z) - Failing to Falsify: Evaluating and Mitigating Confirmation Bias in Language Models [38.162539966977484]
大規模言語モデル(LLM)は、人間の心理学からの規則発見研究に適応することで、確証バイアスを示す。
LLMは確証バイアスを示し、しばしば三重項を偽造するよりも、仮説を確証するために提案する。
論文 参考訳(メタデータ) (2026-04-02T19:39:52Z) - Accelerating Social Science Research via Agentic Hypothesization and Experimentation [33.55093074029515]
ExPERIGENは、ベイズ最適化によって2相探索にインスパイアされたエンドツーエンド発見を運用するフレームワークである。
より統計的に有意な仮説が2~4倍の確率で発見され、従来の手法よりも7~17%の確率で予測できる。
LLM産生仮説の最初のA/B試験を行い, 統計的に有意な結果を示した。
論文 参考訳(メタデータ) (2026-02-08T14:20:56Z) - Bayes-Entropy Collaborative Driven Agents for Research Hypotheses Generation and Optimization [4.469102316542763]
本稿では,HypoAgentsと呼ばれるマルチエージェント協調フレームワークを提案する。
多様性のサンプリングを通じて仮説を生成し、事前の信念を確立する。
その後、外部文献の証拠収集にRAG(erieval-augmented generation)を採用している。
情報エントロピー$H = - sum p_ilog p_i$ を用いて高不確かさ仮説を特定し、それらを積極的に洗練する。
論文 参考訳(メタデータ) (2025-08-03T13:05:32Z) - Open-ended Scientific Discovery via Bayesian Surprise [63.26412847240136]
AutoDSは、ベイジアン・サプライズを用いた科学探査を駆動する、オープンエンドの科学的発見の方法である。
我々はAutoDSを、生物学、経済学、金融学、行動科学といった21の領域にまたがる実世界のデータセットにまたがるデータ駆動ディスカバリの設定で評価する。
論文 参考訳(メタデータ) (2025-06-30T22:53:59Z) - MOOSE-Chem2: Exploring LLM Limits in Fine-Grained Scientific Hypothesis Discovery via Hierarchical Search [102.11776494401705]
大規模言語モデル (LLM) は科学的仮説生成の自動化において有望であることを示している。
既存のアプローチは主に、批判的な方法論や実験的な詳細を欠いた粗粒の仮説を導出する。
我々は、科学的仮説発見の新しいタスクを導入し、正式に定義する。
論文 参考訳(メタデータ) (2025-05-25T16:13:46Z) - ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition [67.26124739345332]
大規模言語モデル(LLM)は科学的研究を支援する可能性を示しているが、高品質な研究仮説を発見する能力はいまだ検討されていない。
我々は,LLMを科学的発見のサブタスクのほぼ十分セットで評価するための,最初の大規模ベンチマークを紹介する。
学術論文から重要コンポーネント(研究質問、背景調査、インスピレーション、仮説)を抽出する自動フレームワークを開発する。
論文 参考訳(メタデータ) (2025-03-27T08:09:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。