論文の概要: Sound Agentic Science Requires Adversarial Experiments
- arxiv url: http://arxiv.org/abs/2604.22080v1
- Date: Thu, 23 Apr 2026 21:24:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-27 15:36:26.27048
- Title: Sound Agentic Science Requires Adversarial Experiments
- Title(参考訳): 音響エージェント科学は敵対的な実験を必要とする
- Abstract要約: 本稿では, エージェント支援による非実験的クレームを, ファルシフィケーションファーストの基準で評価することを提案する。
エージェントは、主に最も説得力のある物語を作るために使うのではなく、主張が失敗する可能性のある方法を積極的に探すために使うべきだと我々は主張する。
- 参考スコア(独自算出の注目度): 0.5156484100374058
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-based agents are rapidly being adopted for scientific data analysis, automating tasks once limited by human time and expertise. This capability is often framed as an acceleration of discovery, but it also accelerates a familiar failure mode, the rapid production of plausible, endlessly revisable analyses that are easy to generate, effectively turning hypothesis space into candidate claims supported by selectively chosen analyses, optimized for publishable positives. Unlike software, scientific knowledge is not validated by the iterative accumulation of code and post hoc statistical support. A fluent explanation or a significant result on a single dataset is not verification. Because the missing evidence is a negative space, experiments and analyses that would have falsified the claim were never run or never published. We therefore propose that non-experimental claims produced with agentic assistance be evaluated under a falsification-first standard: agents should not be used primarily to craft the most compelling narrative, but to actively search for the ways in which the claim can fail.
- Abstract(参考訳): LLMベースのエージェントは、人間の時間と専門知識によって制限されたタスクを自動化する科学データ分析に急速に採用されている。
この能力はしばしば発見の加速と見なされるが、慣れ親しんだ失敗モードを加速し、容易に生成し、仮説空間を選択的に選択された分析によって支持される候補クレームに効果的に変換し、出版可能な正に最適化する。
ソフトウェアとは異なり、科学的知識はコードの反復的な蓄積やポストホックな統計的支援によって検証されない。
単一のデータセットに対する流動的な説明や重要な結果は、検証ではない。
証拠の欠落は負の空間であるため、主張を偽造したであろう実験と分析は決して実行されなかった。
そこで我々は,エージェント支援による非実験的クレームを,ファルシフィケーション第一の基準の下で評価することを提案した。エージェントは,最も魅力的な物語を作るために,また,そのクレームが失敗する可能性のある方法を積極的に探すために,主に使用されるべきではない。
関連論文リスト
- Bringing analytic rigor to agentic AI for science: The Brain Researcher platform for neuroimaging data analysis [59.44063760362954]
本稿では、神経イメージング研究者の計算環境で動作するエージェントリサーチハーネスであるBrain Researcherを紹介する。
ベンチマークでは、Brain Researcherは7つのモデルで第1選択ツールの選択精度を70.2ポイント向上させた。
共同研究と自己進化研究において、多元的分析によって分析選択感度が明らかにされ、科学的レビューでは、承認された、認定された、修正された、ブロックされた、拒否された、または延期された。
論文 参考訳(メタデータ) (2026-08-20T11:13:27Z) - CausalGame: Benchmarking Causal Thinking of LLM Agents in Games [55.189910630332065]
CausalGameは、AI Scientistsの因果思考能力を評価するためのベンチマークである。
選択バイアス、測定エラー、隠れた共同設立者を含む14のシナリオを設計します。
最高のモデルは78-85%の分析最適値に対して68.0%しか生存できず、セッションの5-7%は因果推論するルーリックのクレジットを受け取っている。
論文 参考訳(メタデータ) (2026-07-05T13:08:51Z) - One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure Attribution [85.65263343588026]
我々は,自己修正型,自律型,接地型実験機であるSAGEを提案する。
その中核的なメカニズムであるMHFA(Multi-Hypothesis Failure Attribution)は、回復を構造的因果診断として扱う。
12のトピック、5ドメインのベンチマークでは、SAGEは基準リフレクションでメトリクスを含むアウトプットを42%から92%に増やしている。
論文 参考訳(メタデータ) (2026-06-30T10:54:16Z) - The Calibration Turn in AI-Assisted Research: A Conceptual and Methodological Framework for Evidence-Licensed Claims [0.9805949492148788]
本稿では,AI支援研究におけるエビデンスライセンスクレームの概念的枠組みを開発する。
仮説生成、モデルによる結果導出、外部検証、信条更新、クレームキャリブレーションの5つの演算子としてAI支援研究を表現している。
論文 参考訳(メタデータ) (2026-06-30T07:46:54Z) - SoundnessBench: Can Your AI Scientist Really Tell Good Research Ideas from Bad Ones? [51.154921661608675]
我々は、ICLRの投稿から再構成された1,099の機械学習研究提案のキュレートされたベンチマークであるSoundnessBenchを紹介する。
SoundnessBenchは、完全なレビュー結果の正確な予測よりも、復元可能な提案段階の音質のベンチマークとして解釈されるべきである。
論文 参考訳(メタデータ) (2026-05-28T17:57:37Z) - AI scientists produce results without reasoning scientifically [3.100302590436282]
大規模言語モデル(LLM)ベースのシステムは、科学的研究を自律的に行うためにますます多くデプロイされている。
そこで本研究では,8つの領域にまたがるLSMに基づく科学的エージェントの評価を行い,その実行と仮説に基づく調査を行った。
論文 参考訳(メタデータ) (2026-04-20T20:23:42Z) - InfiniteScienceGym: An Unbounded, Procedurally-Generated Benchmark for Scientific Analysis [19.4536238905905]
InfiniteScienceGymは、検証可能な質問応答タスクと組み合わせた、手続き的に生成された科学リポジトリのベンチマークである。
シードから、シミュレータは、現実的なディレクトリ構造、ファイル、表データを備えた自己完結型リポジトリを確定的に生成し、特権QA生成器は、正確な根拠真理で、回答可能な質問と解決できない質問の両方を生成する。
全体的な精度は45%を超えず、解決不可能な質問を認識することは依然として大きな弱点であり、強力なモデルでは単にトークンを消費するのではなく、ツールを効果的に使用する傾向にあります。
論文 参考訳(メタデータ) (2026-04-14T18:23:02Z) - CiteAudit: You Cited It, But Did You Read It? A Benchmark for Verifying Scientific References in the LLM Era [51.63024682584688]
大規模言語モデル (LLM) は新たなリスクを導入している。
本稿では,科学文献における幻覚的引用のための総合的なベンチマークおよび検出フレームワークについて紹介する。
我々のフレームワークは、精度と解釈可能性の両方において、先行手法を著しく上回っている。
論文 参考訳(メタデータ) (2026-02-26T19:17:39Z) - The Refutability Gap: Challenges in Validating Reasoning by Large Language Models [11.210425433215827]
近年の報告では、Large Language Models (LLM) は、新しい科学を導き、人間レベルの汎用知性を示す能力を達成したと主張している。
このような主張は、ポパーの難燃性の原則を満たさないため、厳密な科学的主張ではないと我々は主張する。
論文 参考訳(メタデータ) (2025-12-18T14:42:03Z) - Operationalizing Serendipity: Multi-Agent AI Workflows for Enhanced Materials Characterization with Theory-in-the-Loop [0.0]
SciLinkは、材料研究におけるセレンディピティーを運用するために設計された、オープンソースのマルチエージェント人工知能フレームワークである。
実験観察、新規性評価、理論シミュレーションの直接的な自動リンクを生成する。
本稿では,原子分解能およびハイパースペクトルデータへの応用,リアルタイムな人間専門家指導の統合能力,研究ループを閉じる能力について述べる。
論文 参考訳(メタデータ) (2025-08-07T04:59:17Z) - Prediction-Powered Causal Inferences [59.98498488132307]
予測型因果推論(PPCI)に焦点をあてる
まず, 条件付きキャリブレーションにより, 人口レベルでの有効なPPCIが保証されることを示す。
次に、実験間での十分な表現制約伝達の妥当性を導入する。
論文 参考訳(メタデータ) (2025-02-10T10:52:17Z) - To Believe or Not to Believe Your LLM [51.2579827761899]
大規模言語モデル(LLM)における不確実性定量化について検討する。
疫学的な不確実性が大きい場合にのみ確実に検出できる情報理論の指標を導出する。
定式化の利点を実証する一連の実験を行う。
論文 参考訳(メタデータ) (2024-06-04T17:58:18Z) - HypBO: Accelerating Black-Box Scientific Experiments Using Experts'
Hypotheses [0.0]
我々は、仮説の形で専門的な人間の知識を活用して、ベイズ的な探索をより早く、有望な化学空間の領域に誘導する。
提案手法はHypBOと呼ばれ, 改良された種子のサンプルを生成するために, 専門家による仮説を用いている。
論文 参考訳(メタデータ) (2023-08-22T20:59:21Z) - Generating Scientific Claims for Zero-Shot Scientific Fact Checking [54.62086027306609]
科学言語の複雑さと大量のトレーニングデータが不足しているため、自動科学的事実チェックは困難である。
科学的な文から1つ以上の原子的かつ検証可能なクレームを生成するための科学的クレーム生成を提案する。
また, バイオメディカルクレームのゼロショット事実チェックにも有用であることを示す。
論文 参考訳(メタデータ) (2022-03-24T11:29:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。