論文の概要: FirstResearch: Auditable Question Formation for LLM Scientific Discovery Agents
- arxiv url: http://arxiv.org/abs/2607.05682v1
- Date: Mon, 06 Jul 2026 22:52:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.346922
- Title: FirstResearch: Auditable Question Formation for LLM Scientific Discovery Agents
- Title(参考訳): FirstResearch: LLMの科学的発見エージェントに対する監査可能な質問形成
- Abstract要約: FirstResearch(ファーストリサーチ)は、科学的なLLMエージェントのための第1原理のリサーチクエストフォーメーションフレームワークである。
証明書は、プリミティブ定義、仮定、メカニズムモデル、緊張または矛盾、偽造可能な仮説、最小限の決定テスト、障害更新ルールを記録します。
- 参考スコア(独自算出の注目度): 2.921159958223653
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM systems for scientific discovery increasingly assist with ideation, literature synthesis, experiment planning, and report generation, but the first research question they propose can remain difficult to audit: it may sound plausible without exposing the mechanism, falsifier, or assumption that a scientist should inspect. We introduce FirstResearch, a first-principles research-question formation framework for scientific LLM agents whose core artifact is a structured Research Question Certificate. The certificate records primitive definitions, assumptions, a mechanism model, a tension or contradiction, a falsifiable hypothesis, a minimal decisive test, and a failure update rule, making the proposed question inspectable before downstream execution. On ten LLM-agent research topics, FirstResearch outperforms controlled prompt-level baselines inspired by AI co-scientist, Agent Laboratory, and AI Scientist-v2 under a primary DeepSeek-blind-judge protocol. A Gemini-2.5-Flash independent-judge rescore of the same 40 baseline packages preserves the system-level ranking, with FirstResearch scoring 4.86/5 versus 4.38/5 for the strongest baseline and Pearson agreement of 0.865 on average score. A one-repeat ablation checkpoint further suggests that the certificate-centered core is the strongest component: certificate-only scoring reaches 4.90/5 under DeepSeek and 4.88/5 under Gemini, while removing certificates drops below 1/5 under both judges. These results are preliminary and use LLM judges rather than human domain experts, but they support a narrow scientific-discovery claim: explicit derivation constraints are a promising mechanism for making LLM-generated scientific questions more auditable. Code, prompts, saved outputs, and reproduction scripts are available at https://github.com/louiswang524/FirstResearch.
- Abstract(参考訳): 科学的発見のためのLLMシステムは、アイデア、文献合成、実験計画、レポート生成をますます支援するが、彼らが提案する最初の研究課題は、検査が困難である。
FirstResearchは、構造化された研究質問証明書である科学LLMエージェントのための、第一原理的な研究探求形成フレームワークである。
証明書は、プリミティブ定義、仮定、メカニズムモデル、緊張または矛盾、偽装可能な仮説、最小限の決定テスト、失敗更新ルールを記録し、提案された質問を下流実行前に検査可能にする。
10のLDMエージェント研究トピックにおいて、FirstResearchは、DeepSeek-blind-judgeプロトコルの下で、AIの共同科学者、エージェントラボ、AI Scientist-v2にインスパイアされた、プロンプトレベルのベースラインを上回ります。
同じ40のベースラインパッケージのGemini-2.5-Flash独立審査スコアはシステムレベルランキングを維持しており、FirstResearchは最強ベースラインで4.86/5、Pearsonは0.865で4.38/5と評価されている。
証明書のみのスコアはDeepSeekで4.90/5、Geminiで4.88/5、そして両方の審査員で1/5未満の証明書を削除している。
これらの結果は予備的であり、人間の領域の専門家ではなくLLMの審査員が用いられるが、それらは狭い科学的発見の主張を支持している: 明示的な導出制約は、LLMの生成した科学的質問をより監査しやすいものにするための有望なメカニズムである。
コード、プロンプト、保存された出力、および再生スクリプトはhttps://github.com/louiswang524/FirstResearchで入手できる。
関連論文リスト
- Training AI Scientists to Replicate Research [8.913339899077362]
紙複製のためのスケーラブルなタスクスペースであるReplicaを開発した。
本稿では,低騒音で再現性評価に適合する自動生成ルーリック判定手法を提案する。
論文 参考訳(メタデータ) (2026-08-13T14:59:27Z) - One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure Attribution [85.65263343588026]
我々は,自己修正型,自律型,接地型実験機であるSAGEを提案する。
その中核的なメカニズムであるMHFA(Multi-Hypothesis Failure Attribution)は、回復を構造的因果診断として扱う。
12のトピック、5ドメインのベンチマークでは、SAGEは基準リフレクションでメトリクスを含むアウトプットを42%から92%に増やしている。
論文 参考訳(メタデータ) (2026-06-30T10:54:16Z) - ProjectionBench: Evaluating Scientific Hypothesis Generation in LLMs Under Progressive Information Disclosure [0.0]
科学的発見と推論におけるモデル性能を評価するためのベンチマークフレームワークを提案する。
GPT-5, GPT-5.4, Gemini 2.5 pro, Gemini 3.1 pro Previewを, 生体活性物質, 機械材料, ナノ材料にまたがる45紙で評価した。
論文 参考訳(メタデータ) (2026-05-28T17:38:19Z) - When AI reviews science: Can we trust the referee? [73.47745294608072]
私たちは、トレーニングとデータ検索、デスクレビュー、深いレビュー、反論、システムレベルといった、レビューライフサイクル全体のアタックをマップします。
評価スコアに高名度フレーミング, 断定力, 反抗薬効, 文脈中毒の因果効果を分離するために, 2つの高度なLCMベースの審判を用いた。
論文 参考訳(メタデータ) (2026-04-26T08:03:32Z) - CiteAudit: You Cited It, But Did You Read It? A Benchmark for Verifying Scientific References in the LLM Era [51.63024682584688]
大規模言語モデル (LLM) は新たなリスクを導入している。
本稿では,科学文献における幻覚的引用のための総合的なベンチマークおよび検出フレームワークについて紹介する。
我々のフレームワークは、精度と解釈可能性の両方において、先行手法を著しく上回っている。
論文 参考訳(メタデータ) (2026-02-26T19:17:39Z) - FIRE-Bench: Evaluating Agents on the Rediscovery of Scientific Insights [63.32178443510396]
FIRE-Bench (Full-cycle Insight Rediscovery Evaluation) は、確立された発見の再検討を通じてエージェントを評価するベンチマークである。
最強のエージェントでさえ、限られた再発見成功(50 F1)を達成し、実行中に高いばらつきを示し、実験的な設計、実行、エビデンスに基づく推論において繰り返し失敗モードを表示する。
論文 参考訳(メタデータ) (2026-02-02T23:21:13Z) - BadScientist: Can a Research Agent Write Convincing but Unsound Papers that Fool LLM Reviewers? [21.78901120638025]
製造指向の紙生成エージェントがマルチモデルLCMレビューシステムを欺くことができるかどうかを考察する。
我々のジェネレータは、実際の実験を必要としないプレゼンテーション操作戦略を採用している。
健全な集約数学にもかかわらず、整合性検査は体系的に失敗する。
論文 参考訳(メタデータ) (2025-10-20T18:37:11Z) - ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition [67.26124739345332]
大規模言語モデル(LLM)は科学的研究を支援する可能性を示しているが、高品質な研究仮説を発見する能力はいまだ検討されていない。
我々は,LLMを科学的発見のサブタスクのほぼ十分セットで評価するための,最初の大規模ベンチマークを紹介する。
学術論文から重要コンポーネント(研究質問、背景調査、インスピレーション、仮説)を抽出する自動フレームワークを開発する。
論文 参考訳(メタデータ) (2025-03-27T08:09:15Z) - Attribution in Scientific Literature: New Benchmark and Methods [41.64918533152914]
大規模言語モデル(LLM)は、科学的コミュニケーションにおいて、自動ソース引用のための有望だが挑戦的なフロンティアを提供する。
本稿では、arXivから12の科学領域にまたがる文レベルのアノテーションを備えた新しいデータセットREASONSを紹介する。
我々は、GPT-O1、GPT-4O、GPT-3.5、DeepSeekなどのモデルや、Perplexity AI (7B)のような他の小さなモデルで広範な実験を行う。
論文 参考訳(メタデータ) (2024-05-03T16:38:51Z) - Large Language Models for Automated Open-domain Scientific Hypotheses Discovery [50.40483334131271]
本研究は,社会科学の学術的仮説発見のための最初のデータセットを提案する。
従来のデータセットとは異なり、新しいデータセットには、(1)オープンドメインデータ(RAW Webコーパス)を観察として使用すること、(2)人間性にさらに新しい仮説を提案することが必要である。
パフォーマンス向上のための3つのフィードバック機構を含む,タスクのためのマルチモジュールフレームワークが開発されている。
論文 参考訳(メタデータ) (2023-09-06T05:19:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。