論文の概要: Training AI Scientists to Replicate Research
- arxiv url: http://arxiv.org/abs/2608.13331v1
- Date: Thu, 13 Aug 2026 14:59:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 18:29:38.572349
- Title: Training AI Scientists to Replicate Research
- Title(参考訳): 研究をリプリケートするためにAI科学者を訓練する
- Authors: Damon Falck, Samer Sabri, Anja Surina, Thom Foster, Anya Sims, Sam Devlin, Dylan Rogers, Tantum Collins, Kaloyan Aleksiev, Louis Kirsch, Edward Hughes,
- Abstract要約: 紙複製のためのスケーラブルなタスクスペースであるReplicaを開発した。
本稿では,低騒音で再現性評価に適合する自動生成ルーリック判定手法を提案する。
- 参考スコア(独自算出の注目度): 8.913339899077362
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The replicability of papers is a cornerstone of scientific knowledge, ensuring the reliability of existing results and providing a base for further experiments. The act of replication typically illuminates details that were previously underspecified, and thus requires similar hypothesis-driven exploration to open-ended research. In this work, we develop Replica, a scalable task space for paper replication. To provide reward signal, we introduce an auto-generated rubric-based judge that has low noise and agrees with human assessment of replication quality. We post-train Faraday, a 27B-parameter "AI Scientist" agent that leverages coding agents as tools, surpassing the performance of Claude Opus 4.8 and GPT-5.5 on held-out replication tasks. Qualitative analysis of individual rollouts reveals that Faraday adopts a more scientifically-principled approach. We believe that our results provide a stepping stone towards AI agents capable of long-horizon scientific innovation without requiring complex harnesses.
- Abstract(参考訳): 論文の複製性は科学的知識の基礎であり、既存の結果の信頼性を確保し、さらなる実験の基盤を提供する。
複製の行為は、通常、以前は未特定だった詳細を照らすため、オープンエンドの研究に類似した仮説駆動の探索が必要である。
本研究では,紙複製のためのスケーラブルなタスク空間であるReplicaを開発する。
報奨信号として,低騒音かつ人間の再現性評価に適合する自動生成ルーリック式判定器を導入する。
コーディングエージェントをツールとして活用する27Bパラメータ"AI Scientist"エージェントであるFaradayは、保持された複製タスクにおけるClaude Opus 4.8とGPT-5.5のパフォーマンスを上回った。
個別のロールアウトの質的分析により、ファラデーはより科学的に先導的なアプローチを採用することが明らかになった。
われわれの結果は、複雑なハーネスを必要とせず、長期にわたる科学革新が可能なAIエージェントへの一歩となると信じている。
関連論文リスト
- SciResearcher: Scaling Deep Research Agents for Frontier Scientific Reasoning [54.194672921128785]
我々は、フロンティア科学データ構築のための完全に自動化されたエージェントフレームワークであるSciResearcherを紹介する。
SciResearcherは、学術的証拠に基づく様々な概念的および計算的なタスクを合成する。
我々は,HLE-Bio/Chem-Goldベンチマークで19.46%を達成できるエージェント基盤モデルであるSciResearcher-8Bを開発した。
論文 参考訳(メタデータ) (2026-05-02T15:26:45Z) - AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery [55.70879973230979]
AutoResearchBenchは、自律的な科学文献発見のためのベンチマークである。
エージェントWebブラウジングに関する以前のベンチマークと比較すると、AutoResearchBenchは研究指向である。
最も強力なLCMでさえ、BrowseCompのような一般的なエージェントによるWebブラウジングベンチマークをほとんど征服したにもかかわらず、Deep Researchでは9.39%、Wide Researchでは9.31%の精度しか達成していない。
論文 参考訳(メタデータ) (2026-04-28T06:05:17Z) - OR-Agent: Bridging Evolutionary Search and Structured Research for Automated Algorithm Discovery [10.217363774023033]
OR-Agentは、リッチな実験環境における自動探査のために設計されたマルチエージェントの研究フレームワークである。
本稿では,研究開始点の進化的選択,総合的な研究計画生成,研究ツリー内の協調探索を統一する進化的システム機構を提案する。
我々は古典的最適化ベンチマーク(走行セールスマン、静電容量化車両ルーティング、ビンパッキング、オリエンテーリング、および複数のクナップサック問題を含む)およびシミュレーションに基づく協調運転シナリオを含む実験を行う。
論文 参考訳(メタデータ) (2026-02-14T13:32:03Z) - ReplicatorBench: Benchmarking LLM Agents for Replicability in Social and Behavioral Sciences [19.81372090301296]
ReplicatorBenchは、3段階にわたる研究レプリケーションにおけるAIエージェントの評価のためのエンドツーエンドのベンチマークである。
ReplicatorAgentは,Web検索やサンドボックス環境との反復的なインタラクションなど,必要なツールを備えたエージェントフレームワークである。
ReplicatorAgentは、4つの基礎となる大規模言語モデル(LLM)にまたがって評価する。
論文 参考訳(メタデータ) (2026-02-11T20:42:10Z) - FIRE-Bench: Evaluating Agents on the Rediscovery of Scientific Insights [63.32178443510396]
FIRE-Bench (Full-cycle Insight Rediscovery Evaluation) は、確立された発見の再検討を通じてエージェントを評価するベンチマークである。
最強のエージェントでさえ、限られた再発見成功(50 F1)を達成し、実行中に高いばらつきを示し、実験的な設計、実行、エビデンスに基づく推論において繰り返し失敗モードを表示する。
論文 参考訳(メタデータ) (2026-02-02T23:21:13Z) - ReplicationBench: Can AI Agents Replicate Astrophysics Research Papers? [29.17900668495058]
本稿では、フロンティアAIエージェントの評価フレームワークであるReplicationBenchを紹介する。
天体物理学の文献から得られた研究論文全体を、エージェントが複製できるかどうかを検査する。
R ReplicationBenchは、論文スケールで専門家が検証した天体物理学の研究タスクの最初のベンチマークを確立している。
論文 参考訳(メタデータ) (2025-10-28T16:21:19Z) - AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite [75.58737079136942]
本稿では,AstaBenchについて紹介する。AstaBenchは,科学的研究を行うためのエージェント能力の総合的な測定を行うスイートである。
私たちのスイートには、プロダクショングレードの検索ツールを備えた、最初の科学研究環境が付属しています。
22のエージェントクラスで57のエージェントを評価したところ,いくつかの興味深い結果が得られた。
論文 参考訳(メタデータ) (2025-10-24T17:10:26Z) - Operationalizing Serendipity: Multi-Agent AI Workflows for Enhanced Materials Characterization with Theory-in-the-Loop [0.0]
SciLinkは、材料研究におけるセレンディピティーを運用するために設計された、オープンソースのマルチエージェント人工知能フレームワークである。
実験観察、新規性評価、理論シミュレーションの直接的な自動リンクを生成する。
本稿では,原子分解能およびハイパースペクトルデータへの応用,リアルタイムな人間専門家指導の統合能力,研究ループを閉じる能力について述べる。
論文 参考訳(メタデータ) (2025-08-07T04:59:17Z) - AI Copilots for Reproducibility in Science: A Case Study [1.583709163934932]
オープンサイエンスのイニシアチブは、研究成果をより透明で、アクセス可能で、再利用可能なものにしようと試みているが、公表された発見が独立して再生できることを保証することは、依然として永続的な課題である。
この記事では、研究者、レビュアー、読者を支援するAIベースのプラットフォームであるOpenPubを紹介します。
論文 参考訳(メタデータ) (2025-06-25T04:56:28Z) - ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition [67.26124739345332]
大規模言語モデル(LLM)は科学的研究を支援する可能性を示しているが、高品質な研究仮説を発見する能力はいまだ検討されていない。
我々は,LLMを科学的発見のサブタスクのほぼ十分セットで評価するための,最初の大規模ベンチマークを紹介する。
学術論文から重要コンポーネント(研究質問、背景調査、インスピレーション、仮説)を抽出する自動フレームワークを開発する。
論文 参考訳(メタデータ) (2025-03-27T08:09:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。