論文の概要: Can AI Agents Make Open-Ended Scientific Discovery? Evidence from Station
- arxiv url: http://arxiv.org/abs/2610.08927v1
- Date: Tue, 06 Oct 2026 18:00:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.532546
- Title: Can AI Agents Make Open-Ended Scientific Discovery? Evidence from Station
- Title(参考訳): AIエージェントは、科学的な発見をオープンにできるのか?
- Abstract要約: 複数のエージェントが科学的エコシステムをシミュレートするオープンワールド環境であるStationにおける、オープンエンドタスクにAIが取り組む能力について検討する。
ICLRで発表された3つの最近の口頭文書から,オープンエンドタスクを構築した。
私たちは、Stationが平均的な基準の62.7%をカバーしているのに対し、Codex Multiagent-v2は15.4%、AI Scientist-v2は14.4-2.0.6%である。
- 参考スコア(独自算出の注目度): 14.556758955830796
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent AI systems have made rapid progress in scientific discovery when given well-defined metrics, but whether they can autonomously undertake open-ended scientific discovery remains unclear. We investigate AI's ability to tackle open-ended tasks in Station, an open-world environment in which multiple agents simulate a scientific ecosystem. To tackle challenges specific to open-ended tasks, we propose augmenting Station with two mechanisms: a Supervisor mechanism and periodic Meta Reflection, which encourage persistent exploration even when intermediate metrics are lacking. We construct open-ended tasks from three recent oral papers presented at ICLR. We give agents the main research question studied in each paper while withholding the paper's results and disabling web access. We then measure how many of the original findings-partitioned into individual criteria-agents rediscover. We find that Station rediscovers 62.7% of the criteria on average, compared with 15.4% for Codex Multiagent-v2 and 14.4-20.6% for AI Scientist-v2. Ablation and behavioral analyses indicate that adding the two mechanisms together improves research coverage and continuity. We further evaluate Station on two open-ended tasks without oracle papers and find that some of the discoveries made by the agents closely match discoveries reported by researchers after the knowledge cutoff date. Together, these results indicate that a suitable environment can enable agents to autonomously make meaningful progress in open-ended scientific discovery.
- Abstract(参考訳): 最近のAIシステムは、明確に定義されたメトリクスを与えられたとき、科学的発見を急速に進歩させたが、それらが自律的にオープンな科学的発見を達成できるかどうかは不明のままである。
複数のエージェントが科学的エコシステムをシミュレートするオープンワールド環境であるStationにおける、オープンエンドタスクにAIが取り組む能力について検討する。
オープンエンドタスクに特有な課題に対処するため,中間指標が欠如している場合でも永続的な探索を奨励する,スーパーバイザ機構と周期的メタリフレクションという2つのメカニズムによるステーションの拡張を提案する。
ICLRで発表された3つの最近の口頭文書から,オープンエンドタスクを構築した。
論文の結果を守りつつ、ウェブアクセスを無効にしながら、各論文で研究された主な研究課題をエージェントに与えます。
次に、元の発見のどれ程を個々の基準エージェントに分けて再発見するかを計測する。
私たちは、Stationが平均的な基準の62.7%をカバーしているのに対し、Codex Multiagent-v2は15.4%、AI Scientist-v2は14.4-20.6%である。
アブレーションと行動分析は、2つのメカニズムを一緒に加えることで研究のカバレッジと継続性が向上することを示している。
さらに,2つのオープンエンドタスクにおいて,神託書類を使わずにステーションを評価したところ,エージェントによる発見のいくつかは,知識遮断後の研究者による発見と密接に一致していることが判明した。
これらの結果は、適切な環境によって、エージェントが自律的にオープンな科学的発見において有意義な進歩をすることができることを示唆している。
関連論文リスト
- Benchmarking AI Agents for Addressing Scientific Challenges Across Scales [118.2204632627895]
SciAgentArenaは、現実世界の科学研究シナリオでAIエージェントを評価するための体系的なベンチマークである。
ステップワイズ検証を備えた約200のタスクと、多様なAIエージェントを評価するためのインタラクティブでエージェントに依存しない環境で構成される。
タスク構造や評価基準が明確である場合, 現状のエージェントはデータ分析に効果的に貢献できることがわかった。
論文 参考訳(メタデータ) (2026-06-10T22:55:30Z) - Harnessing the Collective Intelligence of AI Agents in the Wild for New Discoveries [35.87396515951979]
EinsteinArenaは、オープンな分散研究と発見のためのエージェントネイティブプラットフォームである。
2026年5月時点で、EinsteinArenaのエージェントは、これまでの人間やAIソリューションよりも、12の最先端の結果を発見した。
論文 参考訳(メタデータ) (2026-06-09T04:25:28Z) - ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research [142.29356526274387]
我々は自律的な科学的研究を評価するためのベンチマークであるResearchClawBenchを紹介する。
各タスクは、実際の論文に基づき、関連する文献や生データを提供し、評価中に対象の論文を隠蔽する。
論文 参考訳(メタデータ) (2026-05-28T16:27:40Z) - AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery [55.70879973230979]
AutoResearchBenchは、自律的な科学文献発見のためのベンチマークである。
エージェントWebブラウジングに関する以前のベンチマークと比較すると、AutoResearchBenchは研究指向である。
最も強力なLCMでさえ、BrowseCompのような一般的なエージェントによるWebブラウジングベンチマークをほとんど征服したにもかかわらず、Deep Researchでは9.39%、Wide Researchでは9.31%の精度しか達成していない。
論文 参考訳(メタデータ) (2026-04-28T06:05:17Z) - FIRE-Bench: Evaluating Agents on the Rediscovery of Scientific Insights [63.32178443510396]
FIRE-Bench (Full-cycle Insight Rediscovery Evaluation) は、確立された発見の再検討を通じてエージェントを評価するベンチマークである。
最強のエージェントでさえ、限られた再発見成功(50 F1)を達成し、実行中に高いばらつきを示し、実験的な設計、実行、エビデンスに基づく推論において繰り返し失敗モードを表示する。
論文 参考訳(メタデータ) (2026-02-02T23:21:13Z) - Rethinking the AI Scientist: Interactive Multi-Agent Workflows for Scientific Discovery [0.17341675932416767]
本稿では,数分で測定したターンアラウンド時間を用いて,インタラクティブな科学的調査を可能にするマルチエージェントシステムであるDeep Researchを紹介する。
このアーキテクチャは、永続的な世界状態を通じて統合された計画、データ分析、文献検索、新規性検出のための特殊なエージェントから構成される。
BixBenchの計算生物学ベンチマークによる評価は、最先端のパフォーマンスを示し、オープンレスポンスでは48.8%、マルチチョイス評価では64.4%の精度を達成した。
論文 参考訳(メタデータ) (2026-01-18T19:12:41Z) - AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite [75.58737079136942]
本稿では,AstaBenchについて紹介する。AstaBenchは,科学的研究を行うためのエージェント能力の総合的な測定を行うスイートである。
私たちのスイートには、プロダクショングレードの検索ツールを備えた、最初の科学研究環境が付属しています。
22のエージェントクラスで57のエージェントを評価したところ,いくつかの興味深い結果が得られた。
論文 参考訳(メタデータ) (2025-10-24T17:10:26Z) - Open-ended Scientific Discovery via Bayesian Surprise [63.26412847240136]
AutoDSは、ベイジアン・サプライズを用いた科学探査を駆動する、オープンエンドの科学的発見の方法である。
我々はAutoDSを、生物学、経済学、金融学、行動科学といった21の領域にまたがる実世界のデータセットにまたがるデータ駆動ディスカバリの設定で評価する。
論文 参考訳(メタデータ) (2025-06-30T22:53:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。