論文の概要: Adversarial Fast-Moving Real-World Domains as Test Beds for Benchmarking AI Scientist Capabilities
- arxiv url: http://arxiv.org/abs/2608.03569v1
- Date: Tue, 04 Aug 2026 12:30:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.187302
- Title: Adversarial Fast-Moving Real-World Domains as Test Beds for Benchmarking AI Scientist Capabilities
- Title(参考訳): AIサイエンティストの能力のベンチマークのためのテストベッドとしての敵対的な高速な実世界のドメイン
- Authors: William Bolton, Philip Torr,
- Abstract要約: AI科学者が新しいアイデアを生み出す能力のベンチマークは、非常に難しい。
我々はこのフレームワークを2つの構造的に異なるドメイン、F1(F1)とMagic: The Gathering(MTG)でインスタンス化する。
両方の領域にまたがって、モデルは妥当なアウトプットを生成するが、現実のエキスパートソリューションと整合性は少ない。
- 参考スコア(独自算出の注目度): 24.09636531093206
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Benchmarking the ability of AI scientists to generate novel ideas is notoriously difficult. Existing benchmarks in this field have made progress in evaluating scientific reasoning and research replication, but often rely on synthetic tasks or retrospective targets, which may be confounded by prior exposure. We hypothesize that complex, adversarial, fast-moving real-world domains where expert practitioners independently generate observable outputs can provide a practical solution to fill this gap and evaluate the capabilities needed for AI scientists, including reasoning, novelty, and hypothesis formulation. We instantiate this framework in two structurally different domains, Formula 1 (F1), where models ideate around car design concepts for the 2026 season, and real pre-season innovations provide a ground truth, and Magic: The Gathering (MTG), where models propose decks from a recently updated card pool and are evaluated against 19 Pro Tour (PT) decklists. Across both domains, models produce plausible outputs, but few align with real-world expert solutions. In F1, the best model, GPT-5.2 matched 10 of 40 real innovations with 166 ideas proposed across runs. In MTG, the best deck from Gemini 3 Flash recovered 5 of 7 new-set cards from the third-place PT deck, and across all 108 decks, the cards models selected most often were also the cards most widely adopted by PT decks (Spearman $ρ= 0.74$, $p = 0.0003$). These results suggest that a key capability gap for AI scientists is not idea generation, but filtering, prioritization, and coherent novelty.
- Abstract(参考訳): AI科学者が新しいアイデアを生み出す能力のベンチマークは、非常に難しい。
この分野での既存のベンチマークは、科学的推論と研究の複製を評価するのに進歩しているが、しばしば合成タスクや振り返りターゲットに依存しており、これは事前の露光によって構築される可能性がある。
我々は、専門家が独立して観測可能なアウトプットを生成し、このギャップを埋め、推論、ノベルティ、仮説定式化を含むAI科学者に必要な能力を評価するための実践的なソリューションを提供することができる、複雑な、敵対的で素早く動く現実世界のドメインを仮定する。
このフレームワークは、2026年シーズンのカーデザインコンセプトをモデルが考えるF1(F1)と、実際のプレシーズンのイノベーションが基礎的な真実を提供するマジック:ザ・ギャザリング(MTG)という2つの構造的なドメインでインスタンス化されます。
両方の領域にまたがって、モデルは妥当なアウトプットを生成するが、現実のエキスパートソリューションと整合性は少ない。
F1では、最高のモデルであるGPT-5.2が実際の40のイノベーションのうち10と一致し、166のアイデアが提案された。
Gemini 3 FlashのベストデッキであるMTGでは、第3位のPTデッキから新セットカード7枚のうち5枚を回収し、108枚のうち最も多く選ばれたカードはPTデッキで最も広く採用されているカードである(Spearman $ρ = 0.74$, $p = 0.0003$)。
これらの結果は、AI科学者にとって重要な能力ギャップはアイデア生成ではなく、フィルタリング、優先順位付け、一貫性のある新規性にあることを示唆している。
関連論文リスト
- ProjectionBench: Evaluating Scientific Hypothesis Generation in LLMs Under Progressive Information Disclosure [0.0]
科学的発見と推論におけるモデル性能を評価するためのベンチマークフレームワークを提案する。
GPT-5, GPT-5.4, Gemini 2.5 pro, Gemini 3.1 pro Previewを, 生体活性物質, 機械材料, ナノ材料にまたがる45紙で評価した。
論文 参考訳(メタデータ) (2026-05-28T17:38:19Z) - GIANTS: Generative Insight Anticipation from Scientific Literature [84.95947892931142]
本稿では、下流紙のコアインサイトを基礎となる親論文から予測する世代課題であるインサイト予測を導入する。
実測値と実測値の類似性を評価するLM判定器を用いてモデル評価を行い,これらの類似性スコアが有能な人間の評価値と相関していることを示す。
GIANTS-4Bは、強化学習(RL)を用いて訓練されたLMで、これらの類似度スコアをプロキシ報酬として用いた洞察予測を最適化する。
論文 参考訳(メタデータ) (2026-04-10T18:13:55Z) - SciDesignBench: Benchmarking and Improving Language Models for Scientific Inverse Design [3.4610016208336774]
SciDesignBenchは、14の科学領域にわたる520のシミュレーター地上タスクのベンチマークである。
最高のゼロショットモデルは、パースレートがかなり高いにもかかわらず、わずか29.0%の成功しか得られない。
論文 参考訳(メタデータ) (2026-03-13T07:11:47Z) - The FM Agent [36.44000839818829]
大規模言語モデル(LLM)は、自律型AI研究エージェントの開発を触媒している。
本稿では,新しい汎用マルチエージェントフレームワークであるFM Agentを紹介する。
我々のシステムは、演算研究、機械学習、GPUカーネル最適化、古典数学問題など、さまざまな領域で評価されてきた。
論文 参考訳(メタデータ) (2025-10-30T04:57:57Z) - Winning Gold at IMO 2025 with a Model-Agnostic Verification-and-Refinement Pipeline [10.177917426690703]
大規模な言語モデルは、しばしばオリンピアードレベルの問題と競合する。
我々は,モデルに依存しない検証・修正パイプラインを構築した。
IMO 2025において、その効果を実証した。
論文 参考訳(メタデータ) (2025-07-21T17:59:49Z) - Predicting Empirical AI Research Outcomes with Language Models [27.148683265085012]
AI研究における有望なアイデアの多くは提供されないが、その検証には相当な人的労力と計算が必要だ。
このタスクの最初のベンチマークを構築し、LMと人間の専門家を比較します。
私たちはカンファレンス論文からアイデアと実験結果を取り除き、ベースモデルがテストの切り離し日後に公表された1,585人の人間による検証されたアイデアペアを生成しました。
我々は,精巧なGPT-4.1と紙検索エージェントを組み合わせたシステムを開発し,25人の人間専門家を雇って比較する。
NLP領域では、我々のシステムは人間の専門家を64.4%対48.で破る。
論文 参考訳(メタデータ) (2025-06-01T02:46:31Z) - Sparks of Artificial General Intelligence: Early experiments with GPT-4 [66.1188263570629]
OpenAIが開発したGPT-4は、前例のない規模の計算とデータを使って訓練された。
我々は, GPT-4が数学, コーディング, ビジョン, 医学, 法学, 心理学などにまたがる, 新規で困難な課題を解くことを実証した。
我々は、GPT-4を人工知能(AGI)システムの早期(まだ未完成)版と見なすことができると信じている。
論文 参考訳(メタデータ) (2023-03-22T16:51:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。