論文の概要: ResearchGym: Evaluating Language Model Agents on Real-World AI Research
- arxiv url: http://arxiv.org/abs/2602.15112v1
- Date: Mon, 16 Feb 2026 19:00:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-18 16:03:17.87252
- Title: ResearchGym: Evaluating Language Model Agents on Real-World AI Research
- Title(参考訳): ResearchGym: リアルタイムAI研究における言語モデルエージェントの評価
- Abstract要約: 我々は、エンドツーエンドの研究においてAIエージェントを評価するためのベンチマークおよび実行環境であるResearchGymを紹介する。
これを実現するために,ICML,ICLR,ACLの5つの口頭およびスポットライト論文を再利用した。
GPT-5を動力とするエージェントの制御評価において、我々は鋭い能力-信頼性ギャップを観察する。
- 参考スコア(独自算出の注目度): 48.46915933681714
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce ResearchGym, a benchmark and execution environment for evaluating AI agents on end-to-end research. To instantiate this, we repurpose five oral and spotlight papers from ICML, ICLR, and ACL. From each paper's repository, we preserve the datasets, evaluation harness, and baseline implementations but withhold the paper's proposed method. This results in five containerized task environments comprising 39 sub-tasks in total. Within each environment, agents must propose novel hypotheses, run experiments, and attempt to surpass strong human baselines on the paper's metrics. In a controlled evaluation of an agent powered by GPT-5, we observe a sharp capability--reliability gap. The agent improves over the provided baselines from the repository in just 1 of 15 evaluations (6.7%) by 11.5%, and completes only 26.5% of sub-tasks on average. We identify recurring long-horizon failure modes, including impatience, poor time and resource management, overconfidence in weak hypotheses, difficulty coordinating parallel experiments, and hard limits from context length. Yet in a single run, the agent surpasses the solution of an ICML 2025 Spotlight task, indicating that frontier agents can occasionally reach state-of-the-art performance, but do so unreliably. We additionally evaluate proprietary agent scaffolds including Claude Code (Opus-4.5) and Codex (GPT-5.2) which display a similar gap. ResearchGym provides infrastructure for systematic evaluation and analysis of autonomous agents on closed-loop research.
- Abstract(参考訳): 我々は、エンドツーエンドの研究においてAIエージェントを評価するためのベンチマークおよび実行環境であるResearchGymを紹介する。
これを実現するために,ICML,ICLR,ACLの5つの口頭およびスポットライト論文を再利用した。
各論文リポジトリからデータセット,評価ハーネス,ベースライン実装を保存するが,提案手法を留保する。
これにより、39のサブタスクを含む5つのコンテナ化されたタスク環境が生成される。
それぞれの環境の中で、エージェントは新たな仮説を提案し、実験を行い、論文のメトリクスに基づいて強い人間のベースラインを超えるよう試みなければならない。
GPT-5を動力とするエージェントの制御評価において、我々は鋭い能力-信頼性ギャップを観察する。
エージェントは15評価のうち1つ(6.7%)のリポジトリから提供されたベースラインを11.5%改善し、平均して26.5%のサブタスクしか完了していない。
我々は,不忍,低時間,資源管理,仮説の自信過剰,並列実験のコーディネート困難,コンテキスト長からのハードリミットなど,繰り返し発生する長期的障害モードを同定する。
しかし、1回の実行では、エージェントはICML 2025 Spotlightタスクのソリューションを超える。
また、類似のギャップを示すClaude Code (Opus-4.5) や Codex (GPT-5.2) など、プロプライエタリなエージェントの足場も評価する。
ResearchGymは、クローズドループ研究における自律エージェントの体系的評価と分析のためのインフラを提供する。
関連論文リスト
- Overview of the NLPCC 2026 Shared Task 11: Agent-Based Experiment Reproduction from Scientific Papers [29.922671630644558]
AgentActionBenchは、機械学習とAI4Scienceドメインにわたるエージェントベースの実験再現を評価するための、プロセス指向のベンチマークである。
我々のフレームワークは、MPPベースのアクションレコーダーを使用して、複製プロセス全体を通してエージェントの振る舞いを捉え、紙固有の潤滑剤を用いて結果のトレースを評価する。
ベンチマークの10%をカバーする人間アノテーション付きのサブセットは、検証データを提供し、モデルアシストの強化は、ベンチマーク全体を10,000以上のルーリックアイテムに拡張する。
論文 参考訳(メタデータ) (2026-09-10T05:50:24Z) - ReproRepo: Scaling Reproducibility Audits with GitHub Repository Issues [54.98461672730087]
ReproRepoは、人為的なGitHub問題を活用するスケーラブルな評価フレームワークで、現実的な再現ブロッカーを自然に監視する。
ReproRepoは、大規模なカンファレンスから1,149件の機械学習論文をインスタンス化し、4つのフロンティアモデルエージェント構成を評価します。
その結果, LLMエージェントは, コードを実行せずにも, 紙とリポジトリのペアから多くの実世界の問題を識別できることがわかった。
論文 参考訳(メタデータ) (2026-06-16T17:58:05Z) - The Meta-Agent Challenge: Are Current Agents Capable of Autonomous Agent Development? [80.24951682268332]
本稿では,自律エージェント開発のためのフロンティアモデルのキャパシティをテストするための評価フレームワークであるMeta-Agent Challenge(MAC)を紹介する。
評価の整合性を確保するため、このフレームワークは報奨ハッキングに対する多層防御によって確保される。
メタエージェントは人間工学的な基本方針とほとんど一致せず、その一部はプロプライエタリなフロンティアモデルに支配されている。
論文 参考訳(メタデータ) (2026-06-03T04:58:17Z) - ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research [142.29356526274387]
我々は自律的な科学的研究を評価するためのベンチマークであるResearchClawBenchを紹介する。
各タスクは、実際の論文に基づき、関連する文献や生データを提供し、評価中に対象の論文を隠蔽する。
論文 参考訳(メタデータ) (2026-05-28T16:27:40Z) - OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation [57.505743202759646]
OccuBenchは10の業界カテゴリと65の専門ドメインにわたる100の現実のプロフェッショナルタスクシナリオをカバーするベンチマークである。
我々のマルチエージェント合成パイプラインは, 可溶性, 校正困難, 文書基底の多様性を保証した評価インスタンスを自動生成する。
論文 参考訳(メタデータ) (2026-04-13T00:27:32Z) - COMPOSITE-Stem [32.17652486099204]
COMPOSITE-STEMは、物理学、生物学、化学、数学における70の専門的なタスクのベンチマークである。
我々のベンチマークでは、正確なマッチンググレーティングとクレーターベースのルーリックとアズ・ア・ジャイグリーグレーディングプロトコルを組み合わせる。
トップパフォーマンスモデルは21%を実現し、ComposITE-STEMが現在のエージェントリーチを超える能力をキャプチャすることを示した。
論文 参考訳(メタデータ) (2026-04-10T19:08:50Z) - Strategic Navigation or Stochastic Search? How Agents and Humans Reason Over Document Collections [37.38277822936901]
我々は,800の異種PDF文書に基づいた2,250人の人間による質問のベンチマークであるMADQAを紹介する。
最適なエージェントは、人間の検索者を生の正確さで一致させることができるが、それらはほとんど異なる質問に成功し、弱い戦略計画の補足のためにブルートフォースサーチに依存している。
我々は、ブルートフォース検索からキャリブレーションされた効率的な推論への移行を支援するために、データセットと評価ハーネスをリリースする。
論文 参考訳(メタデータ) (2026-03-12T17:11:22Z) - AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite [75.58737079136942]
本稿では,AstaBenchについて紹介する。AstaBenchは,科学的研究を行うためのエージェント能力の総合的な測定を行うスイートである。
私たちのスイートには、プロダクショングレードの検索ツールを備えた、最初の科学研究環境が付属しています。
22のエージェントクラスで57のエージェントを評価したところ,いくつかの興味深い結果が得られた。
論文 参考訳(メタデータ) (2025-10-24T17:10:26Z) - Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation [87.47155146067962]
数百のタスクで並列評価をオーケストレーションする,標準化された評価ハーネスを提供する。
モデル、足場、ベンチマークにまたがる3次元解析を行う。
私たちの分析では、ほとんどのランで精度を低下させる高い推論努力など、驚くべき洞察が示されています。
論文 参考訳(メタデータ) (2025-10-13T22:22:28Z) - ReviewerToo: Should AI Join The Program Committee? A Look At The Future of Peer Review [23.630458187587223]
ReviewerTooは、AI支援ピアレビューの研究とデプロイのためのフレームワークである。
専門的なレビュアー・ペルソナと構造化された評価基準による体系的な実験を支援する。
私たちは、複雑な評価判断をドメインの専門家に任せながら、AIが一貫性、カバレッジ、公平性を高める方法を示します。
論文 参考訳(メタデータ) (2025-10-09T23:53:19Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Adaptive Monitoring and Real-World Evaluation of Agentic AI Systems [3.215065407261898]
大規模言語モデルと外部ツールを組み合わせたマルチエージェントシステムは、研究機関からハイテイクドメインへと急速に移行している。
この「先進的な」続編は、アルゴリズムのインスタンス化や経験的な証拠を提供することで、そのギャップを埋める。
AMDMは擬似ゴールドリフトで異常検出遅延を12.3秒から5.6秒に減らし、偽陽性率を4.5%から0.9%に下げる。
論文 参考訳(メタデータ) (2025-08-28T15:52:49Z) - MLR-Bench: Evaluating AI Agents on Open-Ended Machine Learning Research [70.72318131988102]
MLR-Benchは、オープンエンド機械学習研究においてAIエージェントを評価するための包括的なベンチマークである。
MLR-Benchは,(1)NeurIPS, ICLR, ICMLのさまざまなMLトピックを対象としたワークショップから得られた201のリサーチタスク,(2)LLMベースのレビュアーと慎重に設計されたレビュールーリックを組み合わせた自動評価フレームワーク,(3)MLR-Agent,研究タスクを4段階(アイデア生成,提案定式化,実験,論文執筆)で完了するモジュールエージェントの足場である。
論文 参考訳(メタデータ) (2025-05-26T13:18:37Z) - FieldWorkArena: Agentic AI Benchmark for Real Field Work Tasks [52.47895046206854]
FieldWorkArenaは、現実世界のフィールドワークをターゲットにしたエージェントAIのベンチマークである。
本稿では、エージェントAIが現実世界の作業環境ベンチマークのために持つべき新しいアクション空間を定義する。
論文 参考訳(メタデータ) (2025-05-26T08:21:46Z) - PaperBench: Evaluating AI's Ability to Replicate AI Research [3.4567792239799133]
PaperBenchは、AIエージェントが最先端のAI研究を複製する能力を評価するベンチマークである。
エージェントは、スクラッチから20個のICML 2024 SpotlightとOralの文書を複製する必要がある。
PaperBenchには8,316の個別の段階的なタスクが含まれている。
論文 参考訳(メタデータ) (2025-04-02T15:55:24Z) - CORE-Bench: Fostering the Credibility of Published Research Through a Computational Reproducibility Agent Benchmark [11.794931453828974]
CORE-Benchは3つの分野(コンピュータ科学、社会科学、医学)にわたる90の科学論文に基づく270のタスクからなるベンチマークである。
エージェントの精度を高速かつ並列に測定する評価システムを提案する。
最高のエージェントは、最も難しいタスクにおいて21%の精度を達成した。
論文 参考訳(メタデータ) (2024-09-17T17:13:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。