論文の概要: Can AI agents conduct open-ended AI research? Early evidence from two case studies
- arxiv url: http://arxiv.org/abs/2607.27191v1
- Date: Wed, 29 Jul 2026 17:57:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.772832
- Title: Can AI agents conduct open-ended AI research? Early evidence from two case studies
- Title(参考訳): AIエージェントはオープンなAI研究を実行できるか? 2つのケーススタディの初期の証拠
- Abstract要約: エージェントがオープンエンドAI研究を実行できるかどうかの証拠は薄い。
現在の評価では、オープンエンドの調査を除外する狭いタスクでテストエージェントをテストするか、あるいは盲目のピアレビューにAI生成論文を提出する。
我々は、AI R&D自動化に向けた進歩を測定するための第3の方法を紹介します。
- 参考スコア(独自算出の注目度): 16.75408134467252
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Forecasts of explosive AI progress hinge on AI agents automating AI research. But evidence on whether agents can carry out open-ended AI research is thin. Current evaluations either test agents on narrow, verifiable tasks, which excludes open-ended research, or submit AI-generated papers to blind peer review, which is overstretched, stochastic, and suffers from poor review quality. We introduce a third way to measure progress towards AI R\&D automation. An agent takes on the central, open-ended research question of a high-quality unpublished paper, and the paper's original authors grade its output. We call these shadow evaluations. We ran shadow evaluations on two unpublished NeurIPS 2026 submissions, giving frontier agents six days and thousands of dollars of compute. The agents completed all of the engineering without human help, yet could not make substantial progress towards answering the research questions. As a result, both papers were unambiguously rejected by the authors. We identify five recurring failure modes: poor judgment about the bar for publishable research, uncreative responses to shortcomings in the research design, ineffective backtracking from dead ends, poor resource awareness, and instruction drift. A robustness check with a second model and scaffold reproduced these failures. We release the expert reviews, survey responses, agent repositories, and logs. Our results provide early evidence that today's agents can do the engineering of AI research, but struggle with critical parts of the research lifecycle.
- Abstract(参考訳): AI研究を自動化するAIエージェントに対する爆発的なAIプログレスヒンジの予測。
しかし、エージェントがオープンなAI研究を実行できるかどうかの証拠は薄い。
現在の評価では、オープンエンドの研究を除外する、狭い検証可能なタスクのテストエージェント、あるいはAI生成の論文をブラインドピアレビューに提出するエージェントが、オーバーストレッチで確率的であり、レビュー品質の低下に悩まされている。
我々は、AIのR&D自動化に向けた進歩を測定するための第3の方法を紹介します。
エージェントは、高品質な未発表の論文の、中央的でオープンな研究課題を取り上げ、その論文の原著者は、その成果を格付けする。
これらを影評価と呼ぶ。
私たちは、未発表のNeurIPS 2026の提出書類で影の評価を行い、フロンティアエージェントに6日と何千ドルもの計算を与えました。
エージェントは人間の助けなしにすべてのエンジニアリングを完了したが、研究の質問に答えるほどの進歩は得られなかった。
その結果、両紙は著者によって明白に拒絶された。
出版可能な研究のためのバーの判断が不十分、研究設計の欠点に対する非創造的な応答、デッドエンドからの非効率なバックトラック、リソースの認識不良、指示ドリフトの5つの失敗モードを特定した。
2つ目のモデルと足場を備えた堅牢性チェックは、これらの失敗を再現しました。
専門家レビュー、調査回答、エージェントリポジトリ、ログを公開しています。
我々の結果は、今日のエージェントがAI研究のエンジニアリングを行うことができるという初期の証拠を提供するが、研究ライフサイクルの重要な部分と戦っている。
関連論文リスト
- PaperDoctor: Evidence-Grounded and Actionable Feedback for Scientific Papers in Progress [130.58520199343707]
PaperDoctorは,3つの重要なイノベーションを備えた,サブミッション前のフィードバックのためのエージェントフレームワークである。
まず、全体論的階層的なフレームワークは、書き込み、レイアウト、参照、コード、理論、先行作業、実験を評価します。
第二に、各発見には、観察、文、方程式、コードラインなどの特定の証拠へのポインタ、修正提案が含まれる。
第3に、PaperDoctorはクレームの重要性と計算予算に基づいて実験を選択的に再構築し、再実行する。
論文 参考訳(メタデータ) (2026-09-15T11:08:11Z) - How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks [6.001213285107465]
AutoResearchEvalは、7つの科学領域にまたがるフロンティア科学に根ざした100のタスクを特徴としている。
8つのハーネスモデルの組み合わせを評価すると、800個のオート検索剤の軌道が得られる。
我々は,人間のキャリブレーションしたエージェント・アズ・ア・ジャッジ・パイプラインを利用して,完全な軌道や中間成果物を検査する。
論文 参考訳(メタデータ) (2026-08-14T21:39:38Z) - Can AI Review Improve Paper Drafting? An Empirical Study on 20 Computer Architecture Submissions [4.04252733799147]
我々は、AIレビューが人間のレビューとどのように一致しているかを明らかにするために、さまざまなレベルの提出系統を持つ20のコンピュータアーキテクチャー論文を調査する。
このケーススタディを実行するために、Web UI統合ツールであるemphAI-Paper-Reviewを構築し、ドラフトペーパーの構造化AIレビューを生成する。
論文 参考訳(メタデータ) (2026-05-31T05:05:26Z) - AI for Auto-Research: Roadmap & User Guide [107.0834449839233]
研究ライフサイクル全体にわたってAIをエンドツーエンドに分析する。
我々は、信頼できる援助と信頼できない自律性の間に、鋭くステージに依存した境界を特定できる。
障害モードを排除するのではなく、より大きな自動化が不明瞭であることが示されています。
論文 参考訳(メタデータ) (2026-05-18T17:08:26Z) - Stop Automating Peer Review Without Rigorous Evaluation [51.53099943385505]
このポジションペーパーは、今日のAIシステムは、論文レビューの作成に使用すべきではない、と論じている。
1)AIレビュアーは、視点の多様性を低下させる論文内および新聞内における過剰な合意の隠れた効果を示す。
ピアレビューの危機に対処するには、ピアレビューの自動化の科学が必要です。
論文 参考訳(メタデータ) (2026-05-04T22:41:04Z) - AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery [55.70879973230979]
AutoResearchBenchは、自律的な科学文献発見のためのベンチマークである。
エージェントWebブラウジングに関する以前のベンチマークと比較すると、AutoResearchBenchは研究指向である。
最も強力なLCMでさえ、BrowseCompのような一般的なエージェントによるWebブラウジングベンチマークをほとんど征服したにもかかわらず、Deep Researchでは9.39%、Wide Researchでは9.31%の精度しか達成していない。
論文 参考訳(メタデータ) (2026-04-28T06:05:17Z) - The Last Human-Written Paper: Agent-Native Research Artifacts [106.47848184955576]
本稿では,物語紙を機械処理可能な研究パッケージに置き換えるプロトコルであるAgent-Native Research Artifact(ARA)を紹介する。
通常の開発において決定と終了をキャプチャするLive Research Manager、レガシPDFとリポジトリをARAに変換するARAコンパイラ、人間レビュアーが重要性、ノベルティ、味にフォーカスできるように客観的チェックを自動化するARAネイティブレビューシステムである。
論文 参考訳(メタデータ) (2026-04-27T16:23:09Z) - AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite [75.58737079136942]
本稿では,AstaBenchについて紹介する。AstaBenchは,科学的研究を行うためのエージェント能力の総合的な測定を行うスイートである。
私たちのスイートには、プロダクショングレードの検索ツールを備えた、最初の科学研究環境が付属しています。
22のエージェントクラスで57のエージェントを評価したところ,いくつかの興味深い結果が得られた。
論文 参考訳(メタデータ) (2025-10-24T17:10:26Z) - Stop DDoS Attacking the Research Community with AI-Generated Survey Papers [27.03595915182805]
我々は、膨大な量のAI生成調査論文を研究コミュニティにアップロードするのをやめなければならないと論じている。
私たちは、AI利用における専門家の監視と透明性の回復を呼びかけています。
調査の完全性を守ることはもはやオプションではなく、研究コミュニティにとって必須であることを示します。
論文 参考訳(メタデータ) (2025-10-09T05:55:13Z) - AGI Is Coming... Right After AI Learns to Play Wordle [4.2909314120969855]
マルチモーダルエージェント、特にOpenAIのComputer-User Agent (CUA)は、人間のように標準的なコンピュータインターフェースを通じてタスクを制御および完了するよう訓練されている。
The New York Times Wordle game におけるエージェントのパフォーマンスを評価し,モデル行動の抽出と欠点の同定を行った。
論文 参考訳(メタデータ) (2025-04-21T20:58:58Z) - Evaluating Sakana's AI Scientist: Bold Claims, Mixed Results, and a Promising Future? [20.188659973082643]
サカナは先日,AI Scientistを導入して,自律的に研究を行うこと,すなわち,私たちがARI(Artificial Research Intelligence)と呼ぶものを達成したことを示唆している,と主張している。
AI Scientistの評価は、重大な欠点を明らかにします。
論文 参考訳(メタデータ) (2025-02-20T06:22:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。