論文の概要: How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks
- arxiv url: http://arxiv.org/abs/2608.14905v2
- Date: Wed, 19 Aug 2026 01:11:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 13:35:39.113328
- Title: How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks
- Title(参考訳): エージェントがオートリサーチでいかに失敗するか:100個の実世界フロンティア研究課題におけるエンド・ツー・エンドの診断評価
- Abstract要約: AutoResearchEvalは、7つの科学領域にまたがるフロンティア科学に根ざした100のタスクを特徴としている。
8つのハーネスモデルの組み合わせを評価すると、800個のオート検索剤の軌道が得られる。
我々は,人間のキャリブレーションしたエージェント・アズ・ア・ジャッジ・パイプラインを利用して,完全な軌道や中間成果物を検査する。
- 参考スコア(独自算出の注目度): 6.001213285107465
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI has long assisted scientific research, but the rapid advance of LLMs and agentic scaffolds is reshaping the landscape; a single system can now carry whole-stage research from an initial hypothesis all the way to final published paper, which is a paradigm now referred to as AutoResearch. Existing evaluations reveal little about how these agents operate or where they break down. Tasks are narrowly-scoped, evaluation measures performance but not process, and failure diagnoses lack systematic coverage or artifact-level visibility. To address this gap, we introduce AutoResearchEval, featuring 100 tasks grounded in published frontier science across 7 scientific domains and the full research lifecycle, including ideation, retrieval, execution, analysis, writing, and review. Evaluating 8 harness-model combinations yields 800 autoresearch agent trajectories, with process-level annotation. We organize these insights into AutoResearch Failure Taxonomy or ARFT, a framework of 45 empirically-grounded failure patterns. To enable scalable fine-grained attribution, we leverage a human-calibrated agent-as-a-judge pipeline to inspect complete trajectories and intermediate artifacts. Failure patterns converge on a single overarching limitation, namely that current agents lack a metacognitive loop, which entails the ability to check what they produced against what they found, revise when it does not hold up, and question whether the path they took was sound. The same patterns recur across all 8 harness-model combinations, including the strongest models tested, locating the deficit at the model level rather than in any particular scaffold; whether orchestration-level interventions can close it is an open question this work does not test. We publicly release AutoResearchEval and ARFT to facilitate continued research and development in autonomous scientific discovery.
- Abstract(参考訳): AIは長い間科学的研究を支援してきたが、LLMとエージェントの足場が急速に進歩し、ランドスケープが変化しつつある。
既存の評価では、これらのエージェントがどのように機能するか、どこで機能するかは明らかになっていない。
タスクは狭くスコープされ、評価はパフォーマンスを計測するが、プロセスではない。
このギャップに対処するため、AutoResearchEvalを導入し、7つの科学領域にまたがるフロンティア科学に根ざした100のタスクと、アイデア、検索、実行、分析、執筆、レビューを含む完全な研究ライフサイクルを特徴とする。
8つのハーネスモデルの組み合わせを評価すると、800のオート検索エージェントトラジェクトリとプロセスレベルのアノテーションが得られる。
我々はこれらの知見を,45の経験的基盤的障害パターンからなるフレームワークであるAutoResearch Failure Taxonomy(ARFT)にまとめる。
スケーラブルな微粒化属性を実現するために,人間のキャリブレーションしたエージェント・アズ・ア・ジャッジ・パイプラインを用いて,完全な軌道と中間成果物の検査を行う。
障害パターンは、1つの包括的な制限、すなわち、現在のエージェントがメタ認知ループを欠いていることに収束する。
同じパターンは、テストされた最強モデルを含む8つのハーネスモデルの組み合わせすべてに再帰し、特定の足場ではなくモデルレベルでの欠陥を突き止めます。
我々はAutoResearchEvalとARFTを公開し、自律的な科学的発見の継続的な研究と開発を促進する。
関連論文リスト
- SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents [56.400332595452966]
我々は、監査人が検索エージェントの障害をローカライズ、属性付け、修復できるかどうかを評価するベンチマークであるSearchAuditBenchを紹介する。
SearchAuditBenchは1,243の障害トラックで構成され、平均73.1メッセージと65.1Kトークンを5つのディープサーチベンチマークで8つのオープンウェイトモデルから収集している。
本稿では,検索エージェントの障害を効果的にローカライズ,属性,修復するマルチパースペクティブ監査フレームワークであるSearchAuditorを提案する。
論文 参考訳(メタデータ) (2026-08-05T09:09:00Z) - AREX: Towards a Recursively Self-Improving Agent for Deep Research [75.96468303743958]
本稿では,再帰的自己改善型ディープリサーチエージェントであるAREXを紹介する。
AREXは、証拠を集め、暫定的な回答を構築する内部研究ループを交互に構成する。
我々は,エージェント学習と長期強化学習を通じて,AREXを検証済みの合成タスクと高品質な軌道上で訓練する。
論文 参考訳(メタデータ) (2026-07-23T16:05:46Z) - FARS: A Fully Automated Research System Deployed at Scale [19.413175066072302]
完全自動化AI研究システムであるFARS(Fully Automated Research System)について述べる。
FARSは、アイデア、計画、実験、執筆を通じて、自律的にプロジェクトを生成し、推進する。
FARSの最初の公開デプロイメントでは、67のきめ細かいAI/MLトピックにまたがる166の完全な研究論文が作成された。
論文 参考訳(メタデータ) (2026-06-30T13:30:24Z) - Benchmarking AI Agents for Addressing Scientific Challenges Across Scales [118.2204632627895]
SciAgentArenaは、現実世界の科学研究シナリオでAIエージェントを評価するための体系的なベンチマークである。
ステップワイズ検証を備えた約200のタスクと、多様なAIエージェントを評価するためのインタラクティブでエージェントに依存しない環境で構成される。
タスク構造や評価基準が明確である場合, 現状のエージェントはデータ分析に効果的に貢献できることがわかった。
論文 参考訳(メタデータ) (2026-06-10T22:55:30Z) - Act As a Real Researcher: A Suite of Benchmarks Evaluating Frontier LLMs and Agentic Harnesses in Research Lifecycle [16.040691949938203]
AARR(Act as a Real Researcher)ベンチマークシリーズを提案する。
AARRは、エージェントが人間の研究者を特徴づけるプロフェッショナル主義、徹底性、ニュアンスな推論をエミュレートできるかどうかに焦点を当てている。
我々の研究結果は、研究者のようなAIを開発するには、さらなる研究行動の探索が必要であることを示唆している。
論文 参考訳(メタデータ) (2026-06-05T17:13:36Z) - AutoResearchClaw: Self-Reinforcing Autonomous Research with Human-AI Collaboration [175.74514061083195]
提案するAutoResearchClawは,5つのメカニズムに基づいて構築されたマルチエージェント自律型研究パイプラインである。
25トピックの実験ステージベンチマークであるARC-Benchでは、AutoResearchClawがAI Scientist v2を54.7%上回っている。
論文 参考訳(メタデータ) (2026-05-19T15:49:51Z) - AI for Auto-Research: Roadmap & User Guide [107.0834449839233]
研究ライフサイクル全体にわたってAIをエンドツーエンドに分析する。
我々は、信頼できる援助と信頼できない自律性の間に、鋭くステージに依存した境界を特定できる。
障害モードを排除するのではなく、より大きな自動化が不明瞭であることが示されています。
論文 参考訳(メタデータ) (2026-05-18T17:08:26Z) - The Last Human-Written Paper: Agent-Native Research Artifacts [106.47848184955576]
本稿では,物語紙を機械処理可能な研究パッケージに置き換えるプロトコルであるAgent-Native Research Artifact(ARA)を紹介する。
通常の開発において決定と終了をキャプチャするLive Research Manager、レガシPDFとリポジトリをARAに変換するARAコンパイラ、人間レビュアーが重要性、ノベルティ、味にフォーカスできるように客観的チェックを自動化するARAネイティブレビューシステムである。
論文 参考訳(メタデータ) (2026-04-27T16:23:09Z) - AI-Supervisor: Autonomous AI Research Supervision via a Persistent Research World Model [1.14219428942199]
既存の自動研究システムは、ステートレスでリニアなパイプラインとして動作する。
マルチエージェントオーケストレーションフレームワークである textbfAI-Supervisor を提案する。
エージェントは、人間の関心によって駆動されるエンドツーエンドのAI研究の監督を提供する。
論文 参考訳(メタデータ) (2026-03-25T15:16:51Z) - FIRE-Bench: Evaluating Agents on the Rediscovery of Scientific Insights [63.32178443510396]
FIRE-Bench (Full-cycle Insight Rediscovery Evaluation) は、確立された発見の再検討を通じてエージェントを評価するベンチマークである。
最強のエージェントでさえ、限られた再発見成功(50 F1)を達成し、実行中に高いばらつきを示し、実験的な設計、実行、エビデンスに基づく推論において繰り返し失敗モードを表示する。
論文 参考訳(メタデータ) (2026-02-02T23:21:13Z) - When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research [19.97666809905332]
大規模言語モデル(LLM)は、AIコサイシストと呼ばれる自動科学的発見のビジョンを加速させた。
大規模言語モデル(LLM)の最近の進歩は、しばしばAIコサイシストと呼ばれる自動科学的発見のビジョンを加速させた。
論文 参考訳(メタデータ) (2025-05-17T05:45:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。