論文の概要: AutoResearch: An Execution-Grounded Multi-Agent Framework for Reliable Research Workflow Automation
- arxiv url: http://arxiv.org/abs/2607.02520v1
- Date: Mon, 04 May 2026 08:24:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:12.977796
- Title: AutoResearch: An Execution-Grounded Multi-Agent Framework for Reliable Research Workflow Automation
- Title(参考訳): AutoResearch: 信頼性の高いリサーチワークフロー自動化のための実行中心のマルチエージェントフレームワーク
- Authors: Rajesh Kumar, Waqar Ali, Junaid Ahmed, Abdullah Aman Khan, Shaoning Zeng,
- Abstract要約: AutoResearchは、信頼性の高い研究ワークフロー自動化のための実行基盤のマルチエージェントフレームワークである。
システムは、エラー、引用検証失敗、レビューエージェントフィードバックを、生成された研究成果物の実用的なフィルタリング信号として扱う。
- 参考スコア(独自算出の注目度): 8.807417226975081
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Automated research agents increasingly generate code, retrieve literature, and draft scientific artifacts, but they often fail to verify whether generated experiments execute correctly or whether cited sources support generated claims. We present AutoResearch, an execution-grounded multi-agent framework for reliable research workflow automation. AutoResearch couples sandboxed Python/PyTorch execution, iterative code repair, citation verification, claim-support auditing, decision control, and structured \LaTeX{} artifact generation. The system treats runtime errors, citation-verification failures, and review-agent feedback as practical filtering signals for generated research artifacts. In controlled evaluations on HumanEval, MBPP, a SciCode subset, citation-validation tasks, claim-support auditing, and small end-to-end workflow stress tests, AutoResearch improves execution success, citation validity, local claim support, and workflow completion relative to directly comparable baselines. Code-oriented agents are reported separately as partial comparisons. AutoResearch is intended as a reliability-oriented research assistant, not as a fully autonomous scientist or a standalone manuscript-quality benchmark. Source Code: https://github.com/raja21068/AutoResearch
- Abstract(参考訳): 自動研究エージェントは、コードを生成し、文献を検索し、科学的アーティファクトをドラフトするが、生成された実験が正しく実行されるか、引用されたソースが生成されたクレームをサポートするかどうかを検証できないことが多い。
本稿では、信頼性の高い研究ワークフロー自動化のための実行基盤型マルチエージェントフレームワークであるAutoResearchを紹介する。
AutoResearchは、サンドボックス化されたPython/PyTorchの実行、反復的なコード修正、引用検証、クレームサポート監査、決定制御、構造化された \LaTeX{} アーティファクト生成を結合する。
このシステムは、実行時エラー、引用検証失敗、レビューエージェントフィードバックを、生成された研究成果物の実用的なフィルタリング信号として扱う。
HumanEvalの制御された評価では、MBPP、SciCodeサブセット、引用バリデーションタスク、クレームサポート監査、小さなエンドツーエンドワークフローストレステストにおいて、AutoResearchは実行の成功、引用妥当性、ローカルクレームサポート、直接の同等のベースラインに対するワークフロー補完を改善している。
コード指向エージェントは部分比較として別々に報告される。
AutoResearchは、完全な自律科学者やスタンドアロンの原稿品質ベンチマークとしてではなく、信頼性指向の研究アシスタントとして意図されている。
ソースコード:https://github.com/raja21068/AutoResearch
関連論文リスト
- VERITAS: Towards a General-Purpose Replication Tool for Scientific Research [19.45546798679836]
CLIコーディングエージェントを中心に構築されたドメインに依存しないレプリケーションフレームワークであるVERITASを提案する。
論文、コードリポジトリ、またはその両方が与えられた場合、VERITASは論文の主張を抽出し、それらが生じる問題を解決しながら方法論を実行し、実験の実行から証拠に対して各主張を判断する。
パイプラインは重要度重み付けされたレプリケーションスコアを返します。
コンピュータ科学,社会科学,医学,天体物理学を対象とする65の論文, CORE-Bench と ReplicationBench について VERITAS の評価を行った。
論文 参考訳(メタデータ) (2026-07-03T03:55:59Z) - Where Do Deep-Research Agents Go Wrong? Span-Level Error Localization in Agent Trajectories [51.22051230894794]
最終回答に基づく評価は、エージェントが成功するかどうかを示すが、どの部分の軌道が答えを信頼できないかを示すものではない。
2つのエージェントフレームワーク、3つのバックボーンモデル、3つのベンチマークから2,790の実際のトラジェクトリを収集し、生ログをセマンティックスパンに変換し、エキスパートレビューを通じて有害なエラースパンを注釈付けします。
我々は,エージェントの主張を追跡するクレーム中心の監査フレームワークであるDRIFTを提案する。
論文 参考訳(メタデータ) (2026-06-01T10:50:26Z) - Sibyl-AutoResearch: Autonomous Research Needs Self-Evolving Trial-and-Error Harnesses, Not Paper Generators [37.075000666622074]
我々はScientific Trial-and-Error Harnessesを中心に構築された自己進化型AutoResearchフレームワークであるSibyl-AutoResearchを紹介した。
ハーネスは、エージェントが有界なトライアルを実行し、肯定的な結果と否定的な結果を保持し、後続の計画、検証、クレームスコープ、スケジューリング、批判、執筆、修復に教訓を導いてくれる。
SIBYLはファイルベースの自律的な研究システムで、状態、役割、メモリ、ゲート、アーティファクトトレースを公開して変換パスを検査する。
論文 参考訳(メタデータ) (2026-05-21T11:29:08Z) - AI for Auto-Research: Roadmap & User Guide [107.0834449839233]
研究ライフサイクル全体にわたってAIをエンドツーエンドに分析する。
我々は、信頼できる援助と信頼できない自律性の間に、鋭くステージに依存した境界を特定できる。
障害モードを排除するのではなく、より大きな自動化が不明瞭であることが示されています。
論文 参考訳(メタデータ) (2026-05-18T17:08:26Z) - Can Coding Agents Reproduce Findings in Computational Materials Science? [49.254975563645786]
本稿では,大規模言語モデルの科学的主張を再現する能力を評価するためのベンチマークであるAutoMatを紹介する。
課題を専門とする専門家と緊密に連携することで、実際の材料科学論文からの一連の主張をキュレートし、コーディングエージェントがエンドツーエンドのワークフローを回復し実行できるかどうかを検証します。
結果、現在のLSMベースのエージェントはAutoMatの全体的な成功率を低くし、最も優れた設定は54.1%に過ぎなかった。
論文 参考訳(メタデータ) (2026-05-01T17:42:12Z) - RESCORE: LLM-Driven Simulation Recovery in Control Systems Research Papers [18.24843021913362]
制御システムの研究論文から数値シミュレーションを再構築することは、未特定パラメータやあいまいな実装の詳細によってしばしば妨げられる。
本稿では,論文の再現性を忠実に再現する実行可能なコードを生成する自動システムの課題である,シミュレーション検索性に関する論文の課題を定義する。
本稿では,3つのLLMエージェントフレームワークであるRESCORE,Analyzer,Coder,Verifierを提案する。
提案手法は,40.7%のベンチマークインスタンスに対して,タスクコヒーレントなシミュレーションを正常に再現し,シングルパス生成よりも優れていた。
論文 参考訳(メタデータ) (2026-04-06T00:13:14Z) - Automating Computational Reproducibility in Social Science: Comparing Prompt-Based and Agent-Based Approaches [0.3637090866781549]
計算研究の再現は、提供されたデータで元のコードを再実行するのと同じくらい単純であるとしばしば考えられている。
本研究では,大規模な言語モデルとAIエージェントが,そのような障害の診断と修復を自動化できるかどうかを検討する。
論文 参考訳(メタデータ) (2026-02-09T11:59:59Z) - AutoReproduce: Automatic AI Experiment Reproduction with Paper Lineage [62.049868205196425]
AutoReproduceは、研究論文に記載された実験をエンドツーエンドで自動再生できるフレームワークである。
結果は、AutoReproduceが平均的なパフォーマンスギャップを22.1%$で達成していることを示している。
論文 参考訳(メタデータ) (2025-05-27T03:15:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。