論文の概要: One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure Attribution
- arxiv url: http://arxiv.org/abs/2606.31478v1
- Date: Tue, 30 Jun 2026 10:54:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.185501
- Title: One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure Attribution
- Title(参考訳): 自己修正する自律的な研究は多変量仮説の失敗による帰属
- Authors: Jie Ma, Binfei Chu, Jie Gao, Jinlu Zhang, Yiwei Ma, Yi Tan, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji,
- Abstract要約: 我々は,自己修正型,自律型,接地型実験機であるSAGEを提案する。
その中核的なメカニズムであるMHFA(Multi-Hypothesis Failure Attribution)は、回復を構造的因果診断として扱う。
12のトピック、5ドメインのベンチマークでは、SAGEは基準リフレクションでメトリクスを含むアウトプットを42%から92%に増やしている。
- 参考スコア(独自算出の注目度): 85.65263343588026
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Autonomous research agents can now draft hypotheses, write code, run experiments, and produce papers, but they remain brittle when experiments fail. Under the prevailing paradigm, failure recovery is usually delegated to a single free-form reflection: a rich trajectory of metrics, logs, and design choices is compressed into one verbal critique, which often leads either to localized trial-and-error or to hard pivots that discard useful context. We propose SAGE, a Self-correcting, Autonomous, Grounded Experimenter, to tackle this failure-recovery bottleneck. Its core mechanism, Multi-Hypothesis Failure Attribution (MHFA), treats recovery as a structured causal diagnosis. By analyzing dynamic trajectory features, MHFA systematically generates multiple evidence-grounded explanations for a failure, independently evaluates their severity, and deterministically routes the verified root cause to the correct intervention level (hypothesis, experimental design, or implementation). To guarantee scientific honesty, SAGE further employs a grounded reporting mechanism that explicitly constrains drafted results to actual measured values, redacting hallucinated numbers. On a 12-topic, 5-domain benchmark, SAGE increases metrics-bearing outputs from 42% to 92% over a reflection baseline, improves artifact quality from 5.00 to 6.75/10, and blindly outscores AI-Scientist-v2 (52.0 vs. 48.2), with gains concentrated in code development and execution. While fully autonomous scientific writing and generating conference-ready papers remain notoriously difficult open problems for the entire field, SAGE successfully produces significantly more reliable and higher-quality scientific artifacts. Ultimately, by coupling structured recovery with explicit grounding constraints, SAGE significantly outperforms monolithic reflection paradigms, establishing a highly trustworthy foundation for future autonomous research.
- Abstract(参考訳): 自律的な研究エージェントは仮説を起草し、コードを書き、実験を実行し、論文を作成できるが、実験が失敗しても不安定である。
メトリクス、ログ、設計選択の豊富な軌道は、1つの言語的批判に圧縮され、多くの場合、局所的な試行錯誤につながる。
我々は,この障害回復ボトルネックに対処するために,自己修正型,自律型,接地型実験機であるSAGEを提案する。
その中核的なメカニズムであるMHFA(Multi-Hypothesis Failure Attribution)は、回復を構造的因果診断として扱う。
動的軌跡の特徴を解析することにより、MHFAは、障害に対する複数のエビデンスに基づく説明を体系的に生成し、その重症度を独立に評価し、検証された根本原因を正しい介入レベル(仮説、実験設計、実装)に決定的にルーティングする。
科学的に誠実であることを保証するため、SAGEはさらに、起草された結果を実際に測定された値に明示的に制約する基礎的な報告機構を採用し、幻影数を再実行している。
12のトピック、5ドメインのベンチマークでは、SAGEはリフレクションベースライン上でメトリクスを含むアウトプットを42%から92%に引き上げ、アーティファクト品質を5.00から6.75/10に改善し、AI-Scientist-v2(52.0 vs. 48.2)を盲目的に上回り、コード開発と実行に集中している。
完全自律的な科学論文作成と会議可能な論文作成は、この分野全体にとって難しい問題として知られていますが、SAGEはより信頼性が高く、高品質な科学成果物を生み出すことに成功したのです。
最終的に、構造的回復と明確な基盤的制約を結合することにより、SAGEはモノリシックなリフレクションパラダイムを著しく上回り、将来の自律的な研究のための非常に信頼できる基盤を確立します。
関連論文リスト
- Socratic agents for autonomous scientific discovery in high-dimensional physical systems [24.054349223347966]
AHOISはソクラテスの助産師をクローズドループの実験に埋め込む。
物理批判的エージェントは因果質問を通じて仮説を尋問する。
AHOISは、ランダム干渉符号化仮説を自律的に提案し、検証した。
論文 参考訳(メタデータ) (2026-06-25T08:01:07Z) - Workflow Closure Is Not Scientific Closure in Auto-Research Systems [7.328929827918299]
信頼に値する自己調査は、自律的な自己充足を目標とするのではなく、非自律的な制御の下での自律的な実行を目標とすべきである、と我々は主張する。
この急激な領域における100以上の最近の論文やリポジトリの調査に基づいて、繰り返し、構造的に結びついている障害パターンを診断する。
コミュニティの議論を喚起するために、客観的なシグナル、検証、アウトプットの経路にまたがる潜在的な改善について概説する。
論文 参考訳(メタデータ) (2026-05-25T17:16:52Z) - AutoResearchClaw: Self-Reinforcing Autonomous Research with Human-AI Collaboration [175.74514061083195]
提案するAutoResearchClawは,5つのメカニズムに基づいて構築されたマルチエージェント自律型研究パイプラインである。
25トピックの実験ステージベンチマークであるARC-Benchでは、AutoResearchClawがAI Scientist v2を54.7%上回っている。
論文 参考訳(メタデータ) (2026-05-19T15:49:51Z) - Perception Without Engagement: Dissecting the Causal Discovery Deficit in LMMs [68.58207076756237]
本稿では,結果評価からメカニズム診断へ移行する摂動に基づく評価プロトコルProCauEvalを紹介する。
因果推論において,ビデオコンテンツは体系的に過小評価されている。
教師のネガティブなアライメントに基づく強化学習フレームワークであるADPOを提案する。
論文 参考訳(メタデータ) (2026-05-10T08:48:58Z) - Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - AI scientists produce results without reasoning scientifically [3.100302590436282]
大規模言語モデル(LLM)ベースのシステムは、科学的研究を自律的に行うためにますます多くデプロイされている。
そこで本研究では,8つの領域にまたがるLSMに基づく科学的エージェントの評価を行い,その実行と仮説に基づく調査を行った。
論文 参考訳(メタデータ) (2026-04-20T20:23:42Z) - FIRE-Bench: Evaluating Agents on the Rediscovery of Scientific Insights [63.32178443510396]
FIRE-Bench (Full-cycle Insight Rediscovery Evaluation) は、確立された発見の再検討を通じてエージェントを評価するベンチマークである。
最強のエージェントでさえ、限られた再発見成功(50 F1)を達成し、実行中に高いばらつきを示し、実験的な設計、実行、エビデンスに基づく推論において繰り返し失敗モードを表示する。
論文 参考訳(メタデータ) (2026-02-02T23:21:13Z) - When Iterative RAG Beats Ideal Evidence: A Diagnostic Study in Scientific Multi-hop Question Answering [0.2796197251957245]
我々は,同期反復検索と推論が,理想化された静的上界(Gold Context)RAGを超えることができるかどうかを考察した。
我々は,<i>No Context</i>,<i>Gold Context</i>,<i>Gold Context</i>,<i>Gold Context</i>,<i>Iterative RAG</i>,<i>Gold Context</i>,<i>Gold Context</i>,<i>Gold Context</i>,<i>I。
モデル全体では、Iterative RAGはゴールドコンテキストを一貫して上回り、特に非推論では最大25.6ポイントまで上昇する。
論文 参考訳(メタデータ) (2026-01-27T17:35:05Z) - DeepEra: A Deep Evidence Reranking Agent for Scientific Retrieval-Augmented Generated Question Answering [28.427433335623217]
ステップバイステップ推論を統合したディープエビデンス評価エージェント(DeepEra)を提案する。
この研究は、2段階のRAGフレームワークにおいて、無視できないSSLI問題を包括的に研究し、実証的に検証した初めてのものである。
論文 参考訳(メタデータ) (2026-01-23T06:19:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。