論文の概要: EviGraph: Evidence-Guided Autonomous Research Agents
- arxiv url: http://arxiv.org/abs/2608.04738v1
- Date: Wed, 05 Aug 2026 12:02:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.899762
- Title: EviGraph: Evidence-Guided Autonomous Research Agents
- Title(参考訳): EviGraph: Evidence-Guided Autonomous Research Agents
- Authors: Zhenjiang Ren, Ruiji Li, Xujing Zhang, Ziliang Pang, Shuo Ren, Jiajun Zhang,
- Abstract要約: 我々は,研究プロセスを表す自律的な研究フレームワークであるEviGraphを,型付きエビデンスグラフとして紹介する。
EviGraphは、依存関係の欠如、セマンティックなミスアライメント、結果定義の不整合のエビデンスチェーンを検査する。
ARC-Bench-MLとNanoResearch-20の実験により、EviGraphは総合的な研究パフォーマンスにおいて、エンドツーエンドのリサーチエージェントベースラインよりも優れていることが示された。
- 参考スコア(独自算出の注目度): 12.29802995923839
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autonomous research agents can generate hypotheses, execute experiments, and draft manuscripts, yet their outputs often contain unsupported claims and inconsistencies between research questions, experiments, results, and conclusions. We argue that this problem is partly architectural: existing systems organize research as sequential pipelines but do not explicitly maintain or validate the evolving claim-evidence structure across stages.In this paper, we introduce EviGraph, an autonomous research framework that represents the research process as a typed evidence graph containing Problem, Gap, Hypothesis, Experiment, Finding, and Claim nodes. The graph serves as the operational state of the agent rather than a post-hoc record. EviGraph inspects evidence chains for missing dependencies, semantic misalignment, and result-claim inconsistencies, localizes the earliest weak node, and regenerates its affected downstream subgraph. Graph checkpointing prevents unsuccessful repairs from corrupting previously validated evidence. Manuscripts are generated only after every retained claim is grounded in a validated evidence chain.Experiments on ARC-Bench-ML and NanoResearch-20 show that EviGraph outperforms the compared end-to-end research-agent baselines in overall research performance, improves Claim Support Rate by 40.19% over the strongest baseline, and achieves 87.73% Experimental Data Consistency. These results demonstrate the value of explicit evidence-state maintenance for reliable autonomous research.
- Abstract(参考訳): 自律的な研究エージェントは仮説を作成し、実験を行い、原稿を起草することができるが、そのアウトプットには、しばしば、研究の質問、実験、結果、結論の間の不一致や不一致が含まれている。
本稿では,研究プロセスを表す自律的な研究フレームワークであるEviGraphを,問題,ギャップ,仮説,実験,発見,クレームノードを含む型付きエビデンスグラフとして紹介する。
グラフはポストホックレコードではなくエージェントの操作状態として機能する。
EviGraphは、依存関係の欠如、セマンティックなミスアライメント、結果定義の不整合のエビデンスチェーンを検査し、最初期の弱いノードをローカライズし、影響を受けた下流のサブグラフを再生する。
グラフチェックポイントは、以前に検証された証拠が破損することを防ぐ。
ARC-Bench-MLとNanoResearch-20の実験では、EviGraphは総合的な研究成績において、エンドツーエンドのリサーチエージェントベースラインよりも優れ、最強のベースラインよりも40.19%向上し、87.73%実験データ一貫性を達成している。
これらの結果は、信頼性の高い自律型研究における明確なエビデンス・ステート・メンテナンスの価値を示している。
関連論文リスト
- When benchmark inferences do not compose: Projectibility in AI evaluation [0.0]
AIベンチマークの結果が1ステップで連続的なクレームに達することはめったにない。
評価者はそれをさらなるケースに一般化し、能力の証拠として解釈し、新しいタスクに外挿し、他のシステムやサイトへ輸送する。
保証リンクは保証チェーンを自動的に作らない。
論文 参考訳(メタデータ) (2026-07-28T18:07:04Z) - HiEviDR-Bench: A Benchmark for Hierarchical Evidence Aggregation in Deep Research [52.87128503345243]
我々は,Deep Researchにおける階層的エビデンス・アグリゲーションを評価するためのベンチマークであるHiEviDR-Benchを紹介する。
HiEviDR-Benchは、エビデンスの選択、クロスソースリンク、アグリゲーションをキャプチャする明示的なエビデンスグラフを持つ各インスタンスを表す。
報告品質,エビデンストレーサビリティ,引用精度,クレーム検証,回答正当性という5次元のトレーサビリティ指向評価フレームワークを開発した。
論文 参考訳(メタデータ) (2026-07-27T23:50:46Z) - DRNOISE: Benchmarking Deep Research Agents in Misleading Evidence Environments [51.049999642138]
誤解を招く証拠の下で、回答回復のための100タスクのベンチマークであるDRNOISEを紹介する。
それぞれのタスクは、2つの間接的レコードチェーンが支持する固有の金の答えを持ち、ペアのノイズ条件は競合する答えを直接記述する1つのもっともらしい文書を付加する。
強いクリーンタスク性能を持つエージェント全体で、この単一の介入は66-88ポイントの精度低下を引き起こす。
論文 参考訳(メタデータ) (2026-07-19T15:20:40Z) - One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure Attribution [85.65263343588026]
我々は,自己修正型,自律型,接地型実験機であるSAGEを提案する。
その中核的なメカニズムであるMHFA(Multi-Hypothesis Failure Attribution)は、回復を構造的因果診断として扱う。
12のトピック、5ドメインのベンチマークでは、SAGEは基準リフレクションでメトリクスを含むアウトプットを42%から92%に増やしている。
論文 参考訳(メタデータ) (2026-06-30T10:54:16Z) - VeriGraph: Towards Verifiable Data-Analytic Agents [71.17693022916896]
LLMをベースとしたエージェントは、データ集約分析タスクにおいて強力な能力を示してきたが、その出力は滅多に検証されていない。
We propose VeriGraph, a traceable neuro-symbolic reasoning framework that agent can construct an explicit heterogeneous evidence directed acyclic graph。
以上の結果から,明示的なエビデンスグラフ構築がデータ分析エージェントの検証に期待できる道のりであることが示唆された。
論文 参考訳(メタデータ) (2026-06-15T11:50:56Z) - ARIS: Autonomous Research via Adversarial Multi-Agent Collaboration [10.076972559007116]
ARIS(Auto-Research-in-sleep)は、自律的な研究のためのオープンソースの研究ハーネスである。
ARISは、クロスモデル対外コラボレーションを通じて機械学習の研究を調整する。
論文 参考訳(メタデータ) (2026-05-04T18:10:15Z) - The Last Human-Written Paper: Agent-Native Research Artifacts [106.47848184955576]
本稿では,物語紙を機械処理可能な研究パッケージに置き換えるプロトコルであるAgent-Native Research Artifact(ARA)を紹介する。
通常の開発において決定と終了をキャプチャするLive Research Manager、レガシPDFとリポジトリをARAに変換するARAコンパイラ、人間レビュアーが重要性、ノベルティ、味にフォーカスできるように客観的チェックを自動化するARAネイティブレビューシステムである。
論文 参考訳(メタデータ) (2026-04-27T16:23:09Z) - From Fluent to Verifiable: Claim-Level Auditability for Deep Research Agents [8.49451413641847]
研究生成が安価になるにつれて、監査可能性がボトルネックになる、と我々は主張する。
この観点からは,ディープリサーチエージェントの第一級設計および評価対象として,クレームレベルの監査性を提案する。
論文 参考訳(メタデータ) (2026-02-14T19:39:15Z) - GERE: Generative Evidence Retrieval for Fact Verification [57.78768817972026]
本稿では,ジェネレーション方式で証拠を検索する最初のシステムであるGEREを提案する。
FEVERデータセットの実験結果は、GEREが最先端のベースラインよりも大幅に改善されていることを示している。
論文 参考訳(メタデータ) (2022-04-12T03:49:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。