論文の概要: EPOCH: Reliable Discovery through Evidence-Governed Search
- arxiv url: http://arxiv.org/abs/2610.06986v1
- Date: Sun, 04 Oct 2026 06:51:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.495428
- Title: EPOCH: Reliable Discovery through Evidence-Governed Search
- Title(参考訳): EPOCH:Evidence-Governed Searchによる信頼性の高い発見
- Abstract要約: AI研究エージェントのためのエビデンス管理アーキテクチャであるEPOCHを紹介する。
EPOCHは明示的なタスク契約、型付きメモリ、アクティブ・ファルシフィケーション、入場チェック、独立リプレイを組み合わせることでエビデンスに支配された発見ループを実装している。
- 参考スコア(独自算出の注目度): 0.21800539487777928
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI research agents are increasingly used to search over programs, mathematical constructions, and proofs. However, existing systems typically optimize evaluator feedback without adequately governing how that feedback is interpreted, challenged, and reused. As a result, promising but fragile candidates can be promoted as discoveries, while benchmark improvements, finite certificates, and theorem-level claims are too easily conflated. We introduce EPOCH, an evidence-governed architecture designed to close this gap. EPOCH implements an evidence-governed discovery loop by combining explicit task contracts, typed memory, active falsification, admission checks, and independent replay, so that each candidate is evaluated against the strength and scope of the claim it supports. EPOCH achieves state-of-the-art aggregate performance on AlgoTune, substantially exceeding the strongest baseline in mean normalized score (0.65 vs. 0.53), and attains the highest mean score on the internal Math14 suite (0.57). It further shows favorable held-out behavior under official-test replay and leads the descriptive aggregate on AgentHPO. Across ten discovery problems, EPOCH delivers substantial task-specific advances, including improved executable constructions, optimized algorithms, counterexamples, and proof-supported results. These advances demonstrate its ability to convert search into concrete progress across mathematical and computational domains. Together, the results suggest that evidence governance is a necessary step toward AI research agents that produce not only stronger solutions, but also more trustworthy scientific discoveries.
- Abstract(参考訳): AI研究エージェントは、プログラム、数学的構成、証明の探索にますます利用されている。
しかし、既存のシステムは、フィードバックがどのように解釈され、挑戦され、再利用されるかを適切に制御することなく、一般的に評価器のフィードバックを最適化する。
その結果、有望だが脆弱な候補は発見として推し進めることができ、ベンチマークの改善、有限証明、定理レベルのクレームはあまりに簡単に混同される。
EPOCHは、このギャップを埋めるために設計されたエビデンス管理アーキテクチャである。
EPOCHは、明示的なタスクコントラクト、型付きメモリ、アクティブなファルシフィケーション、インプットチェック、独立したリプレイを組み合わせることで、エビデンスに支配された発見ループを実装し、各候補が支持するクレームの強度とスコープに対して評価される。
EPOCHはAlgoTune上での最先端の集計性能を達成し、平均正規化スコア(0.65対0.53)で最強のベースラインをはるかに上回り、内部のMath14スイート(0.57)で最高スコアを達成している。
さらに、オフィシャルテストのリプレイ下での良好な保留動作を示し、AgentHPOの記述的な集約を導く。
EPOCHは10の発見問題全体で、実行可能な構築の改善、最適化されたアルゴリズム、反例、証明支援された結果など、タスク固有の大幅な進歩を実現している。
これらの進歩は、探索を数学的および計算的領域にまたがる具体的な進歩に変換する能力を示す。
結果は、エビデンスガバナンスは強力なソリューションだけでなく、信頼できる科学的発見を生み出すAI研究エージェントにとって必要なステップであることを示している。
関連論文リスト
- Dr.Credit: Rubric-Grounded Process Credit Assignment for Deep Research Agents [50.29411792939258]
ルーブリックグラウンドのクレジットは、最終回答の評価とプロセスの監督のための共有リファレンスとしてタスク要求を使用する。
Dr.Creditは、深い研究エージェントのためのRLフレームワークで中間ツールターンを監督するために、ルーリックグラウンドのクレジットを使用している。
論文 参考訳(メタデータ) (2026-09-28T04:43:12Z) - EAVer: Long-Form Factuality Verification as an End-to-End Agentic Policy [50.665874114632]
我々は、完全な応答レベルの検証ワークフローを統一ポリシーとして制御することを学ぶ、エンドツーエンドのエージェント検証であるEAVerを紹介する。
EAVerはセマンティック関連クレームをグループ化し、信頼に基づいた直接検証やターゲット検索にルートし、コンパクトなインコンテキストメモで検索によって返される証拠を保持する。
論文 参考訳(メタデータ) (2026-09-02T21:00:35Z) - Contextual Information Policy Optimization for Search Agents [25.589979477350095]
我々は,政策最適化と外部エビデンス利用の整合を図るために,文脈情報政策最適化(CIPO)を提案する。
CIPOは、検索された情報に影響された推論行動にターンレベルクレジットを割り当て、このエビデンス利用信号とグローバルな結果報酬を組み合わせて、回答の正当性を維持する。
実験によると、CIPOは事前駆動推論の頻度を減らし、ほとんどのタスクにおいて優れたパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-08-06T15:01:29Z) - CoSearch: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Search [51.911048955965136]
CoSearchは多段階推論エージェントと生成ドキュメントランキングモデルを共同でトレーニングするフレームワークである。
この結果から, 推論エージェントと検索システムの協調訓練は, 実現可能であり, 性能も高いことが示唆された。
論文 参考訳(メタデータ) (2026-04-19T17:48:17Z) - FIRE-Bench: Evaluating Agents on the Rediscovery of Scientific Insights [63.32178443510396]
FIRE-Bench (Full-cycle Insight Rediscovery Evaluation) は、確立された発見の再検討を通じてエージェントを評価するベンチマークである。
最強のエージェントでさえ、限られた再発見成功(50 F1)を達成し、実行中に高いばらつきを示し、実験的な設計、実行、エビデンスに基づく推論において繰り返し失敗モードを表示する。
論文 参考訳(メタデータ) (2026-02-02T23:21:13Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent [74.10138164281618]
BrowseComp-Plus(BrowseComp-Plus)は、BrowseCompから派生したベンチマークである。
このベンチマークは、ディープリサーチエージェントと検索方法の総合的な評価とアンタングル解析を可能にする。
論文 参考訳(メタデータ) (2025-08-08T17:55:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。