論文の概要: Learning to Evaluate Before Improving: Automatic Rubric Induction for Automatic Research Agents
- arxiv url: http://arxiv.org/abs/2608.31076v1
- Date: Mon, 31 Aug 2026 16:48:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.523605
- Title: Learning to Evaluate Before Improving: Automatic Rubric Induction for Automatic Research Agents
- Title(参考訳): 改善前に評価する学習: 自動研究エージェントのためのゴム自動誘導
- Abstract要約: AutoSciRubは評価ファーストのフレームワークで、研究実行前にタスク固有の実行ファイルを誘導する。
AutoSciRubは、未特定の命令を原子科学的目標に分解し、関連する文献やタスク可視データに基礎を置いて、特定の、実行可能な、検証可能な基準を合成する。
改訂期間中、ルーブリック誘導検証は未測定の基準を特定し、研究報告の目的の精査を可能にする。
- 参考スコア(独自算出の注目度): 16.43230671992556
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Autonomous scientific research agents are increasingly applied to end-to-end scientific workflows, including literature review, data analysis, experimentation, and report generation. However, open-ended research tasks often do not clearly specify the analyses, methods, and success criteria required to complete the task. As a result, agents may miss important analyses, use inappropriate methods, or draw conclusions that are insufficiently supported by evidence. To address the problem, we present AutoSciRub, an evaluation-first framework that induces a task-specific executable rubric before research execution, and uses it to guide execution, criterion-level verification as well as iterative revision. AutoSciRub decomposes an underspecified instruction into atomic scientific goals, grounds them in relevant literature and task-visible data, and synthesizes specific, actionable, and verifiable criteria. The resulting rubric makes implicit experimental and evidential requirements explicit, providing guidance for experiments and analyses. During revision, rubric-guided verification identifies unmet criteria and enables targeted refinement of the research report and its supporting artifacts. On ResearchClawBench, AutoSciRub consistently improves all tested configurations, with an average gain of 2.08 points across three backbone LLMs under the fixed Codex harness and 2.95 points across three agent harnesses using a fixed DeepSeek-V4-Flash backbone. On a randomly sampled 20-task subset of AstaBench E2E Discovery, AutoSciRub further achieves an average improvement of 16.8 points across three agent harnesses, while maintaining or increasing the number of successfully completed tasks. These results demonstrate that evaluation-first guidance provides an effective and generalizable control mechanism for autonomous scientific research (Code: https://github.com/zjunlp/AutoSciRub).
- Abstract(参考訳): 自律科学研究エージェントは、文献レビュー、データ分析、実験、レポート生成など、エンドツーエンドの科学ワークフローにますます適用されている。
しかし、オープンエンドの研究タスクは、そのタスクを完了させるために必要な分析、方法、成功基準を明確に示さないことが多い。
その結果、エージェントは重要な分析を見逃したり、不適切な方法を使ったり、証拠によって不十分に支持された結論を導いたりすることができる。
この問題に対処するために、AutoSciRubは、研究実行前にタスク固有の実行可能ルーブリックを誘導する評価ファーストフレームワークで、実行のガイドや基準レベルの検証、反復的なリビジョンを行う。
AutoSciRubは、未特定の命令を原子科学的目標に分解し、関連する文献やタスク可視データに基礎を置いて、特定の、実行可能な、検証可能な基準を合成する。
結果として生じるルーリックは暗黙の実験的および明白な要求を明確化し、実験と分析のためのガイダンスを提供する。
改訂期間中、ルーリックガイドによる検証は、未測定の基準を特定し、研究報告とその支援品の改定を可能にする。
ResearchClawBenchでは、AutoSciRubはテストされたすべての構成を一貫して改善し、固定されたCodexハーネスの下で3つのバックボーンLLMで平均2.08ポイント、固定されたDeepSeek-V4-Flashバックボーンで3つのエージェントハーネスで平均2.95ポイントを獲得した。
AstaBench E2E Discoveryのランダムな20タスクサブセットでは、AutoSciRubはさらに3つのエージェントハーネスの平均16.8ポイントの改善を達成し、完了したタスクの数を維持または増加させた。
これらの結果は、評価ファーストガイダンスが自律科学研究に効果的で一般化可能な制御メカニズムを提供することを示している(コード: https://github.com/zjunlp/AutoSciRub)。
関連論文リスト
- PaperDoctor: Evidence-Grounded and Actionable Feedback for Scientific Papers in Progress [130.58520199343707]
PaperDoctorは,3つの重要なイノベーションを備えた,サブミッション前のフィードバックのためのエージェントフレームワークである。
まず、全体論的階層的なフレームワークは、書き込み、レイアウト、参照、コード、理論、先行作業、実験を評価します。
第二に、各発見には、観察、文、方程式、コードラインなどの特定の証拠へのポインタ、修正提案が含まれる。
第3に、PaperDoctorはクレームの重要性と計算予算に基づいて実験を選択的に再構築し、再実行する。
論文 参考訳(メタデータ) (2026-09-15T11:08:11Z) - ARAC: Benchmarking Auto-Research's Alignment and Completeness on End-to-End Researchs [16.098240211046548]
ARAC-BenchはResearcher-Mimicking Evaluationフレームワークである。
最終回答の一致から、高品質な人間の研究プロセスの再現へと目標をシフトする。
ARAC-Benchは、微細な診断ツールだけでなく、スケーラブルな報酬信号も提供する。
論文 参考訳(メタデータ) (2026-08-13T03:48:07Z) - From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution [14.763650534859176]
我々は、31のトピックと10の主要なカテゴリにまたがる500のディープリサーチタスクの検証可能なベンチマークを紹介します。
このベンチマークはExplorer-Formalizer-Challengerパイプラインを使って自動的に構築される。
私たちのデータ、実装、結果は公開されています。
論文 参考訳(メタデータ) (2026-08-03T12:43:00Z) - An Agentic Approach Towards Replication Package Quality Evaluation [1.6950215926321557]
本稿では,複製パッケージの品質評価のためのエージェント的アプローチについて検討する。
我々は34のソースから380の要件を51の基準に集約し、そのうち31は自動アーティファクトベースの評価のために運用されている。
5つの複製パッケージの予備評価は、91.4%と75.4%の高い実行間一貫性を示している。
論文 参考訳(メタデータ) (2026-06-01T10:00:41Z) - AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery [55.70879973230979]
AutoResearchBenchは、自律的な科学文献発見のためのベンチマークである。
エージェントWebブラウジングに関する以前のベンチマークと比較すると、AutoResearchBenchは研究指向である。
最も強力なLCMでさえ、BrowseCompのような一般的なエージェントによるWebブラウジングベンチマークをほとんど征服したにもかかわらず、Deep Researchでは9.39%、Wide Researchでは9.31%の精度しか達成していない。
論文 参考訳(メタデータ) (2026-04-28T06:05:17Z) - Can LLM Agents Generate Real-World Evidence? Evaluating Observational Studies in Medical Databases [17.35673829214932]
我々は、MIMIC-IVをベースとしたRWE-benchについて、ピアレビューによる観察研究から紹介する。
各タスクは対応する研究プロトコルを基準として提供し、エージェントは実際のデータベースで実験を行う必要がある。
162タスク全体では、タスク成功率は低く、最高のエージェントが39.9%、最高のオープンソースモデルが30.4%に達する。
論文 参考訳(メタデータ) (2026-03-24T03:50:34Z) - The Story is Not the Science: Execution-Grounded Evaluation of Mechanistic Interpretability Research [56.80927148740585]
我々は、動的に進化し、研究評価者としてAIエージェントを開発することで、スケーラビリティと厳密さの課題に対処する。
我々は,機械的解釈可能性の研究をテストベッドとして使用し,標準化された研究成果を構築し,MechEvalAgentを開発した。
我々の研究は、AIエージェントが研究評価を変革し、厳格な科学的実践の道を開く可能性を実証している。
論文 参考訳(メタデータ) (2026-02-05T19:00:02Z) - FIRE-Bench: Evaluating Agents on the Rediscovery of Scientific Insights [63.32178443510396]
FIRE-Bench (Full-cycle Insight Rediscovery Evaluation) は、確立された発見の再検討を通じてエージェントを評価するベンチマークである。
最強のエージェントでさえ、限られた再発見成功(50 F1)を達成し、実行中に高いばらつきを示し、実験的な設計、実行、エビデンスに基づく推論において繰り返し失敗モードを表示する。
論文 参考訳(メタデータ) (2026-02-02T23:21:13Z) - DeepResearchEval: An Automated Framework for Deep Research Task Construction and Agentic Evaluation [56.886936435727854]
DeepResearchEvalは、ディープリサーチタスク構築とエージェント評価のための自動化フレームワークである。
タスク構築のために,多様なユーザプロファイルに固定された現実的で複雑な研究タスクを生成するペルソナ駆動パイプラインを提案する。
評価には,タスク固有の評価次元,基準,重みを動的に導出する適応的ポイントワイド品質評価と,引用が欠落した場合でもWeb検索によるレポート文の自動抽出と検証を行うアクティブ・ファクト・チェッキングの2つの要素からなるエージェントパイプラインを提案する。
論文 参考訳(メタデータ) (2026-01-14T18:38:31Z) - OpenNovelty: An LLM-powered Agentic System for Verifiable Scholarly Novelty Assessment [63.662126457336534]
OpenNoveltyは、透明で証拠に基づく新規性分析のためのエージェントシステムである。
回収された実論文のすべての評価を根拠にし、検証可能な判断を確実にする。
OpenNoveltyは、公正で一貫性があり、エビデンスに支えられたピアレビューを促進するスケーラブルなツールで、研究コミュニティに力を与えることを目指している。
論文 参考訳(メタデータ) (2026-01-04T15:48:51Z) - AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite [75.58737079136942]
本稿では,AstaBenchについて紹介する。AstaBenchは,科学的研究を行うためのエージェント能力の総合的な測定を行うスイートである。
私たちのスイートには、プロダクショングレードの検索ツールを備えた、最初の科学研究環境が付属しています。
22のエージェントクラスで57のエージェントを評価したところ,いくつかの興味深い結果が得られた。
論文 参考訳(メタデータ) (2025-10-24T17:10:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。