論文の概要: TruthInsightBench: An Evidence-Grounded Benchmark for Automated Evaluation of Open-Ended Scientific Discovery Agents
- arxiv url: http://arxiv.org/abs/2609.05079v2
- Date: Tue, 08 Sep 2026 03:39:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 14:43:42.044837
- Title: TruthInsightBench: An Evidence-Grounded Benchmark for Automated Evaluation of Open-Ended Scientific Discovery Agents
- Title(参考訳): TruthInsightBench: オープンエンディング科学発見エージェントの自動評価のためのエビデンス付きベンチマーク
- Authors: Zhibo Yang, Chen Zhang, Yuewei Zhang, Hao Wang,
- Abstract要約: 本稿では,発見のためのベンチマークであるTruthInsightBenchを紹介する。
10の科学領域にわたる40の査読された研究から引き出された40の盲目タスクは、中立的な科学的目的と凍結したデータのみを露呈する。
固定LDMベースの審査員は、6次元に沿ってエージェント自身のクレームの明らかな成熟度を評価する。
- 参考スコア(独自算出の注目度): 11.367029696505357
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autonomous coding agents are increasingly proposed as AI-scientist systems that conduct analyses and write research reports, but executing a prescribed analysis is not the same as making a discovery. Existing benchmarks are configured for reproduction: tasks, data, and rubrics are built around a hidden target study, and recovery of its result is rewarded. We present TruthInsightBench, a benchmark configured for discovery. Its 40 blind tasks, drawn from 40 peer-reviewed studies across 10 scientific domains, expose only a neutral scientific objective and frozen data; source conclusions, expected values, and analysis paths are withheld, leaving the agent to determine what claim the data support. A fixed LLM-based judge scores the evidentiary maturity of an agent's own claims along six dimensions, operationalized as 29 artifact-grounded items, with automated, deterministic aggregation and no per-instance human grading, so evaluation can be repeated automatically as agents evolve. On one frozen base model, four coding agents form a narrow plateau (58.4-60.3 of 100) with no statistically reliable pairwise separation: they execute and document analyses competently, with comparatively strong evidence auditability and novelty, but largely lack the discriminating acts that establish a trustworthy claim (controls, robustness, falsifiability, and cross-dataset generalization). The bottleneck is scientific judgment rather than coding, and genuine discovery remains out of reach. TruthInsightBench makes this gap a measurable target; data and scoring code are at https://github.com/TruthInsight-stack/TruthInsightBench.
- Abstract(参考訳): 自律的なコーディングエージェントは、分析を行い、研究報告を書くAI科学者システムとしてますます提案されているが、所定の分析を実行することは、発見を行うのと同じではない。
タスク、データ、ルーブリックは、隠れたターゲット研究の周りに構築され、その結果の回復が報われる。
本稿では,発見のためのベンチマークであるTruthInsightBenchを紹介する。
10の科学領域にわたる40の査読された研究から引き出された40の盲目タスクは、中立的な科学的目的と凍結したデータのみを露呈する。
固定LDMベースの裁判官は、6次元に沿ってエージェント自身のクレームの明らかな成熟度をスコアし、29個のアーティファクトグラウンドアイテムとして操作され、自動的決定論的アグリゲーションと、エージェントが進化するにつれて自動的に評価が繰り返される。
1つの凍結されたベースモデルにおいて、4つの符号化エージェントは、統計的に信頼性の高いペアワイズ分離のない狭い台地(58.4-60.3 of 100)を形成する。
ボトルネックはコーディングではなく科学的判断であり、真の発見は到達できないままです。
データはhttps://github.com/TruthInsight-stack/TruthInsightBenchにある。
関連論文リスト
- EarthVerse: Benchmarking Scientific Agents Across Dynamic Earth Systems and Natural Hazards [73.12811119273206]
我々は,包括的調査を通じて科学的エージェントを評価するベンチマークであるEarthVerseを紹介する。
エージェントは異種イベントパッケージを検査し、互換性のあるエビデンスを選択し、透過的な計算を実行し、ソース差を調整し、最終回答で証明を保存する。
システム全体では、平均回答ユニットの精度は84.65%であり、最も高いStrict@95は34.81%である。
論文 参考訳(メタデータ) (2026-08-24T17:29:16Z) - Are LLMs Ready for Scientific Discovery? A Capability-Oriented Benchmark for AI Scientists [5.947663261819682]
SDABenchは5つの領域(生物、化学、環境、地理、物理)にわたる6つの能力(記述、探索、推論、予測、因果、力学)に関する評価を再編成するベンチマークである。
記述的モデルは解析をうまく処理するが、仮定の選択、潜在プロセスモデリング、あるいは機械的推論を必要とするタスクを著しく分解する。
論文 参考訳(メタデータ) (2026-07-13T04:39:40Z) - One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure Attribution [85.65263343588026]
我々は,自己修正型,自律型,接地型実験機であるSAGEを提案する。
その中核的なメカニズムであるMHFA(Multi-Hypothesis Failure Attribution)は、回復を構造的因果診断として扱う。
12のトピック、5ドメインのベンチマークでは、SAGEは基準リフレクションでメトリクスを含むアウトプットを42%から92%に増やしている。
論文 参考訳(メタデータ) (2026-06-30T10:54:16Z) - Position: Correct Answer, Wrong Mechanism -- When AI Scientists Defend General Claims Their Own Data Contradicts [0.0]
コーディングエージェントは信頼できるツールを証明しているが、オープンエンドのクレーム作成のための信頼性の低い科学的共著者である。
一段階の体制シフトチェックは、エージェントのクレームのみを必要とし、過度に一般化されたケースにフラグを付ける。
コンパニオン再計算は、正しいオブザーバブルがわかっている場合の残りのケースをフラグする。
論文 参考訳(メタデータ) (2026-06-22T11:14:07Z) - InfiniteScienceGym: An Unbounded, Procedurally-Generated Benchmark for Scientific Analysis [19.4536238905905]
InfiniteScienceGymは、検証可能な質問応答タスクと組み合わせた、手続き的に生成された科学リポジトリのベンチマークである。
シードから、シミュレータは、現実的なディレクトリ構造、ファイル、表データを備えた自己完結型リポジトリを確定的に生成し、特権QA生成器は、正確な根拠真理で、回答可能な質問と解決できない質問の両方を生成する。
全体的な精度は45%を超えず、解決不可能な質問を認識することは依然として大きな弱点であり、強力なモデルでは単にトークンを消費するのではなく、ツールを効果的に使用する傾向にあります。
論文 参考訳(メタデータ) (2026-04-14T18:23:02Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - DREAM: Deep Research Evaluation with Agentic Metrics [21.555357444628044]
本稿では,DREAM(Deep Research Evaluation with Agentic Metrics)を提案する。
DREAM構造評価は、クエリ非依存のメトリクスとツール呼び出しエージェントが生成する適応的なメトリクスを組み合わせた評価プロトコルを用いて行われる。
制御された評価は、DREAMが既存のベンチマークよりも事実や時間的劣化にかなり敏感であることを示している。
論文 参考訳(メタデータ) (2026-02-21T19:14:31Z) - FIRE-Bench: Evaluating Agents on the Rediscovery of Scientific Insights [63.32178443510396]
FIRE-Bench (Full-cycle Insight Rediscovery Evaluation) は、確立された発見の再検討を通じてエージェントを評価するベンチマークである。
最強のエージェントでさえ、限られた再発見成功(50 F1)を達成し、実行中に高いばらつきを示し、実験的な設計、実行、エビデンスに基づく推論において繰り返し失敗モードを表示する。
論文 参考訳(メタデータ) (2026-02-02T23:21:13Z) - DiscoveryBench: Towards Data-Driven Discovery with Large Language Models [50.36636396660163]
我々は、データ駆動探索の多段階プロセスを形式化する最初の包括的なベンチマークであるDiscoveryBenchを紹介する。
我々のベンチマークには、社会学や工学などの6つの分野にまたがる264のタスクが含まれている。
私たちのベンチマークでは、自律的なデータ駆動型発見の課題を説明し、コミュニティが前進するための貴重なリソースとして役立ちます。
論文 参考訳(メタデータ) (2024-07-01T18:58:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。