論文の概要: SCIRIGOR:Evaluating Open-Ended Scientific Analysis Beyond Final Scores
- arxiv url: http://arxiv.org/abs/2609.06192v1
- Date: Sat, 05 Sep 2026 17:29:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.217125
- Title: SCIRIGOR:Evaluating Open-Ended Scientific Analysis Beyond Final Scores
- Title(参考訳): SCIRIGOR:ファイナルスコアを超えたオープンエンディング科学分析の評価
- Abstract要約: 我々は,エビデンスを基盤としたマルチモーダルな科学分析を定式化し,エージェントが実行可能分析と同一実行時の結果と視覚化によって支持されるクレームを生成することを要求した。
SciRIGORは6つの領域と17のサブフィールドにまたがる科学論文から100のケースをまとめた評価フレームワークとベンチマークである。
完全ベンチマークでは、主張はほぼ同じ率(91.8%対91.0%)で忠実で不信な結果に同意するが、ソフトエビデンスチェーンスコアでは62.6%、厳密な全チェーン成功では18.0%を超えない。
- 参考スコア(独自算出の注目度): 11.097584790037454
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Scientific coding agents produce interdependent code, results, figures, and claims, yet evaluating final outputs alone does not establish whether their conclusions are scientifically supported. We formulate evidence-grounded multimodal scientific analysis, requiring agents to produce executable analyses and claims supported by results and visualizations from the same run. We introduce SciRIGOR, an evaluation framework and benchmark comprising 100 cases from scientific articles across six domains and 17 subfields. The framework reconstructs typed evidence graphs, separates artifact fidelity from relational validity, and scores complete claim-support paths while localizing the earliest unsupported relation. Source-grounded alternative paths accommodate scientifically equivalent analyses and visualizations. We evaluate 11 agent/model configurations. On full-benchmark runs, claims agree with faithful and unfaithful results at nearly identical rates (91.8% versus 91.0%). Yet no system exceeds 62.6% on the soft evidence-chain score or 18.0% strict whole-chain success. These findings show that internal coherence does not establish scientific correctness: evaluation must verify support along the complete data-to-claim path.
- Abstract(参考訳): 科学的コーディングエージェントは、相互依存コード、結果、数字、クレームを生成するが、最終的なアウトプットの評価だけでは、その結論が科学的に支持されているかどうかを定めていない。
我々は,エビデンスを基盤としたマルチモーダルな科学分析を定式化し,エージェントが実行可能分析と同一実行時の結果と視覚化によって支持されるクレームを生成することを要求した。
SciRIGORは6つの領域と17のサブフィールドにまたがる科学論文から100のケースをまとめた評価フレームワークとベンチマークである。
このフレームワークは、型付きエビデンスグラフを再構築し、アーティファクトの忠実度を関係妥当性から分離し、最初期の関係をローカライズしながら完全なクレーム支持パスをスコアする。
ソース・グラウンドの代替経路は科学的に等価な分析と視覚化が可能である。
11のエージェント/モデル構成を評価した。
フルベンチマークでは、主張はほぼ同じ率(91.8%対91.0%)で忠実で不誠実な結果と一致している。
しかし、ソフトエビデンスチェーンのスコアで62.6%を超えるシステムや、18.0%の厳密な全チェーンの成功は存在しない。
これらの結果は、内部コヒーレンスが科学的正当性を確立していないことを示している。
関連論文リスト
- Mr.LHDR: A Benchmark for Multimodal Real-World Long-Horizon Deep Research Agents [72.19038675107662]
ミスターL(Mr. L)は、検証可能な証拠の長い、既約の連鎖について、現実世界の深い研究を評価するためのベンチマークである。
各質問は隠されたノード関係グラフから構築され、平均12.1の中間結論を必要とする。
論文 参考訳(メタデータ) (2026-09-10T09:47:44Z) - Sci-MMR: Benchmarking Multi-Step Evidence-Grounded Scientific Reasoning in Multimodal Agents [56.93800079330285]
既存のマルチモーダルベンチマークは、最終回答の精度を大きく評価する。
我々は,多段階のエビデンスに基づく科学的推論のためのベンチマークであるSci-MMRを紹介する。
その結果,解答精度は完全証拠回収率を20%以上上回ることがわかった。
論文 参考訳(メタデータ) (2026-09-10T08:41:07Z) - TruthInsightBench: An Evidence-Grounded Benchmark for Automated Evaluation of Open-Ended Scientific Discovery Agents [11.367029696505357]
本稿では,発見のためのベンチマークであるTruthInsightBenchを紹介する。
10の科学領域にわたる40の査読された研究から引き出された40の盲目タスクは、中立的な科学的目的と凍結したデータのみを露呈する。
固定LDMベースの審査員は、6次元に沿ってエージェント自身のクレームの明らかな成熟度を評価する。
論文 参考訳(メタデータ) (2026-09-04T12:37:20Z) - FrontierChallenge: Evaluating Scientific Workflow Completion [59.601983661596286]
私たちは300のエンドツーエンドの科学的成果物からなるクロスドメインベンチマークであるFrontierChallengeを紹介します。
量子化学、分子動力学、材料特性評価、分析化学、生命科学、電気化学・環境学にまたがる97の課題を公表し評価する。
高い部分的なスコアも自信のある完成のクレームも、科学的タスクが完全に納品されたことを確実に示さないことが分かりました。
論文 参考訳(メタデータ) (2026-08-25T16:50:58Z) - EarthVerse: Benchmarking Scientific Agents Across Dynamic Earth Systems and Natural Hazards [73.12811119273206]
我々は,包括的調査を通じて科学的エージェントを評価するベンチマークであるEarthVerseを紹介する。
エージェントは異種イベントパッケージを検査し、互換性のあるエビデンスを選択し、透過的な計算を実行し、ソース差を調整し、最終回答で証明を保存する。
システム全体では、平均回答ユニットの精度は84.65%であり、最も高いStrict@95は34.81%である。
論文 参考訳(メタデータ) (2026-08-24T17:29:16Z) - Bringing analytic rigor to agentic AI for science: The Brain Researcher platform for neuroimaging data analysis [59.44063760362954]
本稿では、神経イメージング研究者の計算環境で動作するエージェントリサーチハーネスであるBrain Researcherを紹介する。
ベンチマークでは、Brain Researcherは7つのモデルで第1選択ツールの選択精度を70.2ポイント向上させた。
共同研究と自己進化研究において、多元的分析によって分析選択感度が明らかにされ、科学的レビューでは、承認された、認定された、修正された、ブロックされた、拒否された、または延期された。
論文 参考訳(メタデータ) (2026-08-20T11:13:27Z) - EviGraph: Evidence-Guided Autonomous Research Agents [12.29802995923839]
我々は,研究プロセスを表す自律的な研究フレームワークであるEviGraphを,型付きエビデンスグラフとして紹介する。
EviGraphは、依存関係の欠如、セマンティックなミスアライメント、結果定義の不整合のエビデンスチェーンを検査する。
最初期の弱いノードをローカライズし、影響を受けた下流のサブグラフを再生する。
論文 参考訳(メタデータ) (2026-08-05T12:02:55Z) - HiEviDR-Bench: A Benchmark for Hierarchical Evidence Aggregation in Deep Research [52.87128503345243]
我々は,Deep Researchにおける階層的エビデンス・アグリゲーションを評価するためのベンチマークであるHiEviDR-Benchを紹介する。
HiEviDR-Benchは、エビデンスの選択、クロスソースリンク、アグリゲーションをキャプチャする明示的なエビデンスグラフを持つ各インスタンスを表す。
報告品質,エビデンストレーサビリティ,引用精度,クレーム検証,回答正当性という5次元のトレーサビリティ指向評価フレームワークを開発した。
論文 参考訳(メタデータ) (2026-07-27T23:50:46Z) - One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure Attribution [85.65263343588026]
我々は,自己修正型,自律型,接地型実験機であるSAGEを提案する。
その中核的なメカニズムであるMHFA(Multi-Hypothesis Failure Attribution)は、回復を構造的因果診断として扱う。
12のトピック、5ドメインのベンチマークでは、SAGEは基準リフレクションでメトリクスを含むアウトプットを42%から92%に増やしている。
論文 参考訳(メタデータ) (2026-06-30T10:54:16Z) - Can AI Agents Synthesize Scientific Conclusions? [35.01145833955259]
我々は、9.11K質問のベンチマークであるSciConBenchを紹介し、体系的なレビューから専門家による結論を導き、オープンドメインの科学的結論合成を評価する。
SciConHarnessも紹介する。SciConHarnessはクリーンルーム評価用ハーネスで、エージェントに制御されたWebインタラクションを装備し、有効測定を確実にする。
以上の結果から,科学的結論の信頼性は依然として未解決の課題であり,オープンドメインAIエージェントの評価にはクリーンルーム評価が不可欠であることが示唆された。
論文 参考訳(メタデータ) (2026-06-09T18:16:04Z) - RIGOURATE: Quantifying Scientific Exaggeration with Evidence-Aligned Claim Evaluation [29.44948404858214]
RIGOURATEは、紙の本体から証拠を回収し、各クレームにオーバーステートメントスコアを割り当てる。
このフレームワークは、ICLRとNeurIPSの論文から10K以上のクレームエビデンスセットのデータセットで構成されている。
論文 参考訳(メタデータ) (2026-01-07T19:36:08Z) - SciFact-Open: Towards open-domain scientific claim verification [61.288725621156864]
本稿では,科学的クレーム検証システムの性能評価を目的とした新しいテストコレクションであるSciFact-Openを提案する。
我々は、4つの最先端の科学的クレーム検証モデルの上位予測をプールし、注釈付けすることで、科学的クレームの証拠を収集する。
その結果,SciFact-Openへの一般化に苦慮する小形コーパス上で開発されたシステムは,少なくとも15F1の性能低下を示すことがわかった。
論文 参考訳(メタデータ) (2022-10-25T05:45:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。