論文の概要: Bringing analytic rigor to agentic AI for science: The Brain Researcher platform for neuroimaging data analysis
- arxiv url: http://arxiv.org/abs/2608.19902v1
- Date: Thu, 20 Aug 2026 11:13:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.539057
- Title: Bringing analytic rigor to agentic AI for science: The Brain Researcher platform for neuroimaging data analysis
- Title(参考訳): 科学のためのエージェントAIに分析的厳密性をもたらす: 神経画像データ分析のための脳研究プラットフォーム
- Authors: Zijiao Chen, Nicholas Lu, Xinhui Li, Jocelyn A. Ricard, Ce Ju, Huan H. Wang, Christian Kindermann, Jeanette A. Mumford, Steven Dillmann, James Kent, Alejandro de la Vega, Sanmi Koyejo, Vince D. Calhoun, Joshua W. Buckholtz, Juan Helen Zhou, Steffen Bollmann, Russell A. Poldrack,
- Abstract要約: 本稿では、神経イメージング研究者の計算環境で動作するエージェントリサーチハーネスであるBrain Researcherを紹介する。
ベンチマークでは、Brain Researcherは7つのモデルで第1選択ツールの選択精度を70.2ポイント向上させた。
共同研究と自己進化研究において、多元的分析によって分析選択感度が明らかにされ、科学的レビューでは、承認された、認定された、修正された、ブロックされた、拒否された、または延期された。
- 参考スコア(独自算出の注目度): 59.44063760362954
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AI agents can execute scientific analyses, but an analytic output becomes a defensible claim only after alternatives are weighed and the claim is limited to what the evidence supports. Agents may reproduce failures including selective analysis, premature declarations of success and optimization of imperfect criteria. We present Brain Researcher, an agentic research harness operating in a neuroimaging researcher's computational environment under rules for admissible analyses, required checks and claim scope. In benchmarks, Brain Researcher increased first-choice tool-selection accuracy across seven models by 70.2 percentage points (23.3% without it versus 93.6% with it) and verifiable grounding from 4.6% to 22.0%. In collaborator-led and self-evolving studies, multiverse analyses exposed analytic-choice sensitivity, and scientific review classified claims as accepted, qualified, revised, blocked, rejected or deferred. By linking decisions to evidence and provenance, Brain Researcher embeds methodological judgment within the workflow, not after it.
- Abstract(参考訳): AIエージェントは科学的分析を実行することができるが、分析出力は、代替案が評価され、証拠が支持するものに限定された後にのみ、防御可能なクレームとなる。
エージェントは選択分析、成功の早期宣言、不完全な基準の最適化を含む失敗を再現することができる。
本稿では、神経イメージング研究者の計算環境において、許容可能な分析、要求チェック、クレームスコープのルールの下で機能するエージェントリサーチハーネスであるBrain Researcherを紹介する。
ベンチマークでは、Brain Researcherは7つのモデルで第1選択のツール選択精度を70.2ポイント(23.3%で93.6%)向上させ、4.6%から22.0%に改善した。
共同研究と自己進化研究において、多元的分析によって分析選択感度が明らかにされ、科学的レビューでは、承認された、認定された、修正された、ブロックされた、拒否された、または延期された。
決定を証拠と証明にリンクすることで、Brain Researcherはワークフローの後にではなく、方法論的な判断を組み込む。
関連論文リスト
- CausalGame: Benchmarking Causal Thinking of LLM Agents in Games [55.189910630332065]
CausalGameは、AI Scientistsの因果思考能力を評価するためのベンチマークである。
選択バイアス、測定エラー、隠れた共同設立者を含む14のシナリオを設計します。
最高のモデルは78-85%の分析最適値に対して68.0%しか生存できず、セッションの5-7%は因果推論するルーリックのクレジットを受け取っている。
論文 参考訳(メタデータ) (2026-07-05T13:08:51Z) - The Agentic Garden of Forking Paths [27.003267976848225]
我々は、AIエージェントが人間の研究者の多くの分析的変化を捉えながら、これらの経路を明確にすることを示した。
4つの高い領域にまたがって、異なるペルソナを割り当てることは、AIエージェントが異質な、しばしば反対する結論を報告するのに十分である。
反対の結論に達したとしても、最終的なAIレポートに基づいて、各分析における明確な問題を特定することは困難である。
論文 参考訳(メタデータ) (2026-07-01T22:15:37Z) - Benchmarking AI Agents for Addressing Scientific Challenges Across Scales [118.2204632627895]
SciAgentArenaは、現実世界の科学研究シナリオでAIエージェントを評価するための体系的なベンチマークである。
ステップワイズ検証を備えた約200のタスクと、多様なAIエージェントを評価するためのインタラクティブでエージェントに依存しない環境で構成される。
タスク構造や評価基準が明確である場合, 現状のエージェントはデータ分析に効果的に貢献できることがわかった。
論文 参考訳(メタデータ) (2026-06-10T22:55:30Z) - ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research [142.29356526274387]
我々は自律的な科学的研究を評価するためのベンチマークであるResearchClawBenchを紹介する。
各タスクは、実際の論文に基づき、関連する文献や生データを提供し、評価中に対象の論文を隠蔽する。
論文 参考訳(メタデータ) (2026-05-28T16:27:40Z) - SciResearcher: Scaling Deep Research Agents for Frontier Scientific Reasoning [54.194672921128785]
我々は、フロンティア科学データ構築のための完全に自動化されたエージェントフレームワークであるSciResearcherを紹介する。
SciResearcherは、学術的証拠に基づく様々な概念的および計算的なタスクを合成する。
我々は,HLE-Bio/Chem-Goldベンチマークで19.46%を達成できるエージェント基盤モデルであるSciResearcher-8Bを開発した。
論文 参考訳(メタデータ) (2026-05-02T15:26:45Z) - Rethinking the AI Scientist: Interactive Multi-Agent Workflows for Scientific Discovery [0.17341675932416767]
本稿では,数分で測定したターンアラウンド時間を用いて,インタラクティブな科学的調査を可能にするマルチエージェントシステムであるDeep Researchを紹介する。
このアーキテクチャは、永続的な世界状態を通じて統合された計画、データ分析、文献検索、新規性検出のための特殊なエージェントから構成される。
BixBenchの計算生物学ベンチマークによる評価は、最先端のパフォーマンスを示し、オープンレスポンスでは48.8%、マルチチョイス評価では64.4%の精度を達成した。
論文 参考訳(メタデータ) (2026-01-18T19:12:41Z) - AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite [75.58737079136942]
本稿では,AstaBenchについて紹介する。AstaBenchは,科学的研究を行うためのエージェント能力の総合的な測定を行うスイートである。
私たちのスイートには、プロダクショングレードの検索ツールを備えた、最初の科学研究環境が付属しています。
22のエージェントクラスで57のエージェントを評価したところ,いくつかの興味深い結果が得られた。
論文 参考訳(メタデータ) (2025-10-24T17:10:26Z) - BLADE: Benchmarking Language Model Agents for Data-Driven Science [21.682416167339635]
プランニング、メモリ、コード実行機能を備えたLMベースのエージェントは、データ駆動科学をサポートする可能性がある。
本稿では,エージェントの多面的アプローチを自動的に評価するベンチマークBLADEについて述べる。
論文 参考訳(メタデータ) (2024-08-19T02:59:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。