論文の概要: AI's Capability in Assisting Scientific Research in Physics, Astrophysics, and Cosmology I: Literature Review
- arxiv url: http://arxiv.org/abs/2607.25672v1
- Date: Tue, 28 Jul 2026 12:51:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.84105
- Title: AI's Capability in Assisting Scientific Research in Physics, Astrophysics, and Cosmology I: Literature Review
- Title(参考訳): 物理学・天体物理学・宇宙学におけるAIの科学研究支援能力 I:文献レビュー
- Abstract要約: 本研究では,大規模言語モデル(LLM)が学術研究の文献レビューにどの程度役立つかを検討する。
我々は、物理学、天体物理学、宇宙論の分野にまたがる8つの専門家による研究プロジェクトについて、制御された研究を行う。
2025年中頃のLLM (ChatGPT-4o, ChatGPT Deep Research, Gemini) で選択された文献と比較した。
人間とAIが選択した参照の重複は小さく(6%)、AIモデルはまだ有能な専門家による検索を独自に再現していないことを示している。
- 参考スコア(独自算出の注目度): 2.2351980005694156
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We investigate how well large language models (LLMs) can assist with literature reviews for scientific research. We perform a controlled study of eight expert-conceived research projects across the areas of physics, astrophysics, and cosmology. Each project has a defined background and goal, and human experts and AI prompters are asked to perform identical literature review tasks in parallel. We compare the relevant literature selected by humans with that selected by mid-2025 LLMs (ChatGPT-4o, ChatGPT Deep Research, and Gemini). We find the overlap between human- and AI-selected references to be small ($<$6\%), indicating that AI models do not yet reproduce a competent expert search on their own, though they have the potential to complement literature searches by humans. We then assess the reliability and completeness of AI-generated candidate references, distinguishing two types of hallucination: fabrications (references to nonexistent papers) and metadata mismatches (real papers with one or more incorrect fields). We find that while fabricated references make up 3\% of the AI-generated references, 64\% are real papers with at least one incorrect field (title, author, year, journal, DOI, or link), indicating that the mid-2025 models require systematic verification. However, the performance is significantly improved for the 2026 model ChatGPT Pro 5.5, with a single-project test showing zero fabrication or metadata mismatches.
- Abstract(参考訳): 本研究では,大規模言語モデル(LLM)が学術研究の文献レビューにどの程度役立つかを検討する。
我々は、物理学、天体物理学、宇宙論の分野にまたがる8つの専門家による研究プロジェクトについて、制御された研究を行う。
それぞれのプロジェクトには背景と目標が定義されており、人間の専門家とAIプロンプトには、同じ文献レビュータスクを並行して実行するように求められている。
2025年中頃のLLM (ChatGPT-4o, ChatGPT Deep Research, Gemini) で選択された文献と比較した。
人間の選択した参照とAIが選択した参照の重複は小さい($6\%)ことを示し、AIモデルは、人間による文学的な検索を補完する可能性があるが、自分自身で有能な専門家検索を再現していないことを示している。
次に、AI生成した候補参照の信頼性と完全性を評価し、生成(既存の論文への参照)とメタデータミスマッチ(1つ以上の誤ったフィールドを持つ実際の論文)の2種類の幻覚を区別する。
製造された参照はAI生成参照の3\%を占めるが、64\%は、少なくとも1つの誤った分野(タイトル、著者、年、ジャーナル、DOI、リンク)を持つ実際の論文であり、2025年半ばのモデルには体系的な検証が必要であることを示している。
しかし、2026年モデルのChatGPT Pro 5.5の性能は大幅に改善され、単一のプロジェクトテストでは製造やメタデータのミスマッチがゼロであった。
関連論文リスト
- On the limits and opportunities of AI reviewers: Reviewing the reviews of Nature-family papers with 45 expert scientists [113.03797263688519]
多くの科学者は、AIレビュアーを研究を評価する専門知識のない確率的システムと見なしている。
既存のAIレビュアーの評価では、評決が人間の評決に合致するかどうかに焦点が当てられている。
論文 参考訳(メタデータ) (2026-05-20T03:33:55Z) - AI for Auto-Research: Roadmap & User Guide [107.0834449839233]
研究ライフサイクル全体にわたってAIをエンドツーエンドに分析する。
我々は、信頼できる援助と信頼できない自律性の間に、鋭くステージに依存した境界を特定できる。
障害モードを排除するのではなく、より大きな自動化が不明瞭であることが示されています。
論文 参考訳(メタデータ) (2026-05-18T17:08:26Z) - AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery [55.70879973230979]
AutoResearchBenchは、自律的な科学文献発見のためのベンチマークである。
エージェントWebブラウジングに関する以前のベンチマークと比較すると、AutoResearchBenchは研究指向である。
最も強力なLCMでさえ、BrowseCompのような一般的なエージェントによるWebブラウジングベンチマークをほとんど征服したにもかかわらず、Deep Researchでは9.39%、Wide Researchでは9.31%の精度しか達成していない。
論文 参考訳(メタデータ) (2026-04-28T06:05:17Z) - RPC-Bench: A Fine-grained Benchmark for Research Paper Comprehension [65.81339691942757]
RPC-Bench(RPC-Bench)は、高品質なコンピュータサイエンス論文のレビュー・リビューの交換から構築された大規模質問応答ベンチマークである。
我々は、科学研究の流れに沿ったきめ細かい分類を設計し、モデルがなぜ、何、どのように学術的な文脈で質問するかを理解し、答える能力を評価する。
論文 参考訳(メタデータ) (2026-01-14T11:37:00Z) - ResearchGPT: Benchmarking and Training LLMs for End-to-End Computer Science Research Workflows [109.34792911044394]
CS-54k(CS-54k)は、コンピュータ科学におけるQ&Aペアの高品質なコーパスである。
CS-4kは、科学研究を支援するAIの能力を評価するためのベンチマークである。
CS-50kは大規模なトレーニングデータセットである。
論文 参考訳(メタデータ) (2025-10-23T07:07:35Z) - When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research [19.97666809905332]
大規模言語モデル(LLM)は、AIコサイシストと呼ばれる自動科学的発見のビジョンを加速させた。
大規模言語モデル(LLM)の最近の進歩は、しばしばAIコサイシストと呼ばれる自動科学的発見のビジョンを加速させた。
論文 参考訳(メタデータ) (2025-05-17T05:45:16Z) - ScholarCopilot: Training Large Language Models for Academic Writing with Accurate Citations [45.57178343138677]
我々はScholarCopilotを紹介した。ScholarCopilotは学術書記のための既存の大規模言語モデルを強化するために設計された統合フレームワークである。
ScholarCopilotは、検索トークン[RET]を生成して学術的な参照をいつ取得するかを決定し、引用データベースに問い合わせる。
私たちは1つのフレームワーク内で生成タスクと引用タスクの両方を共同で最適化し、効率を向上します。
論文 参考訳(メタデータ) (2025-04-01T14:12:14Z) - Large Language Models for Scholarly Ontology Generation: An Extensive Analysis in the Engineering Field [0.0]
本稿では,異なる研究トピック間の意味的関係を識別する大規模モデルの能力について分析する。
我々はそのタスクを評価するためにIEEE Thesaurusに基づく金の標準を開発した。
Mixtral-8x7B、Dolphin-Mistral、Claude 3-7Bなど、いくつかの優れた結果が得られた。
論文 参考訳(メタデータ) (2024-12-11T10:11:41Z) - Language agents achieve superhuman synthesis of scientific knowledge [0.7635132958167216]
PaperQA2は、ファクトリティの改善、マッチング、あるいは課題の専門家のパフォーマンスを上回るように最適化されたフロンティア言語モデルエージェントである。
PaperQA2は、Wikipediaのような科学的トピックの要約を引用している。
本稿では,人間にとって重要な科学的課題である科学文献の矛盾を明らかにするためにPaperQA2を適用した。
論文 参考訳(メタデータ) (2024-09-10T16:37:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。