論文の概要: Not Just Reason, Not Just Scan: Reinforcement Learning for Proactive Scientific Error Verification over Academic Paper
- arxiv url: http://arxiv.org/abs/2608.26596v1
- Date: Thu, 27 Aug 2026 04:24:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.241589
- Title: Not Just Reason, Not Just Scan: Reinforcement Learning for Proactive Scientific Error Verification over Academic Paper
- Title(参考訳): 科学論文の科学的誤り検証のための強化学習
- Abstract要約: 本稿では,学術論文における科学的誤り検出のための強化学習式VERA-RLを提案する。
VERA-13Kは4,300個のマッチしたチェーンで構成され,研究ワークフローと広い自然科学領域にまたがる6つの科学的エラーカテゴリを網羅した,12,900サンプルのデータセットである。
VERA-RLを用いたQwen3-VL-8Bの訓練は,Gemini 3 ProやQwen3-VL-235B-A22BといったフラッグシップMLLMにアプローチし,検証可能な推論を大幅に改善する。
- 参考スコア(独自算出の注目度): 56.13177687090277
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Multimodal large language models (MLLMs) are increasingly capable scientific assistants, yet they remain far from fully autonomous research. This transition requires models to actively inspect academic papers, build global evidence views, and make traceable judgments without prespecified issues or evidence. However, existing work provides limited task paradigms or training studies for such issue- and evidence-absent verification. We study this challenge through scientific error detection, where models must determine whether errors exist and justify them with evidence-based reasoning. To fill this gap, we present VERA-RL, a reinforcement-learning formulation for scientific error detection over academic papers. Following a Reason--Verify--Scan progression, we construct VERA-13K, a 12,900-sample dataset organized into 4,300 matched chains, covering 6 scientific-error categories across the research workflow and broad natural-science domains. We further introduce fine-grained rewards for reasoning completeness, evidence alignment, and error precision. Training Qwen3-VL-8B with VERA-RL substantially improves verifiable reasoning, approaching flagship MLLMs such as Gemini 3 Pro and Qwen3-VL-235B-A22B on Scan.
- Abstract(参考訳): マルチモーダル大言語モデル(MLLM)は、ますます有能な科学アシスタントとなっているが、完全に自律的な研究には程遠い。
この移行は、学術論文を積極的に検査し、グローバルなエビデンス・ビューを構築し、事前に特定された問題や証拠なしに追跡可能な判断を行うモデルを必要とする。
しかし、既存の研究はそのような問題とエビデンス・アビデント・アビデント・アビデント・検証のための限られたタスク・パラダイムやトレーニング・スタディを提供している。
我々は、この課題を科学的エラー検出を通じて研究し、モデルがエラーが存在するかどうかを判断し、エビデンスに基づく推論で正当化する必要がある。
このギャップを埋めるために,学術論文における科学的誤り検出のための強化学習式VERA-RLを提案する。
Reason--Verify--Scanの進展に続いて、研究ワークフローと広い自然科学領域の6つの科学的エラーカテゴリをカバーする、12,900サンプルのデータセットであるVERA-13Kを構築した。
さらに、完全性、証拠の整合性、誤りの精度を推論するための微粒な報酬も導入する。
VERA-RLを使用したQwen3-VL-8Bの訓練は、ジェミニ3 ProやQwen3-VL-235B-A22Bといった主力MLLMに近づき、検証可能な推論を大幅に改善した。
関連論文リスト
- Sci-MMR: Benchmarking Multi-Step Evidence-Grounded Scientific Reasoning in Multimodal Agents [56.93800079330285]
既存のマルチモーダルベンチマークは、最終回答の精度を大きく評価する。
我々は,多段階のエビデンスに基づく科学的推論のためのベンチマークであるSci-MMRを紹介する。
その結果,解答精度は完全証拠回収率を20%以上上回ることがわかった。
論文 参考訳(メタデータ) (2026-09-10T08:41:07Z) - Can LLMs Discover Scientific Laws in Real and Parallel Worlds? [58.76147897928744]
SCILAWS-BENCHは、公表された研究と実際の科学データから構築された科学法発見のためのベンチマークである。
381の科学論文から118の問題を抽出し、291の法則と6つの科学分野にわたる800万の実際のデータポイントをカバーしている。
予測適合性は、科学的妥当性から分岐し、モデルが公表された公式を再現するか、移動するかを記憶する形に変化し、我々のベスト・オブ・N研究は選択ボトルネックを明らかにした。
論文 参考訳(メタデータ) (2026-09-01T17:17:59Z) - TRACES: A Benchmark for Epistemic Reliability in Scientific Reasoning by LLMs [0.0]
下流検証が存在しない領域では、科学的なエージェントとして大きな言語モデルが提案されている。
筆者らは,42枚の抽出,不正,疑似科学的論文からなるプローブコーパスを,各論文のフレーミングと単発モデルエンゲージメントを抽出・評価する手法と組み合わせて導入した。
プローブは、5つのクレームタイプ、製造された観測、擬似物理機構、魔法の前提、合法化橋、貨物カルト実験である。
論文 参考訳(メタデータ) (2026-08-11T20:30:32Z) - ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence [57.37494162084001]
チェーン・オブ・エビデンス(Chain-of-Evidence, CoE)は、すべてのクレームがエビデンス・ソースにトレース可能であることを要求する検証可能なフレームワークである。
CoE Auditはポストホック監査であり、スコア検証、仕様違反、参照検証、メソッドコードアライメントという4つの整合性チェックが全システムに均一に適用される。
論文 参考訳(メタデータ) (2026-05-25T21:30:27Z) - Not Search, But Scan: Benchmarking MLLMs on Scan-Oriented Academic Paper Reasoning [16.63278420905483]
ScholScanは学術論文推論の新しいベンチマークである。
それは、人間の研究者のような論文全体を読み、クロスチェックし、文書をスキャンして一貫性の問題を特定するよう、モデルに求める。
このベンチマークは、13の自然科学領域と715の論文の9つのエラーカテゴリから抽出された1,800の注意深い注釈付き質問で構成されている。
論文 参考訳(メタデータ) (2026-03-27T15:58:23Z) - The Refutability Gap: Challenges in Validating Reasoning by Large Language Models [11.210425433215827]
近年の報告では、Large Language Models (LLM) は、新しい科学を導き、人間レベルの汎用知性を示す能力を達成したと主張している。
このような主張は、ポパーの難燃性の原則を満たさないため、厳密な科学的主張ではないと我々は主張する。
論文 参考訳(メタデータ) (2025-12-18T14:42:03Z) - Can AI Validate Science? Benchmarking LLMs for Accurate Scientific Claim $\rightarrow$ Evidence Reasoning [6.043212666944194]
CLAIM-BENCHは,科学的クレームエビデンス抽出と検証において,大規模言語モデルの能力を評価するためのベンチマークである。
GPT-4やClaudeのようなクローズドソースモデルは、精度とリコールにおいて、オープンソースモデルよりも一貫して優れています。
戦略的に設計された3つのパスと1対1のプロンプトアプローチは、分散した証拠とクレームを正確にリンクするLSMの能力を大幅に向上させた。
論文 参考訳(メタデータ) (2025-06-09T21:04:39Z) - When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research [19.97666809905332]
大規模言語モデル(LLM)は、AIコサイシストと呼ばれる自動科学的発見のビジョンを加速させた。
大規模言語モデル(LLM)の最近の進歩は、しばしばAIコサイシストと呼ばれる自動科学的発見のビジョンを加速させた。
論文 参考訳(メタデータ) (2025-05-17T05:45:16Z) - Missci: Reconstructing Fallacies in Misrepresented Science [84.32990746227385]
ソーシャルネットワーク上の健康関連の誤報は、意思決定の貧弱さと現実世界の危険につながる可能性がある。
ミスシは、誤った推論のための新しい議論理論モデルである。
大規模言語モデルの批判的推論能力をテストするためのデータセットとしてMissciを提案する。
論文 参考訳(メタデータ) (2024-06-05T12:11:10Z) - A Closer Look at the Self-Verification Abilities of Large Language Models in Logical Reasoning [73.77088902676306]
論理的推論の文脈において,大規模言語モデル(LLM)の自己検証能力について詳しく検討する。
本研究の主目的は,既存のLCMが誤った推論手順を正確に識別するのに苦労し,自己検証法の有効性を保証できないことにある。
論文 参考訳(メタデータ) (2023-11-14T07:13:10Z) - Generating Scientific Claims for Zero-Shot Scientific Fact Checking [54.62086027306609]
科学言語の複雑さと大量のトレーニングデータが不足しているため、自動科学的事実チェックは困難である。
科学的な文から1つ以上の原子的かつ検証可能なクレームを生成するための科学的クレーム生成を提案する。
また, バイオメディカルクレームのゼロショット事実チェックにも有用であることを示す。
論文 参考訳(メタデータ) (2022-03-24T11:29:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。