論文の概要: Though Language Models Err While They Strive: Conformal Prediction for Self-Correcting Scientific Generation
- arxiv url: http://arxiv.org/abs/2607.16704v1
- Date: Sat, 18 Jul 2026 08:38:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.230888
- Title: Though Language Models Err While They Strive: Conformal Prediction for Self-Correcting Scientific Generation
- Title(参考訳): 言語モデルでは試行錯誤するが, 自己修正型科学生成のコンフォーマル予測
- Abstract要約: 本稿では,グラフ構造型共形予測フレームワークであるSFCについて紹介する。
SFCは科学的推論を原子の絶対コヒーレント-事実単位に分解する。
我々は、PhyXマルチモーダル物理学、MATH、ScienceQA、ARC Challengeなど、確立された科学的推論ベンチマークでSFCを実証する。
- 参考スコア(独自算出の注目度): 4.019632358747631
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models frequently violate fundamental scientific principles when generating technical content, undermining their reliability in scientific applications. We introduce Scientific Feasibility Control SFC, a graph-structured conformal prediction framework that provides statistical guarantees for scientific reasoning validity through progressive absolute-coherent-factuality validation. Our approach decomposes scientific reasoning into atomic absolute-coherent-factuality units requiring both individual correctness against physical laws and logical substantiation from preceding context, addressing the cascade effect where early scientific errors contaminate subsequent reasoning steps. Unlike independence-based methods that treat claims in isolation, SFC models logical dependencies as approximate deducibility graphs and operates through real-time validation with dynamic branching when scientific violations are detected, the system branches to alternative generation paths using verified context as foundation. We demonstrate SFC across established scientific reasoning benchmarks including PhyX multimodal physics, MATH, ScienceQA, and ARC Challenge, achieving 50.1 percent accuracy on PhyX physics reasoning, substantially outperforming recent reasoning models including DeepSeek-R1 49.8 percent and GPT-4 45.8 percent while providing 91.7 percent scientific validity with formal conformal coverage guarantees at alpha equals 0.10 confidence level and reducing scientific law violations by 73 percent across multiple model architectures.
- Abstract(参考訳): 大規模言語モデルは、しばしば技術コンテンツを生成する際の基本的な科学的原則に反し、科学的応用における信頼性を損なう。
我々は,段階的な絶対コヒーレントな実効性検証を通じて,科学的推論の妥当性を統計的に保証するグラフ構造化共形予測フレームワークであるSFCを紹介する。
提案手法は,科学的推論を物理法則に対する個々の正当性と先行文脈からの論理的サブスタンスの両方を必要とする原子絶対コヒーレント実効性単位に分解し,初期科学的誤りがその後の推論ステップを汚染するカスケード効果に対処する。
独立性に基づく独立性に基づく手法とは異なり、SFCは論理的依存関係を近似的再現性グラフとしてモデル化し、科学的違反が検出された場合、動的分岐によるリアルタイム検証を通して動作し、検証されたコンテキストを基礎として代替生成経路に分岐する。
我々は、PhyXマルチモーダル物理学、MATH、ScienceQA、ARC Challengeを含む確立された科学推論のベンチマークでSFCを実証し、PhyX物理推論において50.1%の精度を達成し、DeepSeek-R1 49.8%、GPT-4 45.8%といった最近の推論モデルよりも大幅に上回った。
関連論文リスト
- Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning [103.788281428856]
SciReasonerは、タンパク質、小さな分子、無機結晶をまたいだ自然構造推論のための科学基盤モデルである。
SciReasonerは座標、トポロジ、周期接続性を統一された構造対応語彙に識別する。
86のベンチマークで、SciReasonerは67のタスクで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-07-08T17:59:59Z) - Knowing When Not to Answer: Abstention-Aware Scientific Reasoning [2.680633756465714]
科学的条件下では、支持または不確実な結論は、棄権するよりも有害である。
本稿では,この問題に対して,留意点を考慮した検証フレームワークを用いて検討する。
我々はこのフレームワークをSciFactとPubMedQAの2つの科学的ベンチマークで評価した。
論文 参考訳(メタデータ) (2026-02-15T15:29:43Z) - SciIF: Benchmarking Scientific Instruction Following Towards Rigorous Scientific Intelligence [60.202862987441684]
科学的妥当性を確立する制約に厳格に固執しながら、問題を解決する能力。
具体的には,大学レベルの問題と制約の固定されたカタログをペアにすることで,この能力を評価するマルチディシプリンのベンチマークであるSciIFを紹介する。
SciIFは、解の正当性と多拘束性の両方を測定することにより、構成的推論失敗のきめ細かい診断を可能にする。
論文 参考訳(メタデータ) (2026-01-08T09:45:58Z) - PRISM-Physics: Causal DAG-Based Process Evaluation for Physics Reasoning [57.868248683256574]
PRISM-Physicsはプロセスレベルの評価フレームワークであり、複雑な物理推論問題のベンチマークである。
解は公式の有向非巡回グラフ(DAG)として表される。
その結果,評価フレームワークは人的専門家のスコアと一致していることがわかった。
論文 参考訳(メタデータ) (2025-10-03T17:09:03Z) - SCI-Verifier: Scientific Verifier with Thinking [37.08904000514563]
大規模言語モデル(LLM)は、科学的推論にますます応用されている。
科学的領域における既存の検証研究は2つの大きな限界に悩まされている。
データレベルとモデルレベルでのソリューションを提案する。
論文 参考訳(メタデータ) (2025-09-29T04:58:43Z) - SciReasoner: Laying the Scientific Reasoning Ground Across Disciplines [112.78540935201558]
我々は、自然言語と異質な科学的表現を整合させる科学的推論基盤モデルを提案する。
このモデルは、科学的なテキスト、純粋なシーケンス、シーケンスとテキストのペアにまたがる206Bのコーパスで事前訓練され、4000万の命令でSFTを介してアライメントされる。
i) テキストと科学形式間の忠実な翻訳、(ii) テキスト/知識抽出、(iii) プロパティの予測、(iv) プロパティの分類、(v) 条件なしおよび条件付きシーケンスの生成と設計。
論文 参考訳(メタデータ) (2025-09-25T17:52:06Z) - Bayesian Epistemology with Weighted Authority: A Formal Architecture for Truth-Promoting Autonomous Scientific Reasoning [0.0]
本稿では,ベイジアン・エピステロジーとウェイト・オーソリティ(BEWA)を紹介する。
BEWAは、構造化された科学的主張に対する動的で確率論的に一貫性のある関数としての信念を運用している。
グラフベースのクレーム伝搬、権威的信頼性モデリング、暗号化アンカー、ゼロ知識監査検証をサポートする。
論文 参考訳(メタデータ) (2025-06-19T04:22:35Z) - Atomic Reasoning for Scientific Table Claim Verification [83.14588611859826]
非専門家は、その高い情報密度と認識される信頼性のために、科学的表に基づく主張を誤解させるおそれがある。
既存のテーブルクレーム検証モデル、例えば最先端の大規模言語モデル(LLM)は、しばしば精密なきめ細かい推論に苦しむ。
認知負荷理論に触発されて、表に基づく主張を解釈するモデルの能力を高めるには、認知負荷を減らす必要がある。
論文 参考訳(メタデータ) (2025-06-08T02:46:22Z) - Generating Scientific Claims for Zero-Shot Scientific Fact Checking [54.62086027306609]
科学言語の複雑さと大量のトレーニングデータが不足しているため、自動科学的事実チェックは困難である。
科学的な文から1つ以上の原子的かつ検証可能なクレームを生成するための科学的クレーム生成を提案する。
また, バイオメディカルクレームのゼロショット事実チェックにも有用であることを示す。
論文 参考訳(メタデータ) (2022-03-24T11:29:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。