論文の概要: Failure Modes of Large Language Models on Research-Level Mathematics: A Taxonomy and an Empirical Characterisation
- arxiv url: http://arxiv.org/abs/2606.24902v1
- Date: Fri, 12 Jun 2026 14:58:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-28 23:46:52.328471
- Title: Failure Modes of Large Language Models on Research-Level Mathematics: A Taxonomy and an Empirical Characterisation
- Title(参考訳): 研究レベル数学における大規模言語モデルの失敗モード:分類学と経験的特徴化
- Abstract要約: 第一証明」ベンチマークでは、研究レベルの数学に関する10の質問が、最も広く公開されている LLM に提示された。
引用作成(F1)、前提密輸(F2)、サイレント問題修正(F3)、ローカル・グローバル互換性ギャップ(F4)の4つの障害モードを特定します。
次に、ベンチマークの質問1、2、5でGemini 2.5 Flashが生成した8つのワンショットの証明を監査します。
- 参考スコア(独自算出の注目度): 0.8594140167290097
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The "First Proof" benchmark [1] posed ten research-level mathematics questions to the strongest publicly available LLMs and found them consistently wrong-not silent, but confidently, fluently wrong. This paper asks why. Working from the per-question post-mortems in First Proof's Appendix A, I identify four failure modes: citation fabrication (F1), premise smuggling (F2), silent problem reformulation (F3), and local-to-global compatibility gaps (F4). I then audit eight one-shot proofs generated by Gemini 2.5 Flash on Questions 1, 2, and 5 of the benchmark, using two instruments built specifically to surface F1 and F2. The central finding is uncomfortable for anyone who sees retrieval-augmented generation (RAG) as the obvious fix: not one of the eight proofs contained a confirmed fabricated citation, yet every single one contained at least one load-bearing claim asserted as a "fundamental result" or "standard argument" with no justification attached. That failure mode-F2, premise smuggling-is invisible to citation verification by design. A premise-audit instrument I introduce flags it at 100% precision (5/5 judge-confirmed flags are true positives) and 50% proof-level recall in this corpus. The taxonomy and the audit together suggest that the right long-term objective is building inference-time pipelines that prevent these failure modes from occurring, not just detecting them after the fact. Index Terms--Large language models, mathematical reasoning, hallucination, premise smuggling, failure-mode taxonomy.
- Abstract(参考訳): First Proof"ベンチマーク[1]は、最も広く公開されているLLMに10の研究レベルの数学の質問を提起し、それらが一貫して間違ってはいないが、自信を持って、流動的に間違っていることを発見した。
この論文は理由を尋ねる。
First Proof の Appendix A での疑問ごとのポストモーテムから、引用作成(F1)、前提密輸(F2)、サイレント問題修正(F3)、ローカルとグローバルの互換性ギャップ(F4)の4つの障害モードを特定します。
次に、ベンチマークの質問1、2、5でGemini 2.5 Flashが生成した8つのワンショットの証明を監査します。
この中心的な発見は、検索強化世代(RAG)を明らかな修正と見なす人には不愉快である: 8つの証明のうちの1つは、確立された引用を含むわけではないが、全ての証明は、正当化を付さない「基礎的な結果」または「標準的議論」として主張される少なくとも1つの負荷付きクレームを含む。
その障害モード-F2、前提密輸は、設計による引用検証には見えない。
前提監査装置として、100%精度(5/5の判断で確認されたフラグは正の正である)でフラグを導入し、このコーパスでは50%の証明レベルリコールを行います。
分類学と監査は、適切な長期的な目的は、これらの障害モードの発生を防止し、事実の後に検出するだけでなく、推論時のパイプラインを構築することであることを示唆している。
Index Terms - 大規模言語モデル、数学的推論、幻覚、前提密輸、失敗モード分類。
関連論文リスト
- NovGauge: A Fine-Grained Benchmark for Diagnosing LLMs' Capability in Paper Novelty Assessment [54.4265627247104]
大規模言語モデル(LLM)は、主要なAIカンファレンスでピアレビューでますます使用されている。
既存のベンチマークでは、ノベルティを1つの総合的なスコアとして評価している。
本報告では,詳細なノベルティアセスメント診断のための人手によるベンチマークであるNovGaugeについて述べる。
論文 参考訳(メタデータ) (2026-09-10T08:34:56Z) - HALLMARK: Diagnosing Three Failure Modes in LLM Citation Verifiers [30.02579334273979]
GPTZeroは、NeurIPS 2025の受け入れられたセットの中で、幻覚的な引用を持つ53の論文を発見した。
検証結果を比較し、詳細な故障診断を行うベンチマークは存在しない。
幻覚ベンチマーク: 14のタイプにまたがる2,526のBibエントリ、3つの困難層、エントリ毎に6つの診断サブテスト。
論文 参考訳(メタデータ) (2026-07-20T13:21:27Z) - Auditing the Audit: Five Failure Modes in Benchmark-Validity Audits [0.30586855806896046]
パイプライン障害を5つのクラスに分類し、安全ベンチマークとオープンウェイトなインストラクションチューニングモデルによる自己監査を行った。
我々は、ゲートを保証グレードの証拠の保持および開示のプロトコルとして位置づけ、古典的な構成正当性証拠を補足する(置き換えるものではない)。
論文 参考訳(メタデータ) (2026-07-01T05:30:07Z) - Do LLMs Game Formalization? Evaluating Faithfulness in Logical Reasoning [20.336209492846752]
形式検証は証明の正当性を保証するが、形式化の忠実性は保証しない。
私たちは、Lean 4の証明を生成する際に、フロンティアモデルがこのギャップを利用するかどうかを調査します。
統一世代における体系的なゲーミングの証拠は見つからない。
論文 参考訳(メタデータ) (2026-04-21T13:37:49Z) - CausalT5K: Diagnosing and Informing Refusal for Trustworthy Causal Reasoning of Skepticism, Sycophancy, Detection-Correction, and Rung Collapse [1.4608214000864057]
CausalT5Kは10ドメインにわたる5000以上のケースの診断ベンチマークである。
合成ベンチマークとは異なり、CausalT5Kはリアルな物語に因果トラップを埋め込んでいる。
予備的な実験では、静的監査ポリシーが普遍的に失敗する4段階のコントロールランドスケープが示される。
論文 参考訳(メタデータ) (2026-02-09T17:36:56Z) - SIN-Bench: Tracing Native Evidence Chains in Long-Context Multimodal Scientific Interleaved Literature [92.88058660627678]
FITO(Fish-in-the-Ocean)パラダイムは、科学文書の中に明確なクロスモーダルなエビデンスチェーンを構築するモデルを必要とする。
我々は、証拠発見(SIN-Find)、仮説検証(SIN-Verify)、接地QA(SIN-QA)、エビデンスアンコレッド合成(SIN-Summary)の4つのプログレッシブなタスクでSIN-Benchを構築する。
検証可能なアンカーに基づき、マッチング、関連性、論理による証拠品質の診断を行う際に、予測値を評価する「No Evidence, No Score」を導入する。
論文 参考訳(メタデータ) (2026-01-15T06:25:25Z) - ProofBridge: Auto-Formalization of Natural Language Proofs in Lean via Joint Embeddings [9.764411884491052]
ProofBridgeは、NLの定理と証明を自動的にリーン4に翻訳するフレームワークです。
中心となるのは、NL と FL (NL-FL) の定理対を共有意味空間で整列する合同埋め込みモデルである。
我々の訓練は、NL-FL 対が意味論的に同値である場合に限り、この空間において NL-FL の定理が密接にマッピングされることを保証する。
論文 参考訳(メタデータ) (2025-10-17T14:20:50Z) - The Missing Parts: Augmenting Fact Verification with Half-Truth Detection [20.011177314734887]
多くの現実世界の主張は半真実であり、実際は正しいが、批判的な文脈が欠落しているために誤解を招く。
我々は,半真実検出の課題を紹介し,文レベルの証拠アライメントと推論されたクレーム意図を付加した15kの政治的クレームを備えた新しいベンチマークであるPolitiFact-Hiddenを提案する。
提案するTRACERは,エビデンスを整理し,インプリートを推定し,隠されたコンテンツの因果的影響を推定することにより,省略に基づく誤報を識別するモジュラー・リアセスメント・フレームワークである。
論文 参考訳(メタデータ) (2025-08-01T10:06:38Z) - Safe: Enhancing Mathematical Reasoning in Large Language Models via Retrospective Step-aware Formal Verification [56.218970738892764]
Chain-of-Thoughtプロンプトは、大規模言語モデル(LLM)から推論能力を引き出すデファクトメソッドとなっている。
検出が極めて難しいCoTの幻覚を緩和するために、現在の方法は不透明なボックスとして機能し、彼らの判断に対する確認可能な証拠を提供しておらず、おそらくその効果を制限する。
任意のスコアを割り当てるのではなく、各推論ステップで形式数学言語Lean 4で数学的主張を明確にし、幻覚を識別するための公式な証明を提供しようとしている。
論文 参考訳(メタデータ) (2025-06-05T03:16:08Z) - Lean-STaR: Learning to Interleave Thinking and Proving [53.923617816215774]
証明の各ステップに先立って,非公式な思考を生成するために,言語モデルをトレーニングするフレームワークであるLean-STaRを紹介します。
Lean-STaRは、Lean定理証明環境内のminiF2F-testベンチマークで最先端の結果を達成する。
論文 参考訳(メタデータ) (2024-07-14T01:43:07Z) - Proving Theorems Recursively [80.42431358105482]
本稿では、定理をレベル・バイ・レベルで証明するPOETRYを提案する。
従来のステップバイステップメソッドとは異なり、POETRYは各レベルで証明のスケッチを検索する。
また,POETRYが検出した最大証明長は10~26。
論文 参考訳(メタデータ) (2024-05-23T10:35:08Z) - AmbiFC: Fact-Checking Ambiguous Claims with Evidence [57.7091560922174]
実世界の情報ニーズから10kクレームを抽出したファクトチェックデータセットであるAmbiFCを提示する。
アンビFCの証拠に対する主張を比較する際に,曖昧さから生じる不一致を分析した。
我々は,このあいまいさをソフトラベルで予測するモデルを開発した。
論文 参考訳(メタデータ) (2021-04-01T17:40:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。