論文の概要: MIRA-Math: A Benchmark for Minimal Information Requesting and Mathematical Reasoning
- arxiv url: http://arxiv.org/abs/2607.07391v1
- Date: Wed, 08 Jul 2026 13:23:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.393122
- Title: MIRA-Math: A Benchmark for Minimal Information Requesting and Mathematical Reasoning
- Title(参考訳): MIRA-Math: 最小情報要求と数学的推論のためのベンチマーク
- Abstract要約: MIRA-Mathは、完全な潜伏状態がユニークな答えを持つ問題を解決するためのベンチマークである。
解決者は、厳格な予算の下で自然言語の行方不明情報を要求し、返却された事実を正確な最終回答に統合しなければならない。
MIRA-Mathは、代数、確率、線形系、離散構造、信号処理、マルコフ連鎖、回路、計算、数値境界値問題にまたがる22の型付き数学的ファミリーから2,310個のインスタンスを生成する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mathematical reasoning benchmarks typically provide all facts needed to solve each problem, while interactive benchmarks often mix reasoning with tools, retrieval, and long-horizon dialogue. We introduce MIRA-Math, a benchmark for a narrower diagnostic capability: solving mathematical problems whose full latent state has a unique answer, but whose solver-facing view is missing exactly one necessary atomic fact. The solver must request the missing information in natural language under a strict budget and then integrate the returned fact into an exact final answer. A fixed constrained LLM responder sees only the dataset-provided atomic fact and must either offer the quoted fact when the request matches it, or decline otherwise. Thus, instance generation, typed hint specifications, validation, and final-answer verification are deterministic, while request metrics are measured under a fixed LLM-mediated responder channel. MIRA-Math contains 2{,}310 generated instances from 22 typed mathematical families spanning algebra, probability, linear systems, discrete structures, signal processing, Markov chains, circuits, interpolation, and numerical boundary-value problems. Experiments across frontier and small models show that request success and final-answer accuracy are separable: models may ask for the right fact yet fail the downstream computation, or fail before obtaining the canonical hint. We release generators, verifiers, prompts, run metadata, and dataset documentation to support reproducible evaluation of minimal information requesting in mathematical reasoning.
- Abstract(参考訳): 数学的推論ベンチマークは、通常、各問題を解決するのに必要なすべての事実を提供するが、インタラクティブなベンチマークは、推論をツール、検索、ロングホライゾン対話と組み合わせることが多い。
我々は、より狭い診断能力のベンチマークであるMIRA-Mathを紹介した: 完全な潜伏状態にユニークな解がある数学的問題を解くが、その解法に直面する視点は、正確に1つの原子的事実を欠いている。
解決者は、厳格な予算の下で自然言語の行方不明情報を要求し、返却された事実を正確な最終回答に統合しなければならない。
固定制約 LLM 応答器は、データセットが提供するアトミックな事実のみを認識し、要求が一致するときに引用された事実を提供するか、それ以外は減少させる必要がある。
したがって、インスタンス生成、型付きヒント仕様、検証、最終回答検証は決定論的であり、リクエストメトリクスは固定LLM経由の応答チャネルで測定される。
MIRA-Mathは、代数、確率、線形系、離散構造、信号処理、マルコフ連鎖、回路、補間、および数値境界値問題にまたがる22の型付き数学的族から生成される2{,}310のインスタンスを含んでいる。
モデルが正しい事実を要求しても、下流の計算に失敗するか、正統的なヒントを得る前に失敗するかだ。
我々は、数学的推論において最小限の情報要求の再現可能な評価をサポートするために、ジェネレータ、検証器、プロンプト、メタデータの実行、データセットドキュメンテーションをリリースする。
関連論文リスト
- SABER-Math: Automated Benchmark for Information Retrieval Evaluation in Mathematics [4.685475117723465]
専門家のアノテーションを使わずに数理IRを評価するための,最初の完全自動ベンチマークであるSABER-Mathを紹介する。
SABER-Mathは283Kのハイスクールレベルの数学問題から始まり、3つのステップでタスクのランク付けに挑戦する。
我々は、語彙検索器、特殊数式検索システム、最近の埋め込みモデルを評価する。
論文 参考訳(メタデータ) (2026-06-29T07:32:50Z) - Reaching Beyond the Mode: RL for Distributional Reasoning in Language Models [78.68818219506313]
本稿では,複数解に対する分布推論を行うための多解補足学習手法について述べる。
質問応答, 診断, コーディングベンチマークを通じて, 単一回答学習ベースラインと比較して, 多様性, カバレッジ, 設定レベルの校正スコアが向上した。
論文 参考訳(メタデータ) (2026-03-25T22:20:25Z) - HorizonMath: Measuring AI Progress Toward Mathematical Discovery with Automatic Verification [54.06301039725887]
計算および応用数学において8つの領域にまたがる100以上の未解決問題のベンチマークであるHorizonMathを紹介する。
我々のベンチマークは、発見が困難であり、意味のある数学的洞察を必要とする問題のクラスをターゲットにしているが、検証は計算的に効率的で簡単なものである。
論文 参考訳(メタデータ) (2026-03-16T17:59:53Z) - SciML Agents: Write the Solver, Not the Solution [69.5021018644143]
敵の"ミスリーディング"問題の診断データセットと,1,000種類のODEタスクの大規模ベンチマークという,2つの新しいデータセットを紹介した。
オープンおよびクローズドソース LLM モデルについて, (i) 誘導型とガイド型, (ii) オフ・ザ・シェルフ対微調整型という2つの軸に沿って評価した。
予備的な結果は、慎重なプロンプトと微調整により、単純なODE問題を確実に解決できる特殊なLLMエージェントが得られることを示唆している。
論文 参考訳(メタデータ) (2025-09-12T02:53:57Z) - Self-Questioning Language Models [58.73276539661649]
本稿では,提案者がトピックを与えられ,解答者に対する質問を生成する非対称なセルフプレイフレームワークを提案する。
提案者と解答者はともに強化学習を通じて訓練される。
3桁の乗算、OMEGAベンチマークの代数問題、Codeforcesのプログラミング問題である。
論文 参考訳(メタデータ) (2025-08-05T17:51:33Z) - Solving Inequality Proofs with Large Language Models [42.667163027148916]
不等式証明は様々な科学・数学分野において不可欠である。
これにより、大きな言語モデル(LLM)の需要が高まるフロンティアとなる。
我々は、Olympiadレベルの不平等を専門家が計算したデータセットであるIneqMathをリリースした。
論文 参考訳(メタデータ) (2025-06-09T16:43:38Z) - Let's Verify Math Questions Step by Step [29.69769942300042]
MathQ-Verifyは、未定または未定の数学問題を厳格にフィルタリングするために設計された、新しいパイプラインである。
MathQ-Verifyはまず、冗長な命令を削除するためのフォーマットレベルのバリデーションを実行する。
その後、各質問を形式化し、それを原子状態に分解し、数学的定義に対して検証する。
論文 参考訳(メタデータ) (2025-05-20T04:07:29Z) - Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models [86.45058529521258]
OlymMATHは、LLMの複雑な推論能力を厳格にテストするために設計された、Olympiadレベルの新しい数学ベンチマークである。
OlymMATHは200の厳密にキュレートされた問題があり、それぞれが手動で検証され、英語と中国語の並行バージョンで利用可能である。
論文 参考訳(メタデータ) (2025-03-27T11:20:17Z) - HARDMath: A Benchmark Dataset for Challenging Problems in Applied Mathematics [1.5716764919736026]
本稿では,解析的近似技術を必要とする応用数学問題に挑戦するデータセットであるHARDMathを紹介する。
本フレームワークは,数値基底真理に対して検証された解を用いて,多数の問題を自動生成する。
HARDMath-miniは,366問題からなるサブサンプルテストセットであり,応用科学の文脈で定式化された40の単語問題に対して,オープンソースLLMとクローズドソースLLMの両方を評価する。
論文 参考訳(メタデータ) (2024-10-13T20:09:41Z) - GSM-Plus: A Comprehensive Benchmark for Evaluating the Robustness of LLMs as Mathematical Problem Solvers [68.77382332826167]
大規模言語モデル (LLM) は、様々な数学的推論ベンチマークで顕著な性能を達成している。
1つの必須かつ頻繁な証拠は、数学の質問がわずかに変更されたとき、LLMは誤って振る舞うことができることである。
このことは, LLMの数学推論能力の頑健性を評価するために, 幅広い質問のバリエーションを試すことによるものである。
論文 参考訳(メタデータ) (2024-02-29T15:26:14Z) - CHAMP: A Competition-level Dataset for Fine-Grained Analyses of LLMs' Mathematical Reasoning Capabilities [25.857946070979576]
概念とHint-Annotated Math Problems (CHAMP) は、概念に注釈を付けた高校数学の競争問題である。
このベンチマークは困難で、最高のモデルは標準設定で58.1%しか得点できない。
モデルはしばしば、間違った推論ステップを通じて、正しい最終回答に到達します。
論文 参考訳(メタデータ) (2024-01-13T03:18:16Z) - Test Set Sizing Via Random Matrix Theory [91.3755431537592]
本稿ではランダム行列理論の手法を用いて、単純な線形回帰に対して理想的なトレーニング-テストデータ分割を求める。
それは「理想」を整合性計量を満たすものとして定義し、すなわち経験的モデル誤差は実際の測定ノイズである。
本論文は,任意のモデルのトレーニングとテストサイズを,真に最適な方法で解決した最初の論文である。
論文 参考訳(メタデータ) (2021-12-11T13:18:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。