論文の概要: 4OPS: Structural Difficulty Modeling in Integer Arithmetic Puzzles
- arxiv url: http://arxiv.org/abs/2603.25356v1
- Date: Thu, 26 Mar 2026 12:01:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-27 20:52:48.274091
- Title: 4OPS: Structural Difficulty Modeling in Integer Arithmetic Puzzles
- Title(参考訳): 4OPS: Integer Arithmetic Puzzlesの構造困難モデリング
- Authors: Yunus E. Zeytuncu,
- Abstract要約: 算術パズルゲームは、数学的推論タスクの難しさを研究するための制御された設定を提供する。
我々は、到達可能な目標を列挙し、最小操作の証人を抽出し、大規模ラベリングを可能にする、正確な動的プログラミング解法を開発する。
難易度は、正確な目撃者から導かれる、解釈可能な構造的属性の小さなセットによって完全に決定されることを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Arithmetic puzzle games provide a controlled setting for studying difficulty in mathematical reasoning tasks, a core challenge in adaptive learning systems. We investigate the structural determinants of difficulty in a class of integer arithmetic puzzles inspired by number games. We formalize the problem and develop an exact dynamic-programming solver that enumerates reachable targets, extracts minimal-operation witnesses, and enables large-scale labeling. Using this solver, we construct a dataset of over 3.4 million instances and define difficulty via the minimum number of operations required to reach a target. We analyze the relationship between difficulty and solver-derived features. While baseline machine learning models based on bag- and target-level statistics can partially predict solvability, they fail to reliably distinguish easy instances. In contrast, we show that difficulty is fully determined by a small set of interpretable structural attributes derived from exact witnesses. In particular, the number of input values used in a minimal construction serves as a minimal sufficient statistic for difficulty under this labeling. These results provide a transparent, computationally grounded account of puzzle difficulty that bridges symbolic reasoning and data-driven modeling. The framework supports explainable difficulty estimation and principled task sequencing, with direct implications for adaptive arithmetic learning and intelligent practice systems.
- Abstract(参考訳): 算術パズルゲームは、適応学習システムにおける中核的な課題である数学的推論タスクの難しさを研究するための制御された設定を提供する。
数ゲームに着想を得た整数算術パズルのクラスにおける難解構造決定因子について検討する。
問題を形式化し、到達可能な目標を列挙し、最小限の操作証人を抽出し、大規模ラベリングを可能にする、正確な動的プログラミング解法を開発する。
この解法を用いて、340万以上のインスタンスのデータセットを構築し、ターゲットに到達するのに必要な最小の操作数によって困難を定義する。
難易度と解法から導かれる特徴との関係を解析する。
バッグレベルとターゲットレベルの統計に基づくベースライン機械学習モデルは、部分的に解決可能性を予測することができるが、容易なインスタンスを確実に区別することができない。
対照的に、難易度は、正確な目撃者から派生した、解釈可能な構造的属性の小さなセットによって完全に決定されることを示す。
特に、最小構成で使用される入力値の数は、このラベル付けの難しさに対する最小の統計量である。
これらの結果は、記号的推論とデータ駆動モデリングを橋渡しするパズルの難しさを、透明で計算的に基礎づけた説明を提供する。
このフレームワークは、適応型算術学習とインテリジェントな実践システムに直接的な意味を持つ、説明可能な難易度推定と原則化されたタスクシークエンシングをサポートする。
関連論文リスト
- Four Quadrants of Difficulty: A Simple Categorisation and its Limits [4.304007567113229]
そこで我々は,困難信号の4つの四分法分類,すなわち人間対モデル,タスクに依存しない対タスク依存の分類を提案する。
タスクに依存しない機能はほとんど独立して振る舞うことができ、タスクに依存した機能だけが整合していることが分かりました。
これらの知見は、一般的なカリキュラム学習の直観に挑戦し、軽量でタスク依存の難易度推定器の必要性を強調している。
論文 参考訳(メタデータ) (2026-01-04T11:31:51Z) - ScaleDiff: Scaling Difficult Problems for Advanced Mathematical Reasoning [51.946959481392064]
大規模推論モデル (LRM) は複雑な問題解決において顕著な能力を示している。
難しい問題の生成をスケールするために設計されたパイプラインであるScaleDiffを提案する。
我々のパイプラインは、より大きくて高価な教師モデルに頼ることなく、高度な推論能力を効果的に伝達できることを示します。
論文 参考訳(メタデータ) (2025-09-25T12:22:44Z) - Frontier LLMs Still Struggle with Simple Reasoning Tasks [53.497499123166804]
この研究は、フロンティア言語モデルの性能を、幅広い「容易」推論問題に対して研究する。
計算,一階述語論理,証明木,旅行計画など,手続き的に生成された単純な推論タスクのスイートを作成します。
最先端の思考モデルでさえ、このような問題や同様の理由で一貫して失敗することを示します。
論文 参考訳(メタデータ) (2025-07-09T22:22:49Z) - Climbing the Ladder of Reasoning: What LLMs Can-and Still Can't-Solve after SFT? [59.418994222096885]
AIME24データセット上でモデル性能の詳細な解析を行う。
我々は質問を4段階(易、中、硬、極度硬)に分類する。
我々は,SFT-1Kインスタンスが最小限であるR1推論スタイルを採用する必要があることを見出した。
エクレベルの質問は、根本的に異なる課題を示します。
論文 参考訳(メタデータ) (2025-04-16T03:39:38Z) - MATH-Perturb: Benchmarking LLMs' Math Reasoning Abilities against Hard Perturbations [90.07275414500154]
各種モデルにおけるMATH-P-Hardの性能低下を観察する。
また、学習した問題解決スキルを盲目的に適用する新しい形態の記憶に関する懸念も提起する。
論文 参考訳(メタデータ) (2025-02-10T13:31:46Z) - Are Language Models Puzzle Prodigies? Algorithmic Puzzles Unveil Serious
Challenges in Multimodal Reasoning [24.386388107656334]
本稿では,視覚的質問応答の文脈内での多モーダルパズル解決の新たな課題を紹介する。
本稿では,アルゴリズムパズルの解法におけるマルチモーダル言語モデルの能力に挑戦し,評価するための新しいデータセットAlgoVQAを提案する。
論文 参考訳(メタデータ) (2024-03-06T17:15:04Z) - Faith and Fate: Limits of Transformers on Compositionality [109.79516190693415]
3つの代表的構成課題にまたがる変圧器大言語モデルの限界について検討する。
これらのタスクは、問題をサブステップに分割し、これらのステップを正確な答えに合成する必要があります。
実験結果から,多段階合成推論を線形化部分グラフマッチングに還元することにより,トランスフォーマーLLMが構成課題を解くことが示唆された。
論文 参考訳(メタデータ) (2023-05-29T23:24:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。