論文の概要: Recurrent Reasoning on Symbolic Puzzles with Sequence Models
- arxiv url: http://arxiv.org/abs/2606.15686v1
- Date: Sun, 19 Apr 2026 15:48:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:12.901192
- Title: Recurrent Reasoning on Symbolic Puzzles with Sequence Models
- Title(参考訳): 逐次モデルを用いたシボリックパズルの繰り返し推論
- Authors: Gowrav Mannem, Chowdhury Marzia Mahjabin, Jason Chen, Shivank Garg, Kevin Zhu,
- Abstract要約: 本稿では、4つのリカレント論理パズルの難易度制御ベンチマークであるRecurrReasonを紹介する。
我々は、2つのトランスフォーマーファミリ、エンコーダ-デコーダモデル(T5スタイル)とデコーダ-オンリーモデル(GPT-2スタイル)をベンチマークする。
微調整済みのT5は97.27%の検証と81.00%のOOD精度をブロックワールドで達成している。
- 参考スコア(独自算出の注目度): 3.900695166480356
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models often appear strong on symbolic and algorithmic tasks, yet this apparent strength can hide brittle behaviour when problems become longer, harder, or slightly out of distribution. A major limitation of current reasoning benchmarks is that many primarily test whether a model can produce a valid answer, while paying less attention to whether the solution is minimal, robust, and stable under controlled difficulty scaling. We introduce RecurrReason, a difficulty-controlled benchmark of four recurrent logic puzzles (Tower of Hanoi, River Crossing, Block World, and Checkers Jumping) with BFS-optimal trajectories and a single interpretable difficulty parameter $N \in \{1,\dots,10\}$, totalling 10{,}817 unique puzzles and 285{,}933 moves. We benchmark two Transformer families, an encoder-decoder model (T5-style) and a decoder-only model (GPT-2-style), under consistent data splits and evaluation criteria, training on $N{=}1$ to $7$ and evaluating on both held-out in-distribution instances and harder out-of-distribution instances at $N{=}8$ to $10$. Fine-tuned pre-trained T5 achieves 97.27\% validation and 81.00\% OOD accuracy on Block World; all models score 0.00\% on River Crossing under all conditions. Failure mode analysis reveals that architecture is a stronger determinant of success than scale. Pre-training transfers only to puzzles with locally structured transition functions. Our code and dataset will be open-sourced upon acceptance.
- Abstract(参考訳): 大きな言語モデルは、しばしば記号的およびアルゴリズム的なタスクに強く現れるが、この明らかな強さは、問題がより長く、より難しく、あるいはわずかに分布から外れたときに脆い振る舞いを隠すことができる。
現在の推論ベンチマークの最大の制限は、モデルが有効な答えを得られるかどうかを主にテストする一方で、ソリューションが最小限で、堅牢で、スケーリングが制御困難である場合、安定であるかどうかに注意を払わないことである。
本稿では, BFS-最適軌道と単一解釈困難パラメータ$N \in \{1,\dots,10\}$, totalling 10{,}817 unique puzzles and 285{,}933 moveの4つの繰り返し論理パズル(Tower of Hanoi, River Crossing, Block World, and Checkers Jumping)の難易度制御ベンチマークであるRecurrReasonを紹介する。
我々は、2つのトランスフォーマーファミリ、エンコーダ・デコーダモデル(T5スタイル)とデコーダ・オンリーモデル(GPT-2スタイル)を、一貫性のあるデータ分割と評価基準の下でベンチマークし、$N{=1$から$7$までをトレーニングし、Fold-out in-distriionインスタンスと$N{=18$から$10$でより難しいアウト・オブ・ディストリビューションインスタンスの両方で評価する。
微調整済みのT5は97.27.%の検証と81.00.%のOOD精度を実現している。
フェールモード分析は、アーキテクチャがスケールよりも成功の強力な決定要因であることを示している。
事前学習は局所的に構造化された遷移関数を持つパズルにのみ移行する。
私たちのコードとデータセットは、受け入れ次第オープンソースになります。
関連論文リスト
- Flow Reasoning Models: Scaling Reasoning Through Iterative Self-Refinement [13.205772367296353]
フローモデルを用いた構造化推論のためのトレーニングおよびテスト時間スケーリングフレームワークであるReasoning Flow Modelsを紹介する。
正しい答えは、解法力学の安定な固定点であり、再帰的かつ再解法されたときに自分自身に戻る。
セルフコンディショニングチャネルでフローモデルをトレーニングし、推論でそれをクローズすることで、自分たちで過去の予測を洗練できます。
論文 参考訳(メタデータ) (2026-06-28T02:10:36Z) - Reasoning Quality Emerges Early: Data Curation for Reasoning Models [58.56882815783977]
我々は,初期推論トークンのみを用いて,多種多様かつ挑戦的な推論例を識別可能であることを示す。
本手法は,トークン効率を91%向上させながら,既存のベースラインを最大1.7%向上させる。
論文 参考訳(メタデータ) (2026-06-25T09:32:58Z) - LPDS: Evaluating LLM Robustness Through Logic-Preserving Difficulty Scaling [24.184930329823114]
本稿では,問題変動の難易度を定量化するために,論理状態難易度(LPDS)を導入する。
困難が増すにつれて、モデルの推論における性能低下とエラーがより顕著になることを示す。
論文 参考訳(メタデータ) (2026-05-14T20:26:59Z) - Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding [59.60915947702282]
検証可能な報酬(RLVR)による強化学習は,大規模言語モデル(LLM)の推論能力の向上に成功している。
既存のRLVR手法は、訓練データの困難さとモデルの能力のミスマッチにより、探索の非効率に悩まされることが多い。
本稿では,高効率領域に留まることの難易度を動的に調整する新しい監視支援RLVRフレームワークであるSEELEを提案する。
論文 参考訳(メタデータ) (2025-09-08T17:36:21Z) - PuzzleClone: An SMT-Powered Framework for Synthesizing Verifiable Data [7.63617172069015]
Satisfiabilityo Synthesizing (SMT) を用いた大規模検証のためのフレームワークである PuzzleClone を紹介する。
提案手法は,(1) シードパズルを構造化論理仕様に符号化すること,(2) 体系的変数と制約ランダム化によるスケーラブルな変種を生成すること,(3) 再生機構による有効性を確保すること,の3つの重要なイノベーションを特徴とする。
論文 参考訳(メタデータ) (2025-08-21T02:36:16Z) - Concise Reasoning, Big Gains: Pruning Long Reasoning Trace with Difficulty-Aware Prompting [28.537281448659634]
本稿では,性能損失を伴わない推論トレースを動的に短縮するDAP法を提案する。
実験では、難解なCoTサンプルの100Kだけを微調整した学生モデルが800KのLong CoTサンプルで蒸留されたモデルより優れている。
また,本手法は,11種類の多種多様なベンチマークにおいて,比較的少ないトークンを用いて,長鎖よりも短い難易度CoTの精度を向上する。
論文 参考訳(メタデータ) (2025-05-26T09:04:44Z) - Climbing the Ladder of Reasoning: What LLMs Can-and Still Can't-Solve after SFT? [59.418994222096885]
AIME24データセット上でモデル性能の詳細な解析を行う。
我々は質問を4段階(易、中、硬、極度硬)に分類する。
我々は,SFT-1Kインスタンスが最小限であるR1推論スタイルを採用する必要があることを見出した。
エクレベルの質問は、根本的に異なる課題を示します。
論文 参考訳(メタデータ) (2025-04-16T03:39:38Z) - Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach [70.44265766483633]
本稿では,潜在空間における暗黙的推論によるテスト時間計算のスケールアップが可能な,新しい言語モデルアーキテクチャについて検討する。
我々のモデルは繰り返しブロックを繰り返すことで動作し、テスト時に任意の深さに展開する。
結果のモデルが推論ベンチマークの性能を劇的に改善できることが示される。
論文 参考訳(メタデータ) (2025-02-07T18:55:02Z) - DCR: Divide-and-Conquer Reasoning for Multi-choice Question Answering with LLMs [9.561022942046279]
大規模言語モデル(LLM)の推論能力を高めるため,DCR(Divide and Conquer Reasoning)を提案する。
まず、信頼性スコア(mathcalCS$)に基づいて質問を2つのサブセットに分類する。
特に,質問を信頼性スコア(mathcalCS$)に基づいて2つのサブセットに分類する。
論文 参考訳(メタデータ) (2024-01-10T14:38:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。