論文の概要: Flow Reasoning Models: Scaling Reasoning Through Iterative Self-Refinement
- arxiv url: http://arxiv.org/abs/2606.29150v1
- Date: Sun, 28 Jun 2026 02:10:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.803714
- Title: Flow Reasoning Models: Scaling Reasoning Through Iterative Self-Refinement
- Title(参考訳): フロー推論モデル:反復的自己精製による推論のスケーリング
- Authors: Alec Helbling, Andrey Bryutkin, Mauro Martino, Nima Dehmamy, Hendrik Strobelt,
- Abstract要約: フローモデルを用いた構造化推論のためのトレーニングおよびテスト時間スケーリングフレームワークであるReasoning Flow Modelsを紹介する。
正しい答えは、解法力学の安定な固定点であり、再帰的かつ再解法されたときに自分自身に戻る。
セルフコンディショニングチャネルでフローモデルをトレーニングし、推論でそれをクローズすることで、自分たちで過去の予測を洗練できます。
- 参考スコア(独自算出の注目度): 13.205772367296353
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Discrete flow models have recently shown promising performance on few-step text generation; however, when naively applied to structured reasoning tasks such as Sudoku and Zebra puzzles, they converge confidently to incorrect answers (solving only $\sim$36% of Sudoku puzzles). We introduce Flow Reasoning Models (FRMs), a training and test-time-scaling framework for structured reasoning with flow models. We make the observation that, despite their poor solve rate, flow models can act as their own verifiers. A correct answer is a stable fixed point of the denoising dynamics, returning to itself when re-noised and re-solved. This enables a test-time-scaling paradigm: propose many candidate solutions and keep those that are dynamically stable, which alone reaches high solve rates on Sudoku-Shah (~$100\%$) and Zebra ($95.9\%$). This even generalizes to harder out-of-distribution puzzles like Sudoku-Extreme ($96.1\%$), without ever training on that distribution. This pure search, however, wastes a great deal of computation generating incorrect candidate solutions. We therefore design a training recipe to improve the base model's efficiency. First, we train flow models with a self-conditioning channel and close it at inference, letting them refine their own past predictions. Second, we train models to avoid their own failed generations using direct preference optimization. These changes substantially improve the base model's efficiency, letting it reach $99.2\%$ on Sudoku in just $7$ forward passes, over $8\times$ fewer than the strongest matched masked-diffusion baseline we compare needs for the same accuracy. When combined with test-time scaling, this lets flow models solve hard out-of-distribution puzzles (e.g. Sudoku-Extreme) far more efficiently.
- Abstract(参考訳): 離散フローモデルは近年,数ステップのテキスト生成において有望な性能を示したが,スドクパズルやゼブラパズルのような構造化推論タスクに鼻で適用すると,不正確な解に確実に収束する(スドクパズルの$\sim$36%しか解けない)。
本稿では,フローモデルを用いた構造化推論のためのトレーニングおよびテスト時間スケーリングフレームワークであるFlow Reasoning Models (FRMs)を紹介する。
我々は,解答率の低さにもかかわらず,フローモデルが独自の検証器として機能することを観察する。
正しい答えは、解法力学の安定な固定点であり、再帰的かつ再解法されたときに自分自身に戻る。
多くの候補解を提案し、動的に安定な解を保ち、スドクシャー (~100 %$) とゼブラ (95.9 %$) の高解率に達する。
これは、Sudoku-Extreme (96.1\%$)のようなより難しい分配パズルに、その分布を訓練することなく一般化する。
しかし、この純粋な探索は、誤った候補解を生成する大量の計算を無駄にする。
したがって、ベースモデルの効率を改善するためのトレーニングレシピを設計する。
まず、セルフコンディショニングチャネルでフローモデルをトレーニングし、推論でそれをクローズすることで、自分たちで過去の予測を洗練できます。
第2に、直接選好最適化を用いて、失敗する世代を避けるためにモデルをトレーニングする。
これらの変更はベースモデルの効率を大幅に改善し、Sudoku上ではわずか7ドルの前方パスで99.2\%ドルに達し、同じ精度で比較した最強のマスク拡散ベースラインよりも8\times$少なくなる。
テストタイムのスケーリングと組み合わせることで、フローモデルがハード・アウト・オブ・ディストリビューションパズル(例:Sudoku-Extreme)をはるかに効率的に解けるようになります。
関連論文リスト
- Self-Aware Markov Models for Discrete Reasoning [8.161697757509701]
本稿では,Markovトランジションカーネルの学習方法を紹介する。
この設計によりトークンを再マッピングすることができ、モデルが以前のミスを修正することができる。
Sudoku-Extremeデータセットでは、95%の妥当性で、他のフローベース手法よりも明らかに優れている。
論文 参考訳(メタデータ) (2026-03-17T15:30:06Z) - Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching [66.39914384073145]
本稿では,安価な拡散サンプリング推論をステップレベル候補の再利用プールに変換する自己整合性フレームワークを提案する。
ステップレベルの再結合は、難しい問題に対して最も有益であることがわかった。
トレーニング不要のフレームワークは、6つの数学およびコーディングタスクの平均精度を最大2倍改善します。
論文 参考訳(メタデータ) (2026-02-26T11:08:39Z) - INC: An Indirect Neural Corrector for Auto-Regressive Hybrid PDE Solvers [61.84396402100827]
本稿では,学習した補正を支配方程式に統合する間接ニューラルコレクタ(mathrmINC$)を提案する。
$mathrmINC$は、$t-1 + L$の順番でエラー増幅を減らし、$t$はタイムステップ、$L$はリプシッツ定数である。
大規模なベンチマークで$mathrmINC$をテストし、1Dカオスシステムから3D乱流まで、多くの異なる解法、神経バックボーン、テストケースをカバーした。
論文 参考訳(メタデータ) (2025-11-16T20:14:28Z) - Catch Your Breath: Adaptive Computation for Self-Paced Sequence Production [55.76222360698305]
我々は,言語モデルが入力トークン毎に使用する計算ステップの数を動的かつ自律的に拡張できるような,教師付きトレーニング目標のクラスを探索する。
任意のトークンに対して、モデルは don't know> 出力を出力することで、追加の計算ステップを要求できる。
CYBモデルでは精度が向上し,トークンレベルの複雑性とコンテキストに処理時間を適用することができる。
論文 参考訳(メタデータ) (2025-10-13T21:07:05Z) - Entropy After $\langle \texttt{/Think} \rangle$ for reasoning model early exiting [38.93424884988798]
正しい解に到達した後も、回答を再検討し続けながら、大きな推論モデルが過大評価されていることを示す。
We propose Entropy After /Think> (EAT) for monitoring and decide whether to exit reasoning early。
EATは、正確性を損なうことなく、トークン使用量を13~21%削減する。
論文 参考訳(メタデータ) (2025-09-30T16:59:37Z) - DAST: Difficulty-Adaptive Slow-Thinking for Large Reasoning Models [30.184895117009457]
本稿では,問題の難易度に基づいて,モデルが自律的にChain-of-Thought(CoT)の長さを調整できる,DAST(Difficulty-Adaptive Slow Thinking)を提案する。
多様なデータセットとモデルスケールの実験により、DASTは複雑な問題に対する推論精度を維持しながら、過剰思考を効果的に軽減することを示した。
論文 参考訳(メタデータ) (2025-03-06T14:23:06Z) - Truncated Consistency Models [57.50243901368328]
トレーニング一貫性モデルは、PF ODE 軌道に沿ったすべての中間点を対応するエンドポイントにマッピングする学習を必要とする。
このトレーニングパラダイムが一貫性モデルの1ステップ生成性能を制限することを実証的に見出した。
整合性関数の新しいパラメータ化と2段階の訓練手順を提案し,時間外学習が崩壊することを防ぐ。
論文 参考訳(メタデータ) (2024-10-18T22:38:08Z) - Language models scale reliably with over-training and on downstream tasks [121.69867718185125]
スケーリング法則は、高価なトレーニング実行を引き出すための有用なガイドである。
しかし、現在の研究と言語モデルがどのように訓練されているかには差がある。
対照的に、スケーリング法則は主に推論における損失を予測するが、モデルは通常下流のタスクのパフォーマンスで比較される。
論文 参考訳(メタデータ) (2024-03-13T13:54:00Z) - Thought Flow Nets: From Single Predictions to Trains of Model Thought [39.619001911390804]
人間が複雑な問題を解くと、すぐに決定が下されることはめったにない。
その代わり、彼らは直感的な決定から始まり、間違いを見つけ、矛盾を解決し、異なる仮説の間を飛び交う。
論文 参考訳(メタデータ) (2021-07-26T13:56:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。