論文の概要: Self-Aware Markov Models for Discrete Reasoning
- arxiv url: http://arxiv.org/abs/2603.16661v1
- Date: Tue, 17 Mar 2026 15:30:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-18 17:42:07.372711
- Title: Self-Aware Markov Models for Discrete Reasoning
- Title(参考訳): 離散推論のための自己認識マルコフモデル
- Abstract要約: 本稿では,Markovトランジションカーネルの学習方法を紹介する。
この設計によりトークンを再マッピングすることができ、モデルが以前のミスを修正することができる。
Sudoku-Extremeデータセットでは、95%の妥当性で、他のフローベース手法よりも明らかに優れている。
- 参考スコア(独自算出の注目度): 8.161697757509701
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Standard masked discrete diffusion models face limitations in reasoning tasks due to their inability to correct their own mistakes on the masking path. Since they rely on a fixed number of denoising steps, they are unable to adjust their computation to the complexity of a given problem. To address these limitations, we introduce a method based on learning a Markov transition kernel that is trained on its own outputs. This design enables tokens to be remasked, allowing the model to correct its previous mistakes. Furthermore, we do not need a fixed time schedule but use a trained stopping criterion. This allows for adaptation of the number of function evaluations to the difficulty of the reasoning problem. Our adaptation adds two lightweight prediction heads, enabling reuse and fine-tuning of existing pretrained models. On the Sudoku-Extreme dataset we clearly outperform other flow based methods with a validity of 95%. For the Countdown-4 we only need in average of 10 steps to solve almost 96% of them correctly, while many problems can be solved already in 2 steps.
- Abstract(参考訳): 標準的なマスク付き離散拡散モデルは、マスキングパスにおける自身の誤りを修正することができないため、推論タスクの制限に直面している。
与えられた問題の複雑さに合わせて計算を調整することはできない。
これらの制約に対処するために,Markovトランジションカーネルを学習し,自身の出力に基づいて学習する手法を提案する。
この設計によりトークンを再マッピングすることができ、モデルが以前のミスを修正することができる。
さらに、固定時間スケジュールは必要とせず、訓練された停止基準を使用する。
これにより、関数評価の回数を推論問題の難しさに適応させることができる。
我々の適応は2つの軽量な予測ヘッドを追加し、既存の事前学習モデルの再利用と微調整を可能にした。
Sudoku-Extremeデータセットでは、95%の妥当性で、他のフローベース手法よりも明らかに優れている。
Countdown-4では、およそ96%の問題を正しく解くのに平均10ステップしか必要とせず、2ステップですでに多くの問題が解決できる。
関連論文リスト
- Let It Go or Learn to Self-Correct: Continuous Diffusion for Constrained Discrete Tasks [16.76819088768813]
拡散確率モデル(Denoising Diffusion Probabilistic Models)は、各更新を現在のノイズ状態に近い状態に保ちながら、繰り返しdenoisingによってサンプルを生成する。
モデルのクリーンな予測が有益である場合でも,標準拡散サンプリングは早期の誤りを保存する可能性があることを示す。
自己補正トレーニングを導入し、モデル自体の予測に公開し、推論中に発生するエラーに対する堅牢性を改善する。
論文 参考訳(メタデータ) (2026-09-08T16:45:52Z) - Flow Reasoning Models: Scaling Reasoning Through Iterative Self-Refinement [13.205772367296353]
フローモデルを用いた構造化推論のためのトレーニングおよびテスト時間スケーリングフレームワークであるReasoning Flow Modelsを紹介する。
正しい答えは、解法力学の安定な固定点であり、再帰的かつ再解法されたときに自分自身に戻る。
セルフコンディショニングチャネルでフローモデルをトレーニングし、推論でそれをクローズすることで、自分たちで過去の予測を洗練できます。
論文 参考訳(メタデータ) (2026-06-28T02:10:36Z) - How reliable are LLMs when it comes to playing dice? [0.0]
離散確率問題に対する制御ベンチマークによる大規模言語モデルの推論能力について検討する。
モデルの平均精度は標準問題では0.96であるが、直観に反するものでは0.59である。
このプロンプトに誤解を招く提案を埋め込むことで、パフォーマンスが最大34%低下し、免疫力を示すモデルが存在しない。
論文 参考訳(メタデータ) (2026-06-05T17:59:42Z) - Fast Unlearning at Scale via Margin Self-Correction [52.46927918952516]
言語モデルアンラーニングは、トレーニングモデルを更新して、選択したトレーニング例を見ていないかのように振る舞う。
MASCは、既存のベースラインの計算コストのごく一部で、競争力のある忘れがちなトレードオフを達成する。
論文 参考訳(メタデータ) (2026-06-01T21:49:54Z) - e1: Learning Adaptive Control of Reasoning Effort [88.51897900019485]
AIモデルの思考予算の増大は、精度を大幅に向上させるが、すべての質問が同じ量の推論を保証しているわけではない。
ユーザは、アウトプットの品質を、レイテンシやコストに対してどのように評価するかによって、さまざまな理由付けの労力を割り当てる傾向があります。
本稿では,ユーザが指定したトークン数を用いてモデルを学習する自己適応型強化学習手法であるAdaptive Effort Controlを提案する。
論文 参考訳(メタデータ) (2025-10-30T23:12:21Z) - ConciseRL: Conciseness-Guided Reinforcement Learning for Efficient Reasoning Models [14.403953640255823]
強化学習フレームワークに報酬信号として用いられる新しいスコアを導入し、モデルが正確かつ簡潔な推論トレースを生成するよう誘導する。
このスコアは、ジャッジとして機能する大きな言語モデルによって評価され、単純なトークン長を超えて動的でコンテキスト対応のフィードバックを可能にする。
提案手法は,MATHデータセット上での最先端の効率・正確性トレードオフを実現し,簡単な問題ではトークン使用率を最大31倍に削減し,精度を7%向上させるとともに,最も難しい問題では,トークン使用率を最大3.6倍に抑えながら,完全な推論を+7.5%向上させる。
論文 参考訳(メタデータ) (2025-05-22T19:56:35Z) - Climbing the Ladder of Reasoning: What LLMs Can-and Still Can't-Solve after SFT? [59.418994222096885]
AIME24データセット上でモデル性能の詳細な解析を行う。
我々は質問を4段階(易、中、硬、極度硬)に分類する。
我々は,SFT-1Kインスタンスが最小限であるR1推論スタイルを採用する必要があることを見出した。
エクレベルの質問は、根本的に異なる課題を示します。
論文 参考訳(メタデータ) (2025-04-16T03:39:38Z) - Fast Controlled Generation from Language Models with Adaptive Weighted Rejection Sampling [90.86991492288487]
トークンの制約を評価するのは 違法にコストがかかる
LCDは文字列上のグローバル分布を歪め、ローカル情報のみに基づいてトークンをサンプリングすることができる。
我々のアプローチは最先端のベースラインよりも優れていることを示す。
論文 参考訳(メタデータ) (2025-04-07T18:30:18Z) - Subtle Errors in Reasoning: Preference Learning via Error-injected Self-editing [59.405145971637204]
eRror-Injected Self-Editing (RISE) と呼ばれる新しい好み学習フレームワークを提案する。
RISEは、事前定義された微妙なエラーをピボットトークンに注入する。
RISEの有効性を検証する実験では、Qwen2-7B-Instructでの優先学習により、GSM8Kでは3.0%、MATHでは7.9%が顕著に改善され、トレーニングサンプルは4.5Kに留まった。
論文 参考訳(メタデータ) (2024-10-09T07:43:38Z) - GRACE: Discriminator-Guided Chain-of-Thought Reasoning [75.35436025709049]
本稿では, 正しい推論手順を導出するために, GRACE (CorrectnEss Discriminator) を用いたチェーン・オブ・シークレット・リAsoningを提案する。
GRACEは、正しいステップと間違ったステップに対して対照的な損失で訓練された判別器を採用しており、復号時に次のステップ候補を採点するために使用される。
論文 参考訳(メタデータ) (2023-05-24T09:16:51Z) - Learning to Optimize Permutation Flow Shop Scheduling via Graph-based
Imitation Learning [70.65666982566655]
置換フローショップスケジューリング(PFSS)は製造業で広く使われている。
我々は,より安定かつ正確に収束を加速する専門家主導の模倣学習を通じてモデルを訓練することを提案する。
我々のモデルのネットワークパラメータはわずか37%に減少し、エキスパートソリューションに対する我々のモデルの解のギャップは平均6.8%から1.3%に減少する。
論文 参考訳(メタデータ) (2022-10-31T09:46:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。