論文の概要: Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs
- arxiv url: http://arxiv.org/abs/2608.00605v1
- Date: Sat, 01 Aug 2026 11:48:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.824943
- Title: Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs
- Title(参考訳): 信頼グラフから逃れる:拡散LDMにおける数学的推論のための進化的復号法
- Authors: Zhenhong Sun, Hanqing Zhao, Yatao Bian, Rongcheng Tu, Liuyue Xie, Xu Zhang, Jue Wang, Davide Modolo, Daoyi Dong, Dacheng Tao,
- Abstract要約: 我々はLLaDA 2.0の復号軌道を解析し、繰り返し拡散信頼トラップを同定する。
本稿では,拡散復号化を進化過程とみなす訓練不要なテスト時間スケーリングフレームワークである進化復号法を提案する。
- 参考スコア(独自算出の注目度): 69.52853771994451
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Diffusion large language models (dLLMs) have emerged as a promising alternative to autoregressive LLMs, offering efficient generation through block-wise progressive unmasking. However, their strong general-purpose performance does not necessarily translate into reliable mathematical reasoning, where correctness depends on preserving coherent numerical-symbolic reasoning trajectories. In this work, we analyze the decoding trajectories of LLaDA 2.0 and identify a recurring diffusion confidence trap: local token confidence can become misaligned with global reasoning correctness during progressive block decoding. Our analysis reveals two representative failure regimes: sampling-sensitive failures, where correct paths exist but are unstable, and sampling-consistent failures, where repeated sampling converges to repetitive high-confidence but incorrect continuations. Motivated by this observation, we propose Evolutionary Decoding, a training-free test-time scaling framework that views diffusion decoding as an evolutionary process over candidate reasoning states. The framework combines step-wise selection, which preserves useful numerical-symbolic signals and suppresses repetitive patterns, with block-wise mutation, which introduces structured alternatives to escape incorrect high-confidence basins. Experiments on multiple benchmarks show that Evolutionary Decoding improves LLaDA 2.0 over confidence-based decoding, leading to more reliable mathematical reasoning.
- Abstract(参考訳): 拡散大言語モデル (dLLM) は、ブロックワイドなプログレッシブ・アンマスキングによる効率的な生成を提供する自己回帰型LLMの代替として、有望なものとして登場した。
しかし、それらの強力な汎用性能は必ずしも信頼性のある数学的推論に変換されるわけではなく、正しさはコヒーレントな数値-記号的推論軌道の保存に依存する。
本研究では,LLaDA 2.0の復号軌道を解析し,再帰的な拡散信頼トラップを同定する。
本分析では, 正しい経路が存在するが不安定なサンプリング敏感な障害と, 繰り返しサンプリングが繰り返し高信頼だが誤連続に収束するサンプリング整合性障害の2つの代表的な障害機構を明らかにした。
この観察から得られた進化的復号化は,拡散復号化を予測的推論状態の進化過程とみなす訓練不要なテスト時間スケーリングフレームワークである。
このフレームワークは、有用な数値記号信号を保持し、繰り返しパターンを抑制するステップワイズ選択とブロックワイズ突然変異を組み合わせ、不正な高信頼盆地から逃れるための構造化された代替手段を導入する。
複数のベンチマークの実験では、進化的復号化は信頼性に基づく復号化よりもLLaDA 2.0を改善し、より信頼性の高い数学的推論をもたらすことが示されている。
関連論文リスト
- The Confidence Shortcut: A Reasoning Failure Mode of Masked Diffusion Models [5.43345665278304]
信頼性に基づく復号法は、複雑推論に必要な論理フロー軌道と本質的には一致していないと我々は主張する。
信頼に足るトレーニングが、このミスアライメントを積極的に定着させることを示す。
対照的に、ランダムマスキングは、その非効率さが認識されているにもかかわらず、挑戦的な尾を解くのに不可欠な推論・軌道条件をしっかりと保存している。
論文 参考訳(メタデータ) (2026-05-27T21:33:37Z) - Uncertainty Quantification for Large Language Diffusion Models [35.87984313223733]
自己回帰モデルに代わるものとして,大規模言語拡散モデル (LLDM) が登場している。
既存の不確実量化(UQ)手法は自己回帰因子化を前提とするか、高価な繰り返しサンプリングを使用する。
LLDMのUQに関する最初の体系的研究を行い、軽量ゼロショット不確実性信号を提案する。
論文 参考訳(メタデータ) (2026-05-14T08:39:56Z) - Locally Confident, Globally Stuck: The Quality-Exploration Dilemma in Diffusion Language Models [52.61023005303122]
低信頼度再マッシングは、誘導配列分布のエントロピーを制約しながら、品質のプロキシを改善することを示す。
我々は,デコード時に,この分布をほぼ対象とする簡易なインディペンデント・ハスティングス・サンプリング器を開発した。
論文 参考訳(メタデータ) (2026-04-01T02:01:30Z) - Think Twice Before You Write -- an Entropy-based Decoding Strategy to Enhance LLM Reasoning [32.332197731504046]
デコード戦略は、大きな言語モデルの推論能力を形成する上で、中心的な役割を果たす。
グレディ復号やビームサーチといった従来の手法は、しばしばエラーの伝播に悩まされる。
本稿では,トークンレベルの適応性を世代に導入するエントロピー誘導復号化フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-10T23:08:26Z) - Thinking by Subtraction: Confidence-Driven Contrastive Decoding for LLM Reasoning [58.331709210563616]
サブトラクションによる思考は、信頼主導のコントラスト的デコーディングアプローチである。
低信頼トークンの小さなサブセットは、誤りの推論と不要な出力拡大に不当に寄与する。
信頼駆動型コントラストデコーディング(Confidence-Driven Contrastive Decoding)は,デコーディング中の低信頼トークンを検出し,それらの位置で介入する。
論文 参考訳(メタデータ) (2026-02-20T14:13:22Z) - Reversible Diffusion Decoding for Diffusion Language Models [69.10149777322108]
Reversible Diffusion Decoding (RDD) はブロックワイド拡散生成に可逆性を導入するデコーディングフレームワークである。
RDDは、逆プロセスの状態依存的な障害として停滞を検出し、以前のブロックへの効率的なバックトラックを可能にする。
実験により、RDDは最小の計算オーバーヘッドでベースラインよりも生成の堅牢性と品質を向上させることが示された。
論文 参考訳(メタデータ) (2026-01-29T12:52:33Z) - Accelerate Speculative Decoding with Sparse Computation in Verification [49.74839681322316]
投機的復号化は、複数のドラフトトークンを並列に検証することにより、自動回帰言語モデル推論を加速する。
既存のスペーシフィケーション方式は主にトークン・バイ・トーケンの自己回帰復号化のために設計されている。
そこで本研究では,注目度,FFN,MoEを両立させるスパース検証フレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-26T07:53:41Z) - Sycophancy Mitigation Through Reinforcement Learning with Uncertainty-Aware Adaptive Reasoning Trajectories [58.988535279557546]
適応推論トラジェクトリを用いたtextbf sycophancy Mitigation を提案する。
SMARTは,分布外の入力に対して強い性能を維持しながら,サイコファンティクスの挙動を著しく低下させることを示した。
論文 参考訳(メタデータ) (2025-09-20T17:09:14Z) - Unleashing the True Potential of LLMs: A Feedback-Triggered Self-Correction with Long-Term Multipath Decoding [4.220190655754022]
大規模言語モデル(LLM)は、様々なタスクで顕著なパフォーマンスを達成したが、推論中に誤ったコンテンツを生成することへの感受性は、決定的な未解決の課題である。
本稿では,ユーザフィードバックとデコードダイナミクスの強化を両立させる新しいフレームワークであるFeedback-Triggered Regeneration (FTR)を提案する。
具体的には、FTRは、負のユーザフィードバックを受けた場合にのみ応答再生を起動し、本来正しい出力を保持しながら、不良自己評価からのエラー伝播を回避する。
論文 参考訳(メタデータ) (2025-09-09T12:43:28Z) - Towards Better Code Generation: Adaptive Decoding with Uncertainty Guidance [42.737012213197865]
AdaDecはアダプティブなデコーディングフレームワークで、ルックアヘッドベースで不確実性を認識した停止と再実行のメカニズムを採用している。
AdaDecは、greedyデコーディングと比較して、Pass@1の精度で20.9%の絶対的なゲインを達成する。
AdaDecは、必要に応じて再ランクを適用することで、計算オーバーヘッドとレイテンシを低減し、信頼性とともに効率を向上する。
論文 参考訳(メタデータ) (2025-06-10T16:49:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。