論文の概要: Think Twice Before You Write -- an Entropy-based Decoding Strategy to Enhance LLM Reasoning
- arxiv url: http://arxiv.org/abs/2604.00018v1
- Date: Tue, 10 Mar 2026 23:08:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-06 02:36:13.196136
- Title: Think Twice Before You Write -- an Entropy-based Decoding Strategy to Enhance LLM Reasoning
- Title(参考訳): 書く前に考える - LLM推論を促進するエントロピーベースのデコード戦略
- Authors: Jiashu He, Meizhu Liu, Olaitan P Olaleye, Amit Agarwal, M. Avendi, Yassi Abbasi, Matthew Rowe, Hitesh Laxmichand Patel, Paul Li, Tao Sheng, Sujith Ravi, Dan Roth,
- Abstract要約: デコード戦略は、大きな言語モデルの推論能力を形成する上で、中心的な役割を果たす。
グレディ復号やビームサーチといった従来の手法は、しばしばエラーの伝播に悩まされる。
本稿では,トークンレベルの適応性を世代に導入するエントロピー誘導復号化フレームワークを提案する。
- 参考スコア(独自算出の注目度): 32.332197731504046
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Decoding strategies play a central role in shaping the reasoning ability of large language models (LLMs). Traditional methods such as greedy decoding and beam search often suffer from error propagation, while sampling-based approaches introduce randomness without adequate robustness. Self-consistency improves reliability by aggregating multiple rollouts, but incurs significant computational overhead. We propose an entropy-guided decoding framework that introduces token-level adaptivity into generation. At each step, the model computes the entropy of the token distribution, identifies high-uncertainty positions, and selectively branches on these vulnerable points. A dynamic pool of partial rollouts is maintained and expanded until solutions are completed, concentrating computation where uncertainty is greatest and avoiding unnecessary exploration in confident regions. To enable efficient termination, we apply a rollout-level Entropy After </Think> (EAT) stopping criterion by performing entropy evaluation after the full reasoning trace, rather than incrementally at every step. Experiments on GSM8K, AMC2023, and their perturbed variants demonstrate that our method achieves consistently strong accuracy. Notably, on smaller LLMs, performance is comparable to GPT-5 while operating at a fraction of the cost.
- Abstract(参考訳): デコード戦略は、大規模言語モデル(LLM)の推論能力を形成する上で中心的な役割を果たす。
グレディデコーディングやビームサーチといった従来の手法は、しばしばエラーの伝播に悩まされるが、サンプリングベースアプローチでは、十分なロバスト性を持たずにランダム性を導入する。
自己整合性は複数のロールアウトを集約することで信頼性を向上させるが、計算オーバーヘッドが大幅に増加する。
本稿では,トークンレベルの適応性を世代に導入するエントロピー誘導復号化フレームワークを提案する。
各ステップにおいて、モデルはトークン分布のエントロピーを計算し、高い不確かさの位置を特定し、これらの脆弱な点に対して選択的に分岐する。
部分ロールアウトの動的プールは、解が完了するまで維持および拡張され、不確実性が最大である計算に集中し、確実な領域での不要な探索を避ける。
効率的な終端化を実現するため,各段階において漸進的にではなく,完全な推論トレース後のエントロピー評価を行うことにより,ロールアウトレベルのエントロピー・アフター・シンク(EAT)の停止基準を適用した。
GSM8K, AMC2023, およびそれらの摂動変種に対する実験により, 本手法が一貫した精度を実現することを示す。
小型のLCMでは、性能はGPT-5に匹敵するが、コストはわずかである。
関連論文リスト
- Confidence-Based Decoding is Provably Efficient for Diffusion Language Models [8.527157686215117]
拡散言語モデル (DLM) は、言語モデリングのための自己回帰モデル (AR) に代わる有望な代替品として登場した。
DLMにおける信頼度に基づく復号化のための理論解析フレームワークを開発した。
論文 参考訳(メタデータ) (2026-03-23T17:43:21Z) - Not All Queries Need Deep Thought: CoFiCot for Adaptive Coarse-to-fine Stateful Refinement [24.721024438862553]
CoFiCotは粗粒度適応フレームワークで、推論戦略を問題に合わせる。
セマンティックエントロピー、コンセンサス信頼性、予測推論深度でクエリをトリアージするマルチメトリック分類器を実装した。
これにより、複雑なクエリをコンテキスト対応の修正ループにルーティングしながら、単純なクエリに対して効率的なアグリゲーションを適用することができる。
論文 参考訳(メタデータ) (2026-03-09T11:23:07Z) - ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference [60.958331943869126]
ODAR-Expertは、原則化されたリソース割り当てによる精度と効率のトレードオフを最適化する適応的なルーティングフレームワークである。
我々は、MATHの98.2%の精度、HumanityのLast Examの54.8%を含む、強く一貫した利得を示している。
論文 参考訳(メタデータ) (2026-02-27T05:22:01Z) - Towards Better Code Generation: Adaptive Decoding with Uncertainty Guidance [42.737012213197865]
AdaDecはアダプティブなデコーディングフレームワークで、ルックアヘッドベースで不確実性を認識した停止と再実行のメカニズムを採用している。
AdaDecは、greedyデコーディングと比較して、Pass@1の精度で20.9%の絶対的なゲインを達成する。
AdaDecは、必要に応じて再ランクを適用することで、計算オーバーヘッドとレイテンシを低減し、信頼性とともに効率を向上する。
論文 参考訳(メタデータ) (2025-06-10T16:49:46Z) - LIMOPro: Reasoning Refinement for Efficient and Effective Test-time Scaling [39.61818305829112]
PIR(Perplexity-based Importance Refinement)は,各推論ステップの重要性を定量的に評価するフレームワークである。
PIRは、プログレッシブ推論コンポーネントを保持しながら、低重要機能ステップのみを特定し、選択的にプーンする。
我々のアプローチは、異なるモデルサイズ、データソース、トークン予算にまたがる強力な一般化可能性を示す。
論文 参考訳(メタデータ) (2025-05-25T15:17:57Z) - Efficient Safety Alignment of Large Language Models via Preference Re-ranking and Representation-based Reward Modeling [84.00480999255628]
大規模言語モデル(LLM)の安全性アライメントのための強化学習アルゴリズムは,分散シフトの課題に直面している。
現在のアプローチでは、ターゲットポリシーからのオンラインサンプリングを通じてこの問題に対処するのが一般的である。
モデル固有の安全判断能力を活用して報酬信号を抽出する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-13T06:40:34Z) - Self-Evaluation Guided Beam Search for Reasoning [61.523627290397556]
我々は,Large Language Model (LLM) の推論プロセスのガイドと校正を行うための段階的自己評価機構を導入する。
本稿では,ビームサーチによる自己評価ガイダンスを統合した復号アルゴリズムを提案する。
我々のアプローチは、GSM8K、AQuA、StrategyQAにおいて、対応するCodexバックボンドベースラインをわずかに精度6.34%、9.56%、および5.46%で上回る。
論文 参考訳(メタデータ) (2023-05-01T02:37:59Z) - Adaptive Sampling for Best Policy Identification in Markov Decision
Processes [79.4957965474334]
本稿では,学習者が生成モデルにアクセスできる場合の,割引マルコフ決定(MDP)における最良の政治的識別の問題について検討する。
最先端アルゴリズムの利点を論じ、解説する。
論文 参考訳(メタデータ) (2020-09-28T15:22:24Z) - Combining Deep Learning and Optimization for Security-Constrained
Optimal Power Flow [94.24763814458686]
セキュリティに制約のある最適電力フロー(SCOPF)は、電力システムの基本である。
SCOPF問題におけるAPRのモデル化は、複雑な大規模混合整数プログラムをもたらす。
本稿では,ディープラーニングとロバスト最適化を組み合わせた新しい手法を提案する。
論文 参考訳(メタデータ) (2020-07-14T12:38:21Z) - Distributional Robustness and Regularization in Reinforcement Learning [62.23012916708608]
経験値関数の新しい正規化器を導入し、ワッサーシュタイン分布のロバストな値関数を下限とすることを示す。
強化学習における$textitexternalな不確実性に対処するための実用的なツールとして正規化を使用することを提案する。
論文 参考訳(メタデータ) (2020-03-05T19:56:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。