論文の概要: Depth-Entropy Guided Sampling for Training-Free LLM Reasoning
- arxiv url: http://arxiv.org/abs/2607.09693v1
- Date: Fri, 19 Jun 2026 12:36:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-19 21:54:20.372628
- Title: Depth-Entropy Guided Sampling for Training-Free LLM Reasoning
- Title(参考訳): LLM推論のための深さエントロピーガイドサンプリング
- Authors: Zibin Meng, Peng Xie, Kani Chen,
- Abstract要約: 強化学習(Reinforcement Learning, RL)は, 大規模言語モデルの推論能力向上のための主要なパラダイムとなっている。
固有品質信号として層ワイドエントロピー崩壊を利用するトレーニング不要なテスト時間法であるDepth-Entropy Guided Sampling (DEGS)を紹介する。
- 参考スコア(独自算出の注目度): 7.057431471793534
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning (RL) has become the dominant paradigm for improving the reasoning capabilities of large language models, but it requires expensive training, curated data, and reward signals. Recent work shows that sampling from sharpened base-model distributions at test time recovers much of the RL gain, yet existing methods rely solely on output-layer likelihoods and ignore the transformer's internal forward-pass dynamics. We introduce Depth-Entropy Guided Sampling (DEGS), a training-free, test-time method that exploits layer-wise entropy collapse as an intrinsic quality signal. We observe that stronger reasoners -- including RL-posttrained variants -- exhibit a distinctive "late collapse": logit-lens decoded entropy stays elevated until deeper layers before converging. We define a per-sequence collapse depth $D(\mathbf{x})$ and a joint objective $π(\mathbf{x}) \propto p(\mathbf{x})^α\exp(βD(\mathbf{x}))$ that combines sequence likelihood with this depth-entropy structure, instantiated inside an MCMC power-sampling framework (DEGS-MCMC). Across three open-weight models and four reasoning benchmarks, this near-chance per-candidate signal compounds over the sampling trajectory into state-of-the-art training-free accuracy, with gains largest out of domain and on the harder splits -- exactly where likelihood alone falls short -- at single-digit-percent wall-clock overhead. DEGS narrowly trails an in-house GRPO reference on the math splits GRPO was trained for, yet surpasses it out of domain on GPQA for all three models, without any training, reward model, or labeled data.
- Abstract(参考訳): 強化学習(Reinforcement Learning, RL)は、大規模言語モデルの推論能力を改善するための主要なパラダイムとなっているが、高価なトレーニング、キュレートされたデータ、報酬信号が必要である。
近年の研究では,RLのゲインの多くを改良したベースモデル分布からのサンプリングが回収されているが,既存の手法は出力層確率のみに依存し,トランスフォーマーの内部フォワードパスのダイナミクスを無視する。
本稿では,本質的な品質信号として層ワイドエントロピー崩壊を生かしたDepth-Entropy Guided Sampling (DEGS)を導入する。
我々は、RL後続の変種を含む強い推論器が顕著な「後期崩壊」を示しており、ロジトレンデコードエントロピーは収束する前に深い層まで上昇し続けることを観察した。
シーケンス毎の崩壊深さ$D(\mathbf{x})$と、MCMCパワーサンプリングフレームワーク(DEGS-MCMC)内でインスタンス化された、シーケンスの確率とこの深さエントロピー構造を組み合わせた共同目的$π(\mathbf{x})^α(βD(\mathbf{x})$を定義する。
3つのオープンウェイトモデルと4つの推論ベンチマークで、この候補毎の信号化合物はサンプリング軌道上、最先端のトレーニング不要の精度に近づいている。
DEGSは、GRPOがトレーニングした数学分割に関する社内のGRPO参照をわずかに追っているが、トレーニング、報酬モデル、ラベル付きデータなしで、GPQAのドメイン外である。
関連論文リスト
- Posterior Augmented Flow Matching [64.1559809786948]
後拡張フローマッチング(PAFM)はフローマッチング(FM)の一般化である
PAFMは、異なるモデルスケールで最大3.4FID50KでFMよりも改善されていることを示す。
論文 参考訳(メタデータ) (2026-05-01T17:59:59Z) - Reasoning with Sampling: Your Base Model is Smarter Than You Think [52.639108524651846]
本稿では,基本モデル自身の可能性を利用した単純な反復サンプリングアルゴリズムを提案する。
我々のアルゴリズムは、ほぼ一致し、RLのアルゴリズムよりも優れているという推論において、大幅に向上することを示した。
我々の方法は、トレーニング、キュレートされたデータセット、検証器を必要としない。
論文 参考訳(メタデータ) (2025-10-16T17:18:11Z) - Tracing the Representation Geometry of Language Models from Pretraining to Post-training [22.18942718274405]
本研究では,事前学習と後学習にまたがる学習表現の幾何学をスペクトル的に検討する。
自己回帰事前学習中に3つの幾何位相の一貫した非単調列が発見された。
SFTとDPOは、特定の命令データや優先データを統合するために「エントロピー探索」ダイナミクスを駆動します。
論文 参考訳(メタデータ) (2025-09-27T00:46:29Z) - Inference-Time Scaling of Diffusion Language Models with Particle Gibbs Sampling [70.8832906871441]
我々は、モデルを再訓練することなく、所望の報酬に向けて世代を操る方法を研究する。
従来の手法では、通常は1つの認知軌道内でサンプリングやフィルタを行い、軌道レベルの改善なしに報酬をステップバイステップで最適化する。
本稿では,拡散言語モデル(PG-DLM)の粒子ギブスサンプリングについて紹介する。
論文 参考訳(メタデータ) (2025-07-11T08:00:47Z) - Fractured Chain-of-Thought Reasoning [61.647243580650446]
完全CoTと解のみのサンプリングを補間する統合推論時間戦略であるフラクチャードサンプリングを導入する。
フラクチャードサンプリングは、Pass@kとトークンの予算に対して、急激なログ線形スケーリングゲインをもたらすため、優れた精度とコストのトレードオフを一貫して達成できることを示す。
論文 参考訳(メタデータ) (2025-05-19T11:30:41Z) - Reinforcement Learning from Human Feedback without Reward Inference: Model-Free Algorithm and Instance-Dependent Analysis [16.288866201806382]
モデルフリーなRLHFベストポリシー識別アルゴリズムである$mathsfBSAD$を、明示的な報酬モデル推論なしで開発する。
アルゴリズムは、人選好情報から直接、その最適方針を後方方向に識別する。
論文 参考訳(メタデータ) (2024-06-11T17:01:41Z) - Posterior Coreset Construction with Kernelized Stein Discrepancy for
Model-Based Reinforcement Learning [78.30395044401321]
我々は、強化学習(MBRL)のための新しいモデルベースアプローチを開発する。
ターゲット遷移モデルの仮定を緩和し、混合モデルの一般的な族に属する。
連続的な制御環境では、壁時計の時間を最大50%削減することができる。
論文 参考訳(メタデータ) (2022-06-02T17:27:49Z) - Model-based Reinforcement Learning for Continuous Control with Posterior
Sampling [10.91557009257615]
連続状態空間における強化学習(PSRL)のためのモデルベース後方サンプリングについて検討した。
MPC-PSRLはモデルに基づく後部サンプリングアルゴリズムであり,行動選択のためのモデル予測制御を行う。
論文 参考訳(メタデータ) (2020-11-20T21:00:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。