論文の概要: Selective Regenerative Decoding: Trajectory-Level Intervention for Inference-Time Reasoning
- arxiv url: http://arxiv.org/abs/2608.24338v1
- Date: Tue, 25 Aug 2026 10:01:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.928819
- Title: Selective Regenerative Decoding: Trajectory-Level Intervention for Inference-Time Reasoning
- Title(参考訳): Selective Regenerative Decoding: Inference-Time Reasoningのための軌道レベル干渉
- Abstract要約: Selective Regenerative Decodingは、各候補がサフィックスの劣化した部分だけを捨てたり、保存したり、洗練したりするためのルートである。
SRDは、リジェクションサンプリングよりも1.28から1.36倍のサンプル効率向上を実現している。
MATH500、GPQAダイアモンド、HotpotQA、AlpacaEvalを複数生成逆モデルペアで比較すると、SRDはNの精度とほぼ少ない生成トークンで一致している。
- 参考スコア(独自算出の注目度): 12.065412919637525
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Inference-time decoding methods improve LLM reasoning by exploring multiple candidate trajectories, yet treat each trajectory as atomic: either retaining it whole or discarding it irreversibly. This wastes computation on partially promising candidates whose high-quality prefixes are abandoned alongside degraded suffixes. We introduce Selective Regenerative Decoding (SRD), which routes each candidate to discard, keep, or refine only the degraded portion of the suffix while preserving the useful prefix of borderline candidates, without requiring a larger target model. Under mild assumptions, SRD achieves a provable 1.28-to-1.36-fold gain in sample efficiency over rejection sampling with strictly higher expected trajectory quality, with the gain growing as the candidate pool grows. Across MATH500, GPQA Diamond, HotpotQA, and AlpacaEval with multiple generation-reward model pairs, SRD matches Best-of-N accuracy with substantially fewer generated tokens and outperforms speculative rejection in low-compute regimes. By enabling segment-level intervention rather than whole-trajectory selection, SRD opens a previously underexplored region of the accuracy-compute tradeoff for inference-time reasoning.
- Abstract(参考訳): 推論時復号法は、複数の候補軌道を探索してLSM推論を改善するが、各軌道をアトミックとして扱う。
これにより、劣化した接尾辞とともに高品質な接頭辞が放棄された部分的に有望な候補の計算を無駄にする。
SRD(Selective Regenerative Decoding)を導入し、より大きなターゲットモデルを必要とせず、バウンダリ候補の有用な接頭辞を保ちながら、各候補が接尾辞の劣化部分のみを捨てたり、保存したり、洗練したりする。
軽度の仮定では、SRDは、予想される軌道品質が厳格に高い拒絶サンプリングよりも1.28-to-1.36-foldのサンプル効率が証明可能な1.28-to-1.36-foldの利得を達成し、候補プールが大きくなるにつれて利得は増大する。
MATH500、GPQAダイアモンド、HotpotQA、AlpacaEvalを複数の世代逆モデルペアで比較すると、SRDは生成トークンを著しく少なくしてベスト・オブ・Nの精度と一致し、低量子状態における投機的拒絶よりも優れていた。
SRDは、全軌道選択よりもセグメントレベルの介入を可能にすることにより、推論時間推論のための精度計算トレードオフの未探索領域を開放する。
関連論文リスト
- ResiSpec: Enhancing Multi-Candidate Speculative Sampling via Residual Distribution Shaping [79.1905186547363]
ResiSpecは、検証中に提案の配布を戦略的に改革するフレームワークである。
候補の偏光を防止し、最先端のマルチ候補法よりも最大1.92$times$スピードアップを達成する。
論文 参考訳(メタデータ) (2026-08-25T11:25:55Z) - Deeper is Not Always Better: Mitigating the Alignment Tax via Confident Layer Decoding [92.1521161575198]
我々は、最も信頼性の高いニアファイナル層を動的に選択する、トレーニング不要なデコーディング戦略であるConfident Decodingを紹介する。
密集型および混合型LLMの実験は、挑戦的推論ベンチマークにおいて一貫した利得を示す。
論文 参考訳(メタデータ) (2026-06-20T07:03:26Z) - How Useful is Causal Invariance for Domain Adaptation in Finite-Sample Settings? [58.740078141879984]
機械学習モデルは、トレーニングされたソースディストリビューションとは異なるターゲットディストリビューションにデプロイされると、しばしば劣化する。
因果関係に基づく領域一般化における最近の研究は、共用因果構造が不変な予測因子を誘導する方法を示している。
本稿では,完全あるいは部分的な因果知識が,教師付きドメイン適応を確実に改善できるかどうかについて検討する。
論文 参考訳(メタデータ) (2026-06-10T21:07:49Z) - Intrinsic Selection and Particle Resampling for Inference-Time Scaling Beyond Domain Verifiability [15.77992479706947]
推論時間スケーリング(ITS)は、数学やコーディングといった検証可能な領域で大きく成功している。
しかし、ITSを系統的な失敗に陥るタスクに拡張することは、通常、コストのかかる外部解決器や不安定なモデルベースの検証器に依存する。
私たちのパイプラインは、広義、ドメイン特化、マルチモーダルアーキテクチャにシームレスに適用します。
論文 参考訳(メタデータ) (2026-06-07T21:43:37Z) - ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning [69.64972562984882]
提案するThoughtFoldは,よりきめ細かい選好学習を,効率的な推論のための冗長探索に活用するフレームワークである。
ThoughtFoldは効率を大幅に向上させる。
最先端の精度を維持しつつ、DeepSeek-R1-Distill-Qwen-7Bのトークン使用量を約56%削減する。
論文 参考訳(メタデータ) (2026-06-02T11:21:27Z) - Truncated Step-Level Sampling with Process Rewards for Retrieval-Augmented Reasoning [32.295907409325615]
強化学習による検索エンジンの推論のための大規模言語モデルの訓練は、信用代行問題によって妨げられる。
2つの相補的なアイデアに基づいて構築されたフレームワークであるSLATEを提案する。
7つのQAベンチマークの実験では、SLATEがスパース・リワードとプロセス・リワードのベースラインを一貫して上回っていることが確認された。
論文 参考訳(メタデータ) (2026-02-26T19:05:40Z) - Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching [66.39914384073145]
本稿では,安価な拡散サンプリング推論をステップレベル候補の再利用プールに変換する自己整合性フレームワークを提案する。
ステップレベルの再結合は、難しい問題に対して最も有益であることがわかった。
トレーニング不要のフレームワークは、6つの数学およびコーディングタスクの平均精度を最大2倍改善します。
論文 参考訳(メタデータ) (2026-02-26T11:08:39Z) - DeRAG: Black-box Adversarial Attacks on Multiple Retrieval-Augmented Generation Applications via Prompt Injection [0.9499594220629591]
アドリシャル・プロンプト・アタックは、レトリーバル・アフュージョンド・ジェネレーション(RAG)システムの信頼性を大きく変える可能性がある。
本稿では, RAGに基づく質問応答に対して, 対角的プロンプト接尾辞を最適化するために, 微分進化(DE)を適用した新しい手法を提案する。
論文 参考訳(メタデータ) (2025-07-20T16:48:20Z) - Uncertainty-Penalized Direct Preference Optimization [52.387088396044206]
我々は、優先不確実性ペナル化スキームを導入し、DPOの悲観的な枠組みを開発する。
ペナル化は、不確実なサンプルの損失勾配を減衰させる損失の補正として機能する。
我々は,バニラDPOと比較して全体的な性能が向上し,高い不確実性選択/拒絶反応によるプロンプトの完成度も向上した。
論文 参考訳(メタデータ) (2024-10-26T14:24:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。