論文の概要: ExpBoN: Exponential-Noise Best-of-$n$ for Efficient Test-Time LLM Alignment
- arxiv url: http://arxiv.org/abs/2609.21899v1
- Date: Fri, 18 Sep 2026 15:26:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-21 18:40:17.164368
- Title: ExpBoN: Exponential-Noise Best-of-$n$ for Efficient Test-Time LLM Alignment
- Title(参考訳): ExpBoN: 効率的なテスト時間LLMアライメントのための指数ノイズベスト$n$
- Abstract要約: Best-of-n$ (BoN) は単純な推論時間アライメント法である。
本稿では,指数ノイズレポート-ノイズ-マックス機構に基づく代替ソフトなBoN法であるExpBoNを紹介する。
- 参考スコア(独自算出の注目度): 41.48670035122493
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Best-of-$n$ (BoN) sampling is a simple yet effective inference-time alignment method, but hard maximization provides only coarse control over the trade-off between reward and distribution shift. Soft Best-of-$n$ (Verdun et al. 2025) provides smoother control and converges to the optimal distribution associated with KL-regularized reward maximization. In this paper, we introduce ExpBoN, an alternative soft BoN method based on the exponential-noise report-noisy-max mechanism. It admits an exact finite-$n$ decomposition, which yields exponentially fast convergence in total variation, expected reward, and both directions of KL divergence. We provide comprehensive theoretical analyses of its convergence and regret behavior. We further integrate ExpBoN into the guided speculative inference (GSI) framework (Geuter, Mroueh, and AlvarezMelis 2025), resulting in ExpGSI, for efficient reward-guided LLM alignment. ExpGSI yields substantial reductions in computational cost while maintaining comparable accuracy. Experiments on MATH500, MMLU-STEM, and Minerva Math with the Qwen2.5-Math and Qwen3 model families show that ExpGSI reduces estimated computation by $14\%$-$39\%$ across candidate budgets for Qwen2.5-Math and by up to $45\%$ at $n=16$ for Qwen3. Overall, our results provide a theoretical and algorithmic foundation for exponential-noise BoN and efficient test-time LLM alignment.
- Abstract(参考訳): Best-of-n$ (BoN) サンプリングは単純だが効果的な推論時間アライメント法であるが、ハード最大化は報酬と分配シフトの間のトレードオフの粗い制御のみを提供する。
Soft Best-of-n$ (Verdun et al 2025) はより滑らかな制御を提供し、KL-正規化報酬最大化に関連する最適分布に収束する。
本稿では,指数ノイズレポート-ノイズ-マックス機構に基づく代替ソフトなBoN法であるExpBoNを紹介する。
正確な有限$n$分解を認めており、総変分、期待報酬、KL発散の両方向の指数的に高速収束をもたらす。
我々は,その収束と後悔行動に関する包括的理論的分析を行う。
さらにExpBoNをGSIフレームワーク(Geuter,Mroueh,AlvarezMelis 2025)に統合し,ExpGSIを効率よく報酬誘導LDMアライメントする。
ExpGSIは、同等の精度を維持しながら、計算コストを大幅に削減する。
MATH500, MMLU-STEM, および Minerva Math with the Qwen2.5-Math and Qwen3 model family による実験では、ExpGSI は Qwen2.5-Math の候補予算をまたいだ推定計算を 14\%$-39\%$、Qwen3 の$n=16$で45\%$まで削減している。
全体として,この結果は,指数関数型BoNと効率的な試験時間LLMアライメントのための理論的,アルゴリズム的な基礎を提供する。
関連論文リスト
- Bayesian Best-Arm Identification with Abstention: A Polynomial-to-Exponential Phase Transition [51.253617466579335]
本研究では,学習者が端末の推薦を控えることができるベイジアン固定予算のベストアーム識別問題について検討する。
本研究は,非検出誤りの確率を解析し,吸収を伴わない準最適腕を推奨するリスクについて考察する。
論文 参考訳(メタデータ) (2026-06-28T05:07:27Z) - Provably Data-driven Lagrangian Relaxation for Mixed Integer Linear Programming [16.202112411377893]
ラグランジアン緩和(Lagrangian Relaxation, LR)は、MILP(Mixed Linear Programming)を解くための強力な手法である。
結合制約を緩和することにより、LRは並列サブプロブレム解を可能とし、しばしば通常の線形プログラミング緩和よりも厳密な双対境界を与える。
最近の実証研究は、これらの緩和を予測するために機械学習を用いた有望な結果を示しているが、そのような手法の理論的な理解は依然として未解決のままである。
論文 参考訳(メタデータ) (2026-05-18T19:16:42Z) - Provably Adaptive Linear Approximation for the Shapley Value and Beyond [73.0940890296463]
基本的で長期にわたる課題は、その効率的な近似である。
一般に用いられるすべての半値に対して$P(|hatboldsymbol-boldsymbol|_2geq)leq$を必要とする線形空間アルゴリズムを開発する。
本アルゴリズムは,各ユーティリティ関数の平均二乗誤差の明示的最小化を可能にする。
論文 参考訳(メタデータ) (2026-04-09T16:38:14Z) - CarBoN: Calibrated Best-of-N Sampling Improves Test-time Reasoning [62.56541355300587]
本稿では,高逆推論経路に向けてモデルを適応的に修正する一般的なテスト時間校正フレームワークを提案する。
本フレームワークでは,まず解空間を探索し,次にロジットの校正を学習する二相法であるCarBoNを提案する。
MATH-500とAIME-2024の実験では、CarBoNは効率を向上し、同じ精度に達するために最大4倍のロールアウトが可能である。
論文 参考訳(メタデータ) (2025-10-17T14:04:37Z) - Efficiently Solving Discounted MDPs with Predictions on Transition Matrices [6.199300239433395]
生成モデルに基づくDMDP(Discounted Markov Decision Processs)について検討した。
DMDPの解法において,遷移行列上での予測がサンプル効率をいかに向上させるかを検討するための新しい枠組みを提案する。
論文 参考訳(メタデータ) (2025-02-21T09:59:46Z) - Fairness in Monotone $k$-submodular Maximization: Algorithms and Applications [0.0]
我々は、fair $k$submodular問題を研究し、実行時間$mathO(knB)$で$frac13$近似を開発する。
我々は$k$-submodular関数がアクセスできないが、ほぼアクセス可能な場合にのみ近似を保証する。
論文 参考訳(メタデータ) (2024-11-08T04:20:12Z) - Demonstration-Regularized RL [39.96273388393764]
専門的な実証から,次数$widetildeO(mathrmPoly(S,A,H)/(varepsilon2 NmathrmE)$および$widetildeO(mathrmPoly(d,H)/(varepsilon2 NmathrmE)$の線形マルコフ決定過程における最適ポリシを同定した。
実演規則化手法が人間のフィードバックからの強化学習に有効であることを示す。
論文 参考訳(メタデータ) (2023-10-26T10:54:47Z) - Under-bagging Nearest Neighbors for Imbalanced Classification [63.026765294759876]
我々は,不均衡な分類問題に対して,textitunder-bagging $k$-NN (textitunder-bagging $k$-NN) というアンサンブル学習アルゴリズムを提案する。
論文 参考訳(メタデータ) (2021-09-01T14:10:38Z) - Provably Breaking the Quadratic Error Compounding Barrier in Imitation
Learning, Optimally [58.463668865380946]
状態空間 $mathcalS$ を用いたエピソードマルコフ決定過程 (MDPs) における模擬学習の統計的限界について検討する。
rajaraman et al (2020) におけるmdアルゴリズムを用いた準最適性に対する上限 $o(|mathcals|h3/2/n)$ を定式化する。
Omega(H3/2/N)$ $mathcalS|geq 3$ であるのに対して、未知の遷移条件はよりシャープレートに悩まされる。
論文 参考訳(メタデータ) (2021-02-25T15:50:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。