Fugu-MT 論文翻訳(概要): TreeBoN: Enhancing Inference-Time Alignment with Speculative Tree-Search and Best-of-N Sampling

論文の概要: TreeBoN: Enhancing Inference-Time Alignment with Speculative Tree-Search and Best-of-N Sampling

arxiv url: http://arxiv.org/abs/2410.16033v2
Date: Sun, 27 Oct 2024 22:30:42 GMT
ステータス: 翻訳完了
システム内更新日: 2024-11-28 17:07:38.483036
Title: TreeBoN: Enhancing Inference-Time Alignment with Speculative Tree-Search and Best-of-N Sampling
Title（参考訳）: TreeBoN: 投機的ツリー探索とベストオブNサンプリングによる推論時間アライメントの強化
Authors: Jiahao Qiu, Yifu Lu, Yifan Zeng, Jiacheng Guo, Jiayi Geng, Huazheng Wang, Kaixuan Huang, Yue Wu, Mengdi Wang,
Abstract要約: 推論時アライメントは、追加のトレーニングや微調整を必要とせずに、大きな言語モデルの性能を向上させる。 Best-of-N (BoN) サンプリングは、単純だが強力なアプローチであり、複数のレスポンスを生成し、最良のものを選択する。我々は、投機的木探索戦略をBest-of-N(BoN)サンプリングに統合する新しいフレームワークであるTreeBoNを提案する。
参考スコア（独自算出の注目度）: 39.019269570224004
License: http://creativecommons.org/licenses/by/4.0/
Abstract: Inference-time alignment enhances the performance of large language models without requiring additional training or fine-tuning but presents challenges due to balancing computational efficiency with high-quality output. Best-of-N (BoN) sampling, as a simple yet powerful approach, generates multiple responses and selects the best one, achieving improved performance but with a high computational cost. We propose TreeBoN, a novel framework that integrates a speculative tree-search strategy into Best-of-N (BoN) Sampling. TreeBoN maintains a set of parent nodes, iteratively branching and pruning low-quality responses, thereby reducing computational overhead while maintaining high output quality. Our approach also leverages token-level rewards from Direct Preference Optimization (DPO) to guide tree expansion and prune low-quality paths. We evaluate TreeBoN using AlpacaFarm, HH-RLHF, UltraFeedback, GSM8K, and TutorEval datasets, demonstrating consistent improvements. Specifically, TreeBoN achieves the highest win rate of 65% on TutorEval and around 60% win rates across other different datasets, outperforming standard BoN with the same computational cost and showcasing its scalability and alignment efficacy.
Abstract（参考訳）: 推論時アライメントは、追加のトレーニングや微調整を必要とせずに、大規模言語モデルの性能を向上させるが、計算効率と高品質な出力のバランスをとることによる課題を提示する。 Best-of-N (BoN) サンプリングは、単純だが強力なアプローチであり、複数の応答を生成し、最高の応答を選択する。我々は、投機的木探索戦略をBest-of-N(BoN)サンプリングに統合する新しいフレームワークであるTreeBoNを提案する。 TreeBoNは、一連の親ノードを維持し、繰り返し分岐し、低品質のレスポンスをプルーニングすることで、高い出力品質を維持しながら計算オーバーヘッドを低減する。また,DPO(Direct Preference Optimization)のトークンレベルの報酬を利用して,木の拡大と低品質パスを導出する。我々はAlpacaFarm、HH-RLHF、UltraFeedback、GSM8K、TutorEvalのデータセットを用いてTreeBoNを評価し、一貫した改善を示す。具体的には、TreeBoNはTutorEvalで65%、他の異なるデータセットで60%の勝利率を達成し、同じ計算コストで標準のBoNを上回り、スケーラビリティとアライメントの妥当性を示す。

関連論文リスト

RS-ORT: A Reduced-Space Branch-and-Bound Algorithm for Optimal Regression Trees [2.612627266839037]
MIP(Mixed-integer Programming)は最適な決定木を学習するための強力なフレームワークとして登場した。連続的な特徴を内在的にバイナライズすることは、グローバルな最適性を犠牲にし、しばしば不必要に深い木を産み出す。最適回帰木学習を2段階最適化問題として再放送し、RS-ORT(Reduceed-Space Optimal Regression Trees)を提案する。 RS-ORTは木構造変数のみに枝分かれする特殊分岐結合(BB)アルゴリズムである。
論文参考訳（メタデータ） (2025-10-27T22:17:09Z)
TreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Efficiency with Heuristic Tree-based Modeling [65.46347858249295]
TreePOは自己誘導型ロールアウトアルゴリズムで、シーケンス生成を木構造検索プロセスとして見る。 TreePOは基本的に、探索の多様性を保存または強化しながら、更新毎の計算負担を削減します。
論文参考訳（メタデータ） (2025-08-24T16:52:37Z)
Multi-Armed Bandits-Based Optimization of Decision Trees [0.0]
本稿では,マルチアーマッドバンド (MAB) に基づくプルーニング手法,強化学習 (RL) に基づく手法を提案する。そこで我々はMABアルゴリズムを用いて各プルーニング動作からのフィードバックに基づいて最適な分岐ノードを見つける。
論文参考訳（メタデータ） (2025-08-08T02:43:45Z)
TreeRPO: Tree Relative Policy Optimization [55.97385410074841]
nameは、ツリーサンプリングを用いて、様々な推論ステップで報酬の数学的期待を推定する新しい方法である。 GRPOの集団相対的な報酬訓練機構に基づいて、木サンプリング時に生成されたステップレベルグループに基づいて報酬を革新的に計算する。
論文参考訳（メタデータ） (2025-06-05T15:56:38Z)
Sampling-Efficient Test-Time Scaling: Self-Estimating the Best-of-N Sampling in Early Decoding [64.2888389315149]
テスト時のスケーリングは、デコード時に余分な計算を追加することで、大きな言語モデルのパフォーマンスを改善する。ベストオブNサンプリング(Best-of-N sample)は一般的なスケーリング手法であり、より良いソリューションを見つけるために検索スペースを広げる。本稿では,全サンプリングの完全生成を回避する新しい復号法であるセルフトランケーションBest-of-N(ST-BoN)を提案する。
論文参考訳（メタデータ） (2025-03-03T11:21:01Z)
Can a Single Tree Outperform an Entire Forest? [5.448070998907116]
一般的な考え方は、単一の決定木は、テスト精度において古典的なランダムな森林を過小評価する。本研究では,斜め回帰木の試験精度を大幅に向上させることで,このような考え方に挑戦する。本手法は,木習熟を非制約最適化タスクとして再編成する。
論文参考訳（メタデータ） (2024-11-26T00:18:18Z)
Learning Deep Tree-based Retriever for Efficient Recommendation: Theory and Method [76.31185707649227]
効率的なレコメンデーションのために,Deep Tree-based Retriever (DTR)を提案する。 DTRは、トレーニングタスクを、同じレベルでツリーノード上のソフトマックスベースのマルチクラス分類としてフレーム化している。非リーフノードのラベル付けによって引き起こされる準最適性を緩和するため、損失関数の補正法を提案する。
論文参考訳（メタデータ） (2024-08-21T05:09:53Z)
BOND: Aligning LLMs with Best-of-N Distillation [63.254031574394965]
BOND(Best-of-N Distillation)は,Best-of-Nをエミュレートする新しいRLHFアルゴリズムである。具体的には、BONDは、ポリシーから世代分布をBest-of-N分布に近づけるように強制する分布マッチングアルゴリズムである。本稿では,抽象的な要約モデルとGemmaモデルの実験を通じて,提案手法の有効性といくつかの設計選択を実証する。
論文参考訳（メタデータ） (2024-07-19T18:38:25Z)
Variational Best-of-N Alignment [57.617866305771756]
Best-of-N(Best-of-N)は、言語モデルを人間の好みに合わせるアルゴリズムである。推論時にBoNが行うことを模倣するために、言語モデルを微調整することを提案する。我々のアプローチは平均場変分推論に類似しており、従ってそれを変分BoN(vBoN)と呼ぶ。
論文参考訳（メタデータ） (2024-07-08T15:59:44Z)
Adaptive Split Balancing for Optimal Random Forest [8.916614661563893]
そこで本研究では,新しい適応型分割バランス法を用いて木を構築するランダムフォレストアルゴリズムを提案する。本手法は,データから木構造を適応的に学習しながら,シンプルでスムーズなシナリオで最適性を実現する。
論文参考訳（メタデータ） (2024-02-17T09:10:40Z)
Reinforcement Learning for Node Selection in Branch-and-Bound [52.2648997215667]
現在の最先端セレクタは手作りのアンサンブルを使用して、ナイーブなサブノードセレクタと、個々のノードデータに依存する学習ノードセレクタを自動的に切り替える。孤立ノードではなく木の状態全体を考慮しながら強化学習(RL)を用いる新しいシミュレーション手法を提案する。
論文参考訳（メタデータ） (2023-09-29T19:55:56Z)
ForestPrune: Compact Depth-Controlled Tree Ensembles [7.538482310185135]
我々は,個々の木から深度層を刈り取ることで,木アンサンブルを後処理する新しいフレームワークであるフォレストプルーを紹介する。本研究では,フォレストプルーネにおける問題に対する高品質な解を効率的に得るための最適化アルゴリズムを開発した。実験により、フォレストプルーンは既存の後処理アルゴリズムによって抽出されたモデルより優れたパシモニアスモデルを生成することを示した。
論文参考訳（メタデータ） (2022-05-31T22:04:18Z)
bsnsing: A decision tree induction method based on recursive optimal boolean rule composition [2.28438857884398]
本稿では,決定木帰納過程における分割規則選択を最適化するMIP(Mixed-integer Programming)の定式化を提案する。商用の解法よりも高速に実例を解くことができる効率的な探索解法を開発した。
論文参考訳（メタデータ） (2022-05-30T17:13:57Z)
Improved Branch and Bound for Neural Network Verification via Lagrangian Decomposition [161.09660864941603]
ニューラルネットワークの入出力特性を公式に証明するためのブランチとバウンド(BaB)アルゴリズムのスケーラビリティを改善します。活性化に基づく新しい分岐戦略とBaBフレームワークであるブランチとデュアルネットワーク境界(BaDNB)を提案する。 BaDNBは、従来の完全検証システムを大きなマージンで上回り、対数特性で平均検証時間を最大50倍に削減した。
論文参考訳（メタデータ） (2021-04-14T09:22:42Z)
MurTree: Optimal Classification Trees via Dynamic Programming and Search [61.817059565926336]
動的プログラミングと探索に基づいて最適な分類木を学習するための新しいアルゴリズムを提案する。当社のアプローチでは,最先端技術が必要とする時間のごく一部しか使用せず,数万のインスタンスでデータセットを処理することが可能です。
論文参考訳（メタデータ） (2020-07-24T17:06:55Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。