論文の概要: Reward Learning from Best-of-$N$ Preference Data: Targets, Tradeoffs, and Design Principles
- arxiv url: http://arxiv.org/abs/2605.30619v1
- Date: Thu, 28 May 2026 22:15:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.266339
- Title: Reward Learning from Best-of-$N$ Preference Data: Targets, Tradeoffs, and Design Principles
- Title(参考訳): ベスト・オブ・N$の選好データから学ぶ:ターゲット、トレードオフ、設計原則
- Authors: Rattana Pukdee, Maria-Florina Balcan, Pradeep Ravikumar,
- Abstract要約: 我々は、その誘導条件分布による嗜好データの最近の分析をBest-of-N$に専門化する。
独立参照変種に対しては、N$と基底分布の明示的な関数として閉形式報酬対象を導出する。
合成および実選好データに関する実験は、予測されたサンプルサイズとベース分布形状への依存を支持する。
- 参考スコア(独自算出の注目度): 39.21477667267936
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Best-of-$N$ sampling is widely used to construct pairwise preference data: $N$ candidates are drawn from a base distribution, and the best is paired with a rejected response. Despite its widespread use, what Bradley--Terry (BT) reward learning extracts from such data, and how to choose $N$ and the base distribution, remain unclear. We specialize a recent analysis of preference data via its induced conditional distribution to Best-of-$N$. For independent-reference variants, we derive closed-form reward targets as explicit functions of $N$ and the base distribution, and show that they preserve the latent reward ranking. For the practical Best-vs-Random and Best-vs-Worst variants, chosen and rejected responses are coupled through the same candidate set, so exact BT representability generally fails; nevertheless, bounded-class minimizers approach the reference targets as $N$ grows. Although margin and connectivity are known to govern sample efficiency in pairwise preference learning, Best-of-$N$ couples them through $N$ in opposing directions: larger $N$ widens pairwise margins but reduces connectivity. This trade-off yields two design principles: use larger $N$ when preference labels are the bottleneck, smaller $N$ when generation is the bottleneck; and shape the base distribution to place mass between the responses whose comparison matters most at test time. Experiments on synthetic and real preference data support the predicted dependence on sample size and base-distribution shape.
- Abstract(参考訳): Best-of-N$ サンプリングは、ペアの選好データを構築するために広く使用される:$N$ 候補は、ベースディストリビューションから引き出され、ベストは、拒否された応答とペアリングされる。
広く使われているにもかかわらず、Bradley-Terry (BT) がそのようなデータからどのような報奨学習を抽出し、どのように$N$とベースディストリビューションを選択するかは未だ不明である。
我々は、その誘導条件分布による嗜好データの最近の分析をBest-of-N$に専門化する。
独立参照変種に対しては、N$と基底分布の明示的な関数として閉形式報酬目標を導出し、それらが潜在報酬ランキングを保持することを示す。
実用的なBest-vs-RandomとBest-vs-Worstでは、選択された応答と拒否された応答は同じ候補セットを介して結合されるため、BTの正確な表現性は一般的に失敗する。
マージンと接続性はペアの選好学習においてサンプル効率を管理することが知られているが、Best-of-N$は反対の方向に$N$を通して結合する:より大きな$N$はペアのマージンを拡大するが、接続性は減少する。
このトレードオフは2つの設計原則を生み出します – 選好ラベルがボトルネックとなる場合のより大きい$N$、生成時に小さな$N$、テスト時に最も重要となるレスポンス間の質量を割り当てるために基本分布を形作る、というものです。
合成および実選好データに関する実験は、予測されたサンプルサイズとベース分布形状への依存を支持する。
関連論文リスト
- DISCO: Diversifying Sample Condensation for Efficient Model Evaluation [59.01400190971061]
コスト評価は傾向を低下させ、イノベーションのサイクルを遅くし、環境への影響を悪化させる。
モデル応答の多様性を最大化するサンプルを選択することが重要となる。
我々のメソッドである$textbfDiversifying Sample Condensation (DISCO)$は、最も大きなモデル不一致を持つトップkサンプルを選択します。
論文 参考訳(メタデータ) (2025-10-09T08:53:59Z) - Finding the Sweet Spot: Preference Data Construction for Scaling Preference Optimization [66.67988187816185]
本研究の目的は、繰り返しランダムサンプリングにより、オンラインサンプルの数を増大させ、アライメント性能を向上させることである。
実験の結果,サンプルサイズが大きくなるにつれて,この戦略がエフェデクリンの性能向上につながることが明らかとなった。
サンプルの規模が大きくなるにつれてモデル性能を継続的に向上するスケーラブルな嗜好データ構築戦略を導入する。
論文 参考訳(メタデータ) (2025-02-24T04:22:57Z) - Geometric-Averaged Preference Optimization for Soft Preference Labels [78.2746007085333]
LLMを人間の嗜好と整合させる多くのアルゴリズムは、人間の嗜好は二進的かつ決定論的であると仮定する。
本研究では,分散ソフトな選好ラベルを導入し,損失関数におけるLLM出力確率の重み付き幾何平均を用いて直接選好最適化(DPO)を改善する。
論文 参考訳(メタデータ) (2024-09-10T17:54:28Z) - Robust Reinforcement Learning from Corrupted Human Feedback [86.17030012828003]
人間からのフィードバックからの強化学習(RLHF)は、AIシステムと人間の嗜好データを調整するための原則化されたフレームワークを提供する。
我々はRLHFのロバストなアプローチ-$R3M$を提案し、これは、潜在的に破損した選好ラベルをスパースアウトリーとしてモデル化する。
大規模言語モデル(LLM)を用いたロボット制御と自然言語生成の実験により、R3M$は、好みデータに対する様々な摂動に対する報酬の堅牢性を向上することを示した。
論文 参考訳(メタデータ) (2024-06-21T18:06:30Z) - BoNBoN Alignment for Large Language Models and the Sweetness of Best-of-n Sampling [16.38043428743923]
本稿では,大言語モデルからのサンプルを,ベスト・オブ・nドルサンプリングを用いてヒトの嗜好に合わせることの問題点について述べる。
基本モデルからKL距離に対する勝利率とのトレードオフの観点から,n$の最高値が本質的に最適であることを示す。
実験により,BoNBoNアライメントは基本方針に好適なモデルの生成において,大幅な改善をもたらすことが示された。
論文 参考訳(メタデータ) (2024-06-02T18:42:57Z) - Variance Alignment Score: A Simple But Tough-to-Beat Data Selection
Method for Multimodal Contrastive Learning [17.40655778450583]
本稿では、Sigma_texttest, Sigma_irangle$という形式を持つVariance Alignment Score(VAS)という原則付き計量を提案する。
VASとCLIPのスコアを合わせると、ノイズの多いデータセットDataCompの38評価セットに1.3%、高品質なデータセットCC12MのVTABに2.5%の差でベースラインを上回ります。
論文 参考訳(メタデータ) (2024-02-03T06:29:04Z) - Ranking Inferences Based on the Top Choice of Multiway Comparisons [2.468314282946207]
本稿では、各試行においてランダムに選択された項目のうち、上位選択の観測データに基づいて、$n$アイテムのランキングを考察する。
これは、M$-wayランキングに対するプラケット=リュックモデルの有用な修正であり、最高選択のみを観測し、M=2$に対応する祝賀されたブラッドリー=テリー=リュックモデルの延長である。
論文 参考訳(メタデータ) (2022-11-22T02:34:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。