論文の概要: Inference-Time Nash Alignment
- arxiv url: http://arxiv.org/abs/2609.08082v1
- Date: Tue, 08 Sep 2026 00:50:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.5403
- Title: Inference-Time Nash Alignment
- Title(参考訳): 推論時間ナッシュアライメント
- Authors: Hadi Hosseini, Debmalya Mandal, Duohan Zhang,
- Abstract要約: 一般的な選好下での推論時間アライメントについて検討する。
我々はBest-of-Nash(BoN)とNash Mirror Descent(NMD)の2つのアルゴリズムを提案する。
- 参考スコア(独自算出の注目度): 27.24549104998628
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Preference-based fine-tuning methods such as RLHF and DPO require substantial compute and large preference datasets. They also need direct access to the model parameters which are not provided by many state-of-the art models. Inference-time alignment offers a cost-effective alternative without updating model parameters. However, existing inference-time methods rely on a scalar reward model derived under a Bradley-Terry assumption, which cannot represent general preferences. Following recent work on fine-tuning with generalized preferences, in this work, we initiate the study of inference-time alignment under general preferences. We formulate the problem as obtaining a Nash equilibrium of a two-player zero-sum game between policies. We propose two algorithms: Best-of-Nash (BoN) and Nash Mirror Descent (NMD). We prove that both algorithms achieve a duality gap that matches the problem lower bound. Empirically, we implement the two methods on three datasets, which shows that our methods substantially outperform the base policy, converging to the performance of the fine-tuned models. Moreover, our results show that NMD remains robust across the regularization parameter.
- Abstract(参考訳): 優先度に基づくRLHFやDPOのような微調整手法は、かなりの計算量と大規模な選好データセットを必要とする。
また、多くの最先端技術モデルでは提供されないモデルパラメータに直接アクセスする必要がある。
推論時アライメントは、モデルパラメータを更新せずにコスト効率の良い代替手段を提供する。
しかし、既存の推論時間法はブラッドリー・テリーの仮定に基づいて導出されたスカラー報酬モデルに依存しており、一般的な選好を表現できない。
一般化された選好を伴う微調整に関する最近の研究に続いて、本研究では、一般選好の下での推論時間アライメントの研究を開始する。
本稿では,ポリシー間の2プレーヤゼロサムゲームのナッシュ平衡を求める問題として定式化する。
我々は,Best-of-Nash(BoN)とNash Mirror Descent(NMD)の2つのアルゴリズムを提案する。
両アルゴリズムが,問題の下位境界に合致する双対性ギャップを達成できることを実証する。
実験により、3つのデータセットに2つの手法を実装し、この手法がベースポリシーを大幅に上回り、微調整されたモデルの性能に収束することを示す。
さらに,本研究の結果から,NMDは正規化パラメータ全体にわたって頑健であることが明らかとなった。
関連論文リスト
- Unregularized Linear Convergence in Zero-Sum Game from Preference Feedback [50.89125374999765]
NLHFにおける最適乗算重み更新(mathtOMWU$)に対する最初の収束保証を提供する。
本分析では, 稀に発生する行動の確率が指数関数的に小さい値から指数関数的に増大する新たな限界収束挙動を同定する。
論文 参考訳(メタデータ) (2025-12-31T12:08:29Z) - Accelerating Nash Learning from Human Feedback via Mirror Prox [36.04055906691423]
オンラインNLHFアルゴリズムであるNash Mirror Prox(mathtNash-MP$)を導入する。
我々の理論的解析により、ナッシュ-MPは、$beta$-regularized Nash平衡に対して、最終点の線形収束を示すことが証明された。
また,Nash-MPは,利用可能性ギャップと対数確率の半ノルムの均一性に対して,最終等級の線形収束を示すことを示した。
論文 参考訳(メタデータ) (2025-05-26T09:17:32Z) - Achieving $\widetilde{\mathcal{O}}(\sqrt{T})$ Regret in Average-Reward POMDPs with Known Observation Models [69.1820058966619]
平均逆無限水平POMDPを未知の遷移モデルで扱う。
この障壁を克服する斬新でシンプルな推定器を提示する。
論文 参考訳(メタデータ) (2025-01-30T22:29:41Z) - InfAlign: Inference-aware language model alignment [58.66389179049758]
言語モデルのアライメントは、現代の生成言語モデルのトレーニングにおける重要なステップである。
この列車/テストのミスマッチは、推論時間法の観点から標準のRLHFフレームワークを最適化することを示す。
本稿では,ベースモデルに対するアライメントポリシーの予測時間勝利率を最適化することを目的とした,推論対応アライメント(InfAlign)フレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-27T18:45:36Z) - Stochastic Two Points Method for Deep Model Zeroth-order Optimization [32.459322001738144]
本稿では,勾配自由状態下での効率的な2点(S2P)アプローチを提案する。
一般および緩和された滑らか性仮定の下で、S2Pの理論収束性を示す。
我々は、VS2Pが深層モデルの目的を最適化するのに非常に効果的であることを示す。
論文 参考訳(メタデータ) (2024-02-02T18:39:40Z) - On the Effectiveness of Parameter-Efficient Fine-Tuning [79.6302606855302]
現在、多くの研究が、パラメータのごく一部のみを微調整し、異なるタスク間で共有されるパラメータのほとんどを保持することを提案している。
これらの手法は, いずれも細粒度モデルであり, 新たな理論的解析を行う。
我々の理論に根ざした空間性の有効性にもかかわらず、調整可能なパラメータをどう選ぶかという問題はまだ未解決のままである。
論文 参考訳(メタデータ) (2022-11-28T17:41:48Z) - Contrastive Neural Ratio Estimation for Simulation-based Inference [15.354874711988662]
Likelihood-to-evidence ratio Estimation は通常、バイナリ (NRE-A) またはマルチクラス (NRE-B) の分類タスクとしてキャストされる。
バイナリ分類フレームワークとは対照的に、現在のマルチクラスバージョンの定式化は本質的で未知のバイアス項を持つ。
我々は,NRE-Bに固有のバイアスを最適に含まないマルチクラスフレームワークを提案し,実践者が依存する診断を行う立場に置かれる。
論文 参考訳(メタデータ) (2022-10-11T00:12:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。