論文の概要: Pairwise Reference Alignment as a Model-Level Ordinal Observable
- arxiv url: http://arxiv.org/abs/2605.30758v1
- Date: Fri, 29 May 2026 02:41:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.348589
- Title: Pairwise Reference Alignment as a Model-Level Ordinal Observable
- Title(参考訳): モデルレベル順序観測可能なペアワイズ参照アライメント
- Abstract要約: ペアの選好の基準分布を考えると、モデルが拒否応答よりも優先応答をランク付けするかどうかを検証した場合、どのモデルレベルが推定されるか。
モデルスコアリング関数によって誘導される順序可観測関数として、ペアワイズ参照アライメントを定義する。
得られた量には単純な有限サンプル推定器と独立したサンプリング仮定の下での濃度境界がある。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Pairwise preference data is widely used in language-model evaluation and alignment, often for model ranking, reward modeling, or preference optimization. This note formulates a more basic measurement question: given a reference distribution of pairwise preferences, what model-level quantity is estimated when we test whether a model ranks preferred responses above rejected responses? We define pairwise reference alignment as an ordinal observable induced by a model scoring function. Given a reference pair distribution $P_{\mathrm{pair}}$ over triples $(x,y^+,y^-)$, and a scalar model score $S_M(x,y)$, we define the alignment observable as the probability that the model-induced ordering agrees with the reference preference ordering. We further define a centered order-parameter-like statistic and discuss a margin-based extension. The resulting quantities admit simple finite-sample estimators and concentration bounds under independent sampling assumptions. This note does not introduce a new benchmark. It provides a conceptual and statistical formulation for pairwise reference alignment, clarifies the role of the reference pair distribution, and distinguishes the general ordinal observable from scoring choices such as normalized log-probability or energy-based scores. We also provide an initial empirical study on Qwen2.5 models and RewardBench, where the proposed statistics increase with model size and instruction tuning and vary across reference-pair subsets as predicted by the formulation.
- Abstract(参考訳): ペアワイズ選好データは言語モデルの評価やアライメントに広く使われており、しばしばモデルランキング、報酬モデル、選好最適化に使用される。
ペアの選好の基準分布が与えられた場合、モデルが拒否応答よりも優先応答をランク付けするかどうかをテストする際に、モデルレベル量を推定する。
モデルスコアリング関数によって誘導される順序可観測関数として、ペアワイズ参照アライメントを定義する。
参照ペア分布 $P_{\mathrm{pair}}$ over triples $(x,y^+,y^-)$ とスカラーモデルのスコア $S_M(x,y)$ が与えられたとき、モデルによる順序付けが参照優先順序付けに一致する確率として観測可能なアライメントを定義する。
さらに、中心となる順序パラメータのような統計量を定義し、マージンベースの拡張について議論する。
得られた量には単純な有限サンプル推定器と独立したサンプリング仮定の下での濃度境界がある。
この新しいベンチマークは導入されていない。
これは、ペアの参照アライメントに対する概念的および統計的定式化を提供し、参照ペアの分布の役割を明確にし、正規化された対数確率やエネルギーベースのスコアなどのスコア選択と一般順序観測可能な一般順序を区別する。
また、Qwen2.5モデルとRewardBenchに関する実証的研究を行い、モデルサイズと命令チューニングによって統計が増加し、定式化によって予測される基準ペアサブセットによって異なることを示す。
関連論文リスト
- Generalized Score Matching for Parameter Estimation on Convex Domains [13.954816561132942]
一般化されたスコアマッチングの目的を$mathbbRd$の凸部分集合上で導出する。
非負のデータに対する古典的なスコアマッチングとドメイン適応型の変種が、提案フレームワーク内で自然に発生することを示す。
我々の導出は、様々な問題設定における一般化されたスコアマッチングのスコープと適用性に新たな光を当てる。
論文 参考訳(メタデータ) (2026-09-10T13:23:41Z) - MBD: A Model-Based Debiasing Framework Across User, Content, and Model Dimensions [50.00784452900918]
この課題に対処する一般モデルベースデバイアス(MBD)フレームワークを提案する。
任意のコホートに対するエンゲージメント分布の文脈平均と分散を明示的に推定する。
この統合により、フレームワークはバイアス付き生信号からバイアスなしの表現に変換することができる。
論文 参考訳(メタデータ) (2026-03-15T15:07:01Z) - Model Correlation Detection via Random Selection Probing [62.093777777813756]
既存の類似性に基づく手法では、モデルパラメータにアクセスしたり、しきい値なしでスコアを生成する必要がある。
本稿では,モデル相関検出を統計的テストとして定式化する仮説テストフレームワークであるランダム選択探索(RSP)を紹介する。
RSPは相関の証拠を定量化する厳密なp-値を生成する。
論文 参考訳(メタデータ) (2025-09-29T01:40:26Z) - Learning Parametric Distributions from Samples and Preferences [19.879505582147807]
選好に基づくM推定器は、サンプルのみのM推定器よりも分散性が高いことを示す。
我々は,$mathcalO (1/n)$ -- $Theta (1/sqrtn)$よりも大幅に改善された$mathcalO (1/n)$ -- の推定誤差スケーリングを実現する推定器を提案する。
論文 参考訳(メタデータ) (2025-05-29T15:33:43Z) - Model-free Methods for Event History Analysis and Efficient Adjustment (PhD Thesis) [55.2480439325792]
この論文は、モデルフリーの観点から統一された統計学への独立した貢献のシリーズである。
第1章では、機械学習から予測技術を活用する柔軟なメソッドを定式化するために、モデルフリーの視点をどのように利用できるか、詳しく説明している。
第2章では、あるプロセスの進化が他のプロセスに直接影響されるかどうかを記述した地域独立の概念を研究している。
論文 参考訳(メタデータ) (2025-02-11T19:24:09Z) - Robust Ordinal Regression for Subsets Comparisons with Interactions [2.6151761714896122]
本稿では,サブセット間の意思決定者の好みを学習するための厳密な順序付け手法を提案する。
Fishburn と LaValle から派生した決定モデルは、部分集合上の厳密な弱順序と互換性を持つほど一般である。
予測された嗜好が、すべての最も単純なモデル(オッカムのカミソリ)がその嗜好データに一致する場合、信頼できると考えられる。
論文 参考訳(メタデータ) (2023-08-07T07:54:33Z) - Score-based Continuous-time Discrete Diffusion Models [102.65769839899315]
連続時間マルコフ連鎖を介して逆過程が認知されるマルコフジャンププロセスを導入することにより、拡散モデルを離散変数に拡張する。
条件境界分布の単純なマッチングにより、偏りのない推定器が得られることを示す。
提案手法の有効性を,合成および実世界の音楽と画像のベンチマークで示す。
論文 参考訳(メタデータ) (2022-11-30T05:33:29Z) - Optimizing model-agnostic Random Subspace ensembles [5.680512932725364]
教師あり学習のためのモデルに依存しないアンサンブルアプローチを提案する。
提案手法は、ランダム部分空間アプローチのパラメトリックバージョンを用いてモデルのアンサンブルを学習することとを交互に行う。
シミュレーションおよび実世界のデータセット上で,予測と特徴ランキングの両面で,提案手法の優れた性能を示す。
論文 参考訳(メタデータ) (2021-09-07T13:58:23Z) - A Normative Model of Classifier Fusion [4.111899441919164]
新たに相関したディリクレ分布に基づく確率的分類融合の階層的ベイズモデルを提案する。
提案モデルでは,古典的な独立性オピニオンプールと他の独立性融合アルゴリズムを特殊ケースとして扱う。
合成および実世界のデータセット上での核融合の不確かさの低減と正しさによって評価される。
論文 参考訳(メタデータ) (2021-06-03T11:52:13Z) - Nonparametric Score Estimators [49.42469547970041]
未知分布によって生成されたサンプルの集合からスコアを推定することは確率モデルの推論と学習における基本的なタスクである。
正規化非パラメトリック回帰の枠組みの下で、これらの推定器の統一的なビューを提供する。
カールフリーカーネルと高速収束による計算効果を享受する反復正規化に基づくスコア推定器を提案する。
論文 参考訳(メタデータ) (2020-05-20T15:01:03Z) - Decision-Making with Auto-Encoding Variational Bayes [71.44735417472043]
変分分布とは異なる後部近似を用いて意思決定を行うことが示唆された。
これらの理論的な結果から,最適モデルに関するいくつかの近似的提案を学習することを提案する。
おもちゃの例に加えて,単細胞RNAシークエンシングのケーススタディも紹介する。
論文 参考訳(メタデータ) (2020-02-17T19:23:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。