論文の概要: Patterning in Practice: Debiasing Reward Models with Susceptibilities
- arxiv url: http://arxiv.org/abs/2609.00699v1
- Date: Tue, 01 Sep 2026 04:20:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.298288
- Title: Patterning in Practice: Debiasing Reward Models with Susceptibilities
- Title(参考訳): 実践におけるパターニング - 知覚可能性による逆行モデルのデバイアス
- Authors: George Wang, Elizabeth Donoway, Daniel Murfet,
- Abstract要約: Instruct reward model training on Skywork-Reward-Preference v.0.2。
これは、小さなモデルや合成タスクを超えて、特異学習理論に基づくプログラムであるパターニングの最初の応用である。
- 参考スコア(独自算出の注目度): 2.095991286549444
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reward models trained on human preferences are known to suffer from length, formatting, and other stylistic biases. In this paper we use patterning, which reweights each preference pair according to its measured effect on posterior expectation values of benchmark losses (its susceptibility), to debias a Gemma 2 9B Instruct reward model trained on Skywork-Reward-Preference v0.2. We obtain $+14.2 \pm 1.2$ pp on RM-Bench Hard, the split where style cues point against correctness (mean $\pm$ s.e.\ over 5 seeds), with overall RM-Bench accuracy preserved, comparable to the strongest Hard-split gain reported by the closest published comparator (SteerRM, $+13.2$ pp). We demonstrate in a simple case that the reweighting is interpretable by tracing a side effect of the intervention (a regression on a safety subset of RM-Bench) to a small class of training pairs, which we confirm by ablation. The weights also transfer: those computed on Gemma 2 9B debias Gemma 2 2B and 27B with no recomputation, and transfer partially to Llama 3.1 8B. This is the first application of patterning, a program grounded in singular learning theory, beyond small models and synthetic tasks.
- Abstract(参考訳): 人間の好みに基づいて訓練されたリワードモデルは、長さ、フォーマッティング、その他のスタイルバイアスに悩まされていることが知られている。
本稿では,Skywork-Reward-Preference v0.2でトレーニングしたGemma 2 9Bインストラクション報酬モデルにおいて,ベンチマーク損失の後方期待値(感受性)に対する各選好ペアの重み付けを行う。
RM-Bench Hard上では,最も近いコンパレータ (SteerRM, $+13.2$ pp) で報告された最強のハード・スプリット・ゲイン (Hard-Split gain) に匹敵する,RM-Bench の正確さ(平均$$\pm$ s.e.\, 最大 5 以上のシード)に対して,スタイルクエスポイントの分割を行う。
簡単なケースでは、介入の副作用(RM-Benchの安全性サブセットの回帰)を少数のトレーニングペアに追跡することにより、再重み付けが解釈可能であることを証明し、アブレーションにより確認する。
Gemma 2 9B debias Gemma 2 2B と 27B で再計算せずに計算され、Llama 3.1 8B に部分的に転送される。
これは、小さなモデルや合成タスクを超えて、特異学習理論に基づくプログラムであるパターニングの最初の応用である。
関連論文リスト
- The Reward Was in Your Data All Along: Correcting Flow Matching with Discriminator-Guided RL [19.556118547263928]
識別器誘導RL(DRL)は、事前訓練された表現空間内のベースモデルサンプルからデータを分離するために識別器を訓練する。
ガイダンスのないFID(例:SiTで9.38ドルから2.62ドル)と意味空間FD(例:SiTでDINOv3で8.2ドルから19.3ドル)を減らす。
また、後続の嗜好ベースのポストトレーニングでは、好みの報酬とイメージの忠実度の間のフロンティアも向上する。
論文 参考訳(メタデータ) (2026-06-17T15:01:33Z) - Scaling Laws for Behavioral Foundation Models over User Event Sequences [2.924581427482972]
本稿では、共通の2部分の振る舞いモデルアーキテクチャ、特徴ベースのイベント埋め込み、デコーダのみの変換器について検討する。
約600回にわたって、実際のインタラクションデータで動作し、トレーニング用FLOPは1015ドルから1019ドルの範囲で、デプロイ関連軸が4つあります。
計算最適トレーニングは低計算時のテキストと比較してデータ量が多いが、計算量が増加するにつれて、そのD/N$比はチンチラに向かう。
論文 参考訳(メタデータ) (2026-06-03T15:59:25Z) - MARBLE: Multi-Aspect Reward Balance for Diffusion RL [71.6241143519038]
強化学習は、拡散モデルと人間の嗜好を整合させる主要なアプローチとなっている。
既存のプラクティスは、報酬ごとに1つのスペシャリストモデルをトレーニングすることで、複数の報酬を処理します。
我々は,各報酬に対する独立な優位推定器を維持する勾配空間最適化フレームワークMARBLEを提案する。
論文 参考訳(メタデータ) (2026-05-07T16:20:42Z) - Towards Reward Modeling for AI Tutors in Math Mistake Remediation [13.755739827287542]
重み付きサムランキングに基づいて訓練されたBradley-Terry選好モデルの開発とリリースを行う。
合成データのみを用いて、人間の嗜好テストにおいて最適なモデルが0.69対の精度に達する。
論文 参考訳(メタデータ) (2026-03-25T14:56:08Z) - Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling [49.41422138354821]
非負の因子分析をBradley-Terry選好モデルに統合する原理的報酬モデリングフレームワークを提案する。
BNRMは、スパースで非負の潜在因子生成過程を通じて報酬を表す。
BNRMは報酬の過度な最適化を著しく軽減し、分布シフトによるロバスト性を改善し、強いベースラインよりも解釈可能な報酬分解をもたらすことを示す。
論文 参考訳(メタデータ) (2026-02-11T08:14:11Z) - Scaling Reward Modeling without Human Supervision [52.10639750993359]
大規模ウェブコーパスから抽出した文書の接頭辞や接尾辞よりも好みの学習によって報酬ベースのスケーリングを運用する。
人間のアノテーションは使用していないが、数学に焦点を当てたWebデータの1100万トークンのトレーニングは、RewardBench v1とv2で安定したゲインを得る。
モデル全体では、RewardBench v2の精度は平均で+7.7ポイント向上し、ドメイン内の算術部分集合では+16.1まで向上する。
論文 参考訳(メタデータ) (2026-02-11T04:41:53Z) - Outcome-based Reinforcement Learning to Predict the Future [1.4313866885019229]
コンパクトな(14B)推論モデルは、o1のようなフロンティアモデルの予測精度に適合または超えるように訓練可能であることを示す。
ポリマーケットのトレーディングシミュレーションでは、その賭けが10%以上の投資のリターンをもたらすと見積もっている。
論文 参考訳(メタデータ) (2025-05-23T14:56:07Z) - Bias Fitting to Mitigate Length Bias of Reward Model in RLHF [81.44256822500257]
人間のフィードバックからの強化学習は、大きな言語モデルと人間の好みを合わせるための報酬モデルに依存している。
バイアスパターンを自律的に学習し,修正するフレームワークであるFiMi-RMを提案する。
実験により,FiMi-RMはよりバランスの取れた長さ逆分布を実現することが示された。
論文 参考訳(メタデータ) (2025-05-19T08:29:28Z) - Tangent Model Composition for Ensembling and Continual Fine-tuning [69.92177580782929]
タンジェントモデル合成(Tangent Model composition, TMC)は、事前訓練された点を中心に微調整されたコンポーネントモデルを独立に結合する手法である。
TMCの精度は4.2%向上し、非線形微調整モデルの精度は4.2%向上した。
論文 参考訳(メタデータ) (2023-07-16T17:45:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。