論文の概要: What do Reward Models Memorize?
- arxiv url: http://arxiv.org/abs/2607.24484v1
- Date: Mon, 27 Jul 2026 14:20:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.46572
- Title: What do Reward Models Memorize?
- Title(参考訳): リワードモデルは何を記憶しますか?
- Authors: Ivo Verhoeven, Pushkar Mishra, Ekaterina Shutova,
- Abstract要約: 差別的に訓練された報酬モデル (RM) は、記憶を簡単かつ高い利幅の選好ペアに誤割り当てすることを示した。
また、RMは、目に見えない選好ペアと対向するときに、人間の嗜好の単純な相関関係を過度に一般化することを示した。
- 参考スコア(独自算出の注目度): 16.581487607358238
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This paper studies what discriminatively trained reward models (RMs) memorize by measuring counterfactual memorization on two human preference datasets. We show that RMs 1) misallocate memorization to easy, high margin preference pairs, 2) memorize dataset-specific shortcuts (e.g., model identity, user sampling strategy), and 3) overgeneralize simple heuristic correlates of human preference (e.g., length, compliance) when confronted with unseen preference pairs. Overall, our findings indicate that discriminative training of RMs from human preference data results in biased RMs not yet capable of judging response quality in context-dependent scenarios.
- Abstract(参考訳): 本稿では,2つの人の嗜好データセットに対する反実的記憶を計測することにより,差別的に訓練された報酬モデル(RM)が記憶するものについて検討する。
RMは
1)暗記を簡単かつ高利得の選好対に誤配置する。
2)データセット固有のショートカット(例えば、モデルアイデンティティ、ユーザサンプリング戦略)を記憶し、
3) 好ましくない選好ペアと向き合う場合, 人間の嗜好(例えば, 長さ, コンプライアンス)の単純なヒューリスティックな相関関係を過度に一般化する。
以上の結果から,ヒトの嗜好データからのRMの識別訓練は,文脈に依存したシナリオで応答品質を判断できない偏見のあるRMを生じさせることが示唆された。
関連論文リスト
- One Bias After Another: Mechanistic Reward Shaping and Persistent Biases in Language Reward Models [32.15734141265721]
リワードモデル(RM)は、言語モデルと人間の嗜好のオンラインアライメントに不可欠である。
最先端のRMを含む5つの高品質RMのバイアスを測定する。
本稿では, 急激な相関関係から生じる低複雑性バイアスを緩和するために, 簡単なポストホック介入を提案する。
論文 参考訳(メタデータ) (2026-02-06T00:11:37Z) - Reward Models Inherit Value Biases from Pretraining [4.004014851264611]
リワードモデル(RM)は、大きな言語モデルと人間の価値の整合の中心である。
RMは, 基本モデルの関数として, 多次元の人的価値に有意な差が認められた。
この研究は、事前訓練段階における安全と整合性の重要性を浮き彫りにしている。
論文 参考訳(メタデータ) (2026-01-28T18:40:29Z) - Off-Policy Corrected Reward Modeling for Reinforcement Learning from Human Feedback [52.1410307583181]
我々は、ヒューマンフィードバックからの強化学習を用いて、複雑な人間の嗜好に従うために言語モデル(LM)を訓練する。
トレーニングが進むにつれて、LMが生成する応答は、報酬モデル(RM)の応答にもはや似ていない。
新しいラベルやサンプルを必要とせず、重み付けによりRMを補正するオフポリティ補正リワードモデリングを提案する。
論文 参考訳(メタデータ) (2025-07-21T11:19:04Z) - Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment [35.80989342492335]
人間のフィードバックのノイズの多い好みは 報酬の一般化に繋がる
本研究の目的は,報酬モデルにおいて,騒音の嗜好が人間の嗜好とどのように異なるかを明らかにすることである。
我々は、堅牢な選好学習を実現するためのオンラインコラボレーション・リワード・モデリング・フレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-15T10:58:20Z) - CHARM: Calibrating Reward Models With Chatbot Arena Scores [31.599659350165354]
リワードモデル(RM)は、人間の好みのプロキシとして機能し、大きな言語モデルを調整することで、人間のフィードバックからの強化学習において重要な役割を果たす。
我々は、RMにおけるモデル優先バイアスを特定し、特定のポリシーモデルからの応答に不均等に高いスコアを体系的に割り当てる。
この問題に対処するために,アリーナリーダーボードからのエロスコアを利用したCHARM(Chaatbot Arena Reward Modeling)というキャリブレーション手法を提案する。
論文 参考訳(メタデータ) (2025-04-14T09:51:09Z) - Assessing Judging Bias in Large Reasoning Models: An Empirical Study [99.86300466350013]
DeepSeek-R1やOpenAI-o1のような大きな推論モデル(LRM)は、顕著な推論能力を示している。
本稿では、主観的嗜好アライメントデータセットと客観的事実ベースデータセットの両方において、LLMとLRMの偏りを判定するベンチマークを示す。
論文 参考訳(メタデータ) (2025-04-14T07:14:27Z) - Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts [23.27203570485055]
人からのフィードバックから強化学習(RLHF)が,大規模言語モデルと人間の嗜好を整合させる主要な手法として登場した。
多次元絶対値データを用いて報酬モデル(RM)を訓練するための2段階の手法を提案する。
我々は、Llama-3 8BでArmoRMを効率よく訓練し、ArmoRMの上部の浅い部分からなるゲーティングネットワークを構築した。
論文 参考訳(メタデータ) (2024-06-18T17:58:28Z) - Exploring Memorization in Fine-tuned Language Models [53.52403444655213]
我々は,タスク間の微調整中に,言語モデルの暗記を探索する最初の包括的分析を行う。
オープンソースと、さまざまなタスクにまたがる独自の微調整LMによる研究は、暗記が様々な微調整タスクの間に強い相違を示すことを示している。
本稿では,この課題の相違をスパース符号化理論を用いて直感的に説明し,暗記と注目スコア分布との強い相関関係を明らかにする。
論文 参考訳(メタデータ) (2023-10-10T15:41:26Z) - Towards Differential Relational Privacy and its use in Question
Answering [109.4452196071872]
データセット内のエンティティ間の関係の記憶は、トレーニングされた質問応答モデルを使用する場合、プライバシの問題につながる可能性がある。
我々はこの現象を定量化し、微分プライバシー(DPRP)の定義を可能にする。
質問回答のための大規模モデルを用いた実験において,概念を解説する。
論文 参考訳(メタデータ) (2022-03-30T22:59:24Z) - Quantifying Memorization Across Neural Language Models [61.58529162310382]
大規模言語モデル(LM)は、トレーニングデータの一部を記憶するために示され、適切に誘導されると、記憶されたデータを冗長に出力する。
これは、暗記がプライバシーを侵害し(ユーザーデータをエクスポーティングする)、実用性を低下させ(繰り返し覚えやすいテキストは、しばしば品質が低い)、公平性を損なうため、望ましくない。
本稿では、LMが記憶されたトレーニングデータを出力する度合いを定量化する3つの対数線形関係について述べる。
論文 参考訳(メタデータ) (2022-02-15T18:48:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。