論文の概要: Rater State Bias in RLHF Preference Data: An Audit Framework
- arxiv url: http://arxiv.org/abs/2607.16195v2
- Date: Wed, 22 Jul 2026 02:34:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.026213
- Title: Rater State Bias in RLHF Preference Data: An Audit Framework
- Title(参考訳): RLHF選好データにおけるラタステートバイアス:監査フレームワーク
- Authors: Elena Kopteva, Vitaliy Hlynianyi-Zhuk,
- Abstract要約: 人間のフィードバック(RLHF)からの強化学習における構造的欠点を同定する。
持続的なストレスや苦難の条件下では、レイカーの嗜好は時間とともに変化し、嗜好データが反応の質に関する判断とともにレーダ状態を符号化する。
本稿では,RLHFの選好データに有意かつ検証可能な構造バイアス源として,レーダ状態シフトを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We identify a structured confound in Reinforcement Learning from Human Feedback (RLHF). Pairwise preference labels are intended to reflect the compared outputs, but they may also reflect the rater's state during annotation. Under sustained stressful or distressing conditions, raters' preferences may shift over time, so that preference data encode rater state alongside judgments about response quality. We argue that, if present, such shifts would differ from ordinary disagreement or random label noise. They would be state dependent, could be shared across annotators under similar conditions, and would not necessarily cancel during aggregation, reward modeling, and policy optimization. We propose rater state shift as a plausible and testable source of structured bias in RLHF preference data. This paper develops a hypothesis and an audit framework for studying this source of bias. We define rater state shift, rater state confound, and correlated rater state bias. We also propose survival level emotional authenticity as a candidate output signature, defined by lexical, pragmatic, discourse, and safety features whose reliability and validity remain to be demonstrated. We analyze the conditions under which correlated rater state bias would not be averaged out during aggregation and could enter the learned reward signal. We state five predictions that distinguish this mechanism from generic engagement optimization, together with effect size thresholds for an initial audit, and note which require proprietary data. Finally, we present an audit protocol and pilot study plan that can be applied to publicly available instruction tuned models. We do not infer the training history of any specific deployed model.
- Abstract(参考訳): 我々は,RLHF(Reinforcement Learning from Human Feedback)における構造的コンファウンドを同定する。
ペアワイズな選好ラベルは比較した出力を反映することを目的としているが、アノテーション中のレーダの状態も反映している可能性がある。
持続的なストレスや苦難の条件下では、レイカーの嗜好は時間とともに変化し、嗜好データが反応の質に関する判断とともにレーダ状態を符号化する。
現状では、そのような変化は通常の不一致やランダムなラベルノイズと異なると論じる。
それらは状態依存であり、同様の条件下でアノテータ間で共有することができ、アグリゲーション、報酬モデリング、ポリシー最適化の間は必ずしもキャンセルされない。
本稿では,RLHFの選好データに有意かつ検証可能な構造バイアス源として,レーダ状態シフトを提案する。
本稿では,このバイアス源を研究するための仮説と監査フレームワークを開発する。
我々は、レーダ状態シフト、レーダ状態共有、相関レーダ状態バイアスを定義する。
また,信頼性と妥当性を実証する上で,語彙的,実践的,言説的,安全的特徴によって定義される出力署名候補としての生存レベルの感情的正当性も提案する。
相関レーダ状態の偏りがアグリゲーション中に平均化されず、学習した報奨信号に入力できる条件を解析した。
我々は、このメカニズムを一般的なエンゲージメント最適化と区別する5つの予測と、初期監査における効果サイズ閾値と、プロプライエタリなデータを必要とするノートとを述べる。
最後に,公開可能な指導調律モデルに適用可能な監査プロトコルとパイロット試験計画を提案する。
特定のデプロイモデルのトレーニング履歴を推測することはできません。
関連論文リスト
- A Formula-Driven Survey and Research Agenda for On-Policy Distillation [4.397842507533513]
本調査では,OPDを単一損失ファミリーではなく,フィードバックから更新までの問題として検討した。
我々は, 直接分布損失と政策段階の対数比更新という2つの経路から公式駆動型分類法を開発した。
論文 参考訳(メタデータ) (2026-06-22T03:09:21Z) - Is Fairness Truly Fair? Towards Reliable Lipschitz Fairness in Multi-Task Learning via Fixed-\texorpdfstring{$δ$}{delta} Alignment [0.32792728203318305]
リプシッツ様式の個人公正は、意味論的に類似した例が同様の予測を受けるべきだという考えを定式化する。
本稿では,各モデルの表現距離から監査耐性を導出した場合,異なるセマンティックしきい値の下で異なるアルゴリズムを比較する。
トレーニング時間制御正規化から評価時間固定値の監査を分離する信頼性対応フレームワークである textbfReLiF を提案する。
論文 参考訳(メタデータ) (2026-06-09T09:36:54Z) - Causal Imitation Learning Under Measurement Error and Distribution Shift [6.038778620145853]
ノイズ測定によってのみ、決定関連状態の一部が観察される場合、オフライン模倣学習(IL)について検討する。
本稿では,変数間の因果関係を明示的にモデル化することによって,測定誤差下でのILの一般的なフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-29T18:06:53Z) - DistDF: Time-Series Forecasting Needs Joint-Distribution Wasserstein Alignment [92.70019102733453]
トレーニング時系列予測モデルは、モデル予測の条件分布とラベルシーケンスの条件分布の整合性を必要とする。
本研究では,条件予測とラベル分布との差を最小限に抑えてアライメントを実現するDistDFを提案する。
論文 参考訳(メタデータ) (2025-10-28T16:09:59Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - COIN: Uncertainty-Guarding Selective Question Answering for Foundation Models with Provable Risk Guarantees [51.5976496056012]
COINは、統計的に有効な閾値を校正し、質問毎に1つの生成された回答をフィルタリングする不確実性保護選択フレームワークである。
COINはキャリブレーションセット上で経験的誤差率を推定し、信頼区間法を適用して真誤差率に高い確率上界を確立する。
リスク管理におけるCOINの堅牢性,許容回答を維持するための強いテストタイムパワー,キャリブレーションデータによる予測効率を実証する。
論文 参考訳(メタデータ) (2025-06-25T07:04:49Z) - Mitigating LLM Hallucinations via Conformal Abstention [70.83870602967625]
我々は,大言語モデルが一般ドメインでの応答をいつ無視すべきかを決定するための,原則化された手順を開発する。
我々は、幻覚率(エラー率)の厳密な理論的保証の恩恵を受けるため、共形予測手法を活用して、禁忌手順を開発する。
実験によって得られた共形禁忌法は, 種々の閉書, オープンドメイン生成質問応答データセットに, 幻覚率を確実に拘束する。
論文 参考訳(メタデータ) (2024-04-04T11:32:03Z) - When Does Confidence-Based Cascade Deferral Suffice? [69.28314307469381]
カスケードは、推論コストをサンプル毎に適応的に変化させる古典的な戦略である。
deferralルールは、シーケンス内の次の分類子を呼び出すか、または予測を終了するかを決定する。
カスケードの構造に執着しているにもかかわらず、信頼に基づく推論は実際は極めてうまく機能することが多い。
論文 参考訳(メタデータ) (2023-07-06T04:13:57Z) - Robust Fairness under Covariate Shift [11.151913007808927]
保護グループメンバーシップに関して公正な予測を行うことは、分類アルゴリズムの重要な要件となっている。
本稿では,ターゲット性能の面で最悪のケースに対して頑健な予測値を求める手法を提案する。
論文 参考訳(メタデータ) (2020-10-11T04:42:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。