論文の概要: Debiasing Reward Models via Causally Motivated Inference-Time Intervention
- arxiv url: http://arxiv.org/abs/2604.27495v1
- Date: Thu, 30 Apr 2026 06:49:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-01 16:31:53.959851
- Title: Debiasing Reward Models via Causally Motivated Inference-Time Intervention
- Title(参考訳): 因果的動機付け-時間干渉による逆流モデルのデバイアス化
- Authors: Kazutoshi Shinoda, Kosuke Nishida, Kyosuke Nishida,
- Abstract要約: リワードモデル(RM)は、大きな言語モデルと人間の嗜好の整合において中心的な役割を果たす。
本研究では, RMの複数種類のバイアスを推論時に緩和するための因果的動機付け介入を提案する。
- 参考スコア(独自算出の注目度): 16.571157391857522
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reward models (RMs) play a central role in aligning large language models (LLMs) with human preferences. However, RMs are often sensitive to spurious features such as response length. Existing inference-time approaches for mitigating these biases typically focus exclusively on response length, resulting in performance trade-offs. In this paper, we propose causally motivated intervention for mitigating multiple types of biases in RMs at inference time. Our method first identifies neurons whose activations are strongly correlated with predefined bias attributes, and applies neuron-level intervention that suppresses these signals. We evaluate our method on RM benchmarks and observe reductions in sensitivity to spurious features across diverse bias types, without inducing performance trade-offs. Moreover, when used for preference annotation, small RMs (2B and 7B) with our method, which edits less than 2% of all the neurons in RMs, enable LLMs to improve alignment, achieving performance comparable to that of a state-of-the-art 70B RM on AlpacaEval and MT-Bench. Further analysis reveals that bias signals are primarily encoded by neurons in early layers, shedding light on the internal mechanisms of bias exploitation in RMs.
- Abstract(参考訳): リワードモデル(RM)は、大きな言語モデル(LLM)と人間の嗜好の整合において中心的な役割を果たす。
しかし、RMは応答長などの刺激的な特徴に敏感であることが多い。
これらのバイアスを緩和するための既存の推論時アプローチは、通常、応答長にのみ焦点を合わせ、パフォーマンスのトレードオフをもたらす。
本稿では,RMの複数種類のバイアスを推論時に緩和するための因果的動機付け手法を提案する。
本手法は、まず、活性化が予め定義されたバイアス特性と強く相関しているニューロンを特定し、これらのシグナルを抑圧するニューロンレベルの介入を適用する。
本手法をRMベンチマーク上で評価し,性能トレードオフを生じさせることなく,様々なバイアスタイプにまたがる刺激特性に対する感度低下を観察する。
さらに、好みアノテーションに使用する場合、RMの全ニューロンの2%未満を編集する小さなRM (2B, 7B) は、ALpacaEval および MT-Bench 上の最先端70B RM に匹敵する性能を達成し、LLM をアライメントを改善することができる。
さらなる分析により、バイアス信号は主に初期の階層のニューロンによってコードされ、RMの内部のバイアス利用のメカニズムに光を当てていることが明らかとなった。
関連論文リスト
- SteerRM: Debiasing Reward Models via Sparse Autoencoders [28.922614335072414]
SteerRMは、Sparse Autoencoder(SAE)ベースの介入を使用して報酬モデルのバイアスを軽減するための、最初のトレーニング不要な方法である。
RM-Benchの6つの報酬モデルの中で、SteerRMはハードスプリットの精度を平均7.3ポイント改善し、全体的な性能を維持している。
論文 参考訳(メタデータ) (2026-03-13T08:55:36Z) - GPrune-LLM: Generalization-Aware Structured Pruning for Large Language Models [17.33640761554548]
一般化型構造化プルーニングフレームワークであるGPrune-LLMを提案する。
まず、ニューロンを行動整合モジュールに分割し、ランキング競争をローカライズする。
アクティベーションベースのスコアリングが信頼できないモジュールに対しては、アクティベーション非依存メトリックに切り替える。
論文 参考訳(メタデータ) (2026-03-12T19:20:37Z) - One Bias After Another: Mechanistic Reward Shaping and Persistent Biases in Language Reward Models [32.15734141265721]
リワードモデル(RM)は、言語モデルと人間の嗜好のオンラインアライメントに不可欠である。
最先端のRMを含む5つの高品質RMのバイアスを測定する。
本稿では, 急激な相関関係から生じる低複雑性バイアスを緩和するために, 簡単なポストホック介入を提案する。
論文 参考訳(メタデータ) (2026-02-06T00:11:37Z) - Identifying and Transferring Reasoning-Critical Neurons: Improving LLM Inference Reliability via Activation Steering [50.63386303357225]
本稿では,ニューロンの活性化に選択的に介入することで推論信頼性を向上させる軽量なテストタイムフレームワークであるAdaRASを提案する。
AdaRASは、極性を意識した平均差基準を介してReasoning-Critical Neurons(RCN)を特定し、推論中にアクティベーションを適応的に制御する。
10の数学およびコーディングベンチマークの実験では、AIME-24とAIME-25の13%以上のゲインを含む一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-01-27T17:53:01Z) - Eliminating Inductive Bias in Reward Models with Information-Theoretic Guidance [46.71732887299883]
リワードモデル(RM)は、人間のフィードバック(RLHF)からの強化学習において、大きな言語モデルと人間の価値の整合に不可欠である。
我々はtextbfRM (DIR) のための textbfInformation 最適化による textbfDebiasing と呼ばれる新しい情報理論的デバイアス手法を提案する。
情報理論の理論的正当化により、DIRは非線形相関でより洗練されたバイアスを処理できる。
論文 参考訳(メタデータ) (2025-12-29T13:39:41Z) - SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models [53.19726629537694]
ビデオ生成モデルと人間の好みのトレーニング後のアライメントは、重要な目標である。
現在のデータ収集パラダイムは、プロンプト内のペアワイズアノテーションに依存しており、ノイズのラベル付けに悩まされている。
ビデオRMトレーニングのための体系的フレームワークであるSoliRewardを提案する。
論文 参考訳(メタデータ) (2025-12-17T14:28:23Z) - Detecting and Pruning Prominent but Detrimental Neurons in Large Language Models [68.57424628540907]
大規模言語モデル(LLM)は、しばしば特定のデータセットに特化した学習メカニズムを開発する。
本稿では,データセット固有のメカニズムに関連するニューロンの同定と解析により,一般化の促進を目的とした微調整手法を提案する。
本手法では,各ニューロンの高信頼度予測への影響を定量化するため,データセット固有の性能に不均等に寄与するニューロンを同定する。
論文 参考訳(メタデータ) (2025-07-12T08:10:10Z) - Confronting Reward Model Overoptimization with Constrained RLHF [114.71591361764547]
成分RM間の相関がこれらの点の位置に有意な影響を及ぼすことを示す。
ラグランジュ乗算器によって自然に表現される動的重みを学習することで、成分RMの重み付けの問題に対処する。
論文 参考訳(メタデータ) (2023-10-06T16:59:17Z) - Toward Fair Facial Expression Recognition with Improved Distribution
Alignment [19.442685015494316]
本稿では,表情認識(FER)モデルにおけるバイアスを軽減する新しい手法を提案する。
本手法は、FERモデルによる埋め込みにおいて、性別、年齢、人種などの機密属性情報を低減することを目的としている。
ferモデルにおいて、魅力の概念を重要な感度属性として分析し、FERモデルがより魅力的な顔に対するバイアスを実際に示できることを実証する。
論文 参考訳(メタデータ) (2023-06-11T14:59:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。