論文の概要: Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models
- arxiv url: http://arxiv.org/abs/2605.25189v1
- Date: Sun, 24 May 2026 17:34:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 19:50:18.954592
- Title: Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models
- Title(参考訳): 言語モデルの強化学習におけるディレクショナルアライメントによるリワードハックの軽減
- Authors: Wenlong Deng, Jiaji Huang, Kaan Ozkara, Yushu Li, Christos Thrampoulidis, Xiaoxiao Li, Youngsuk Park,
- Abstract要約: 逆ハックは、モデルが意図したタスクを解くのではなく、ショートカットを活用することでプロキシ報酬を改善するときに発生する。
このドリフトをパラメータ更新の独特な方向から解析し、報奨行動がクリーンランよりもはるかに大きな方向変化を示すことを示す。
- 参考スコア(独自算出の注目度): 59.427161616512855
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reward hacking arises when a model improves a proxy reward by exploiting shortcuts rather than solving the intended task. We study this failure mode through the geometry of reinforcement learning updates in language models and argue that hacking emerges when optimization drifts away from a stable low-dimensional learning trajectory. We analyze this drift through dominant singular directions of parameter updates and show that reward-hacking runs exhibit substantially larger directional change than clean runs. Motivated by this observation, we introduce trusted-direction projection, which constrains gradients to remain within a clean reference subspace. Across reward-hacking experiments on mathematical reasoning, the proposed approach delays shortcut exploitation and better preserves task performance.
- Abstract(参考訳): 逆ハックは、モデルが意図したタスクを解くのではなく、ショートカットを活用することでプロキシ報酬を改善するときに発生する。
言語モデルにおける強化学習更新の幾何学を用いて,この障害モードについて検討し,最適化が安定な低次元学習軌道から逸脱した時にハッキングが発生することを論じる。
このドリフトをパラメータ更新の独特な方向から解析し、報奨行動がクリーンランよりもはるかに大きな方向変化を示すことを示す。
この観察に動機づけられた信頼方向投影では、勾配がクリーンな参照部分空間内に留まることを制約する。
数学的推論に関する報奨ハック実験全体にわたって、提案手法はショートカットの実施を遅らせ、タスク性能を向上する。
関連論文リスト
- STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning [80.78140312980484]
我々はSTRIDEと呼ばれる言語駆動の段階的軌道リダイレクトを提案する。
我々は、結果に基づく報酬のみを使用して生成器と生成検証器を共同で訓練し、外部アノテーションを除去する。
様々な推論ベンチマークの実験では、STRIDEが最先端のベースラインを大幅に上回っていることが示されている。
論文 参考訳(メタデータ) (2026-05-13T11:04:31Z) - Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping [66.25536973294726]
テキスト・トゥ・イメージ(T2I)モデルのポストトレーニング手法はハッキングに報いる傾向がある。
SLAS(Super-Linear Advantage Shaping)は、地方政策の分野を再考する。
SLASは、DanceGRPOベースラインを複数のバックボーンとベンチマークで一貫して上回っている。
論文 参考訳(メタデータ) (2026-05-11T17:59:25Z) - When Reward Hacking Rebounds: Understanding and Mitigating It with Representation-Level Signals [11.280037154530847]
LLMの強化学習はハッキングに対して脆弱である。
本研究では,環境操作設定を用いたコーディング作業におけるこの現象について検討する。
本稿では,ショートカットのコンセプトスコアをGRPOの利点計算に統合したアドバンテージ修正を提案する。
論文 参考訳(メタデータ) (2026-04-01T23:33:08Z) - Rectifying Shortcut Behaviors in Preference-based Reward Learning [46.09046818725698]
強化学習では、好みに基づく報酬モデルが、大きな言語モデルと人間の協調行動の整合において中心的な役割を果たす。
最近の研究では、これらのモデルはハッキングに報いる傾向があり、過度な最適化のため、しばしばうまく一般化できないことが示されている。
我々は、好みに基づく報酬学習におけるショートカット行動を軽減するために、原則的だが柔軟なアプローチを導入する。
論文 参考訳(メタデータ) (2025-10-21T20:08:32Z) - Learning a Dense Reasoning Reward Model from Expert Demonstration via Inverse Reinforcement Learning [50.20267980386502]
我々は、専門家によるデモンストレーションから直接、プロセスの監督のための密集したトークンレベルの報酬モデルを学びます。
学習された推論報酬は、2つの補完的な役割を果たす: (i)訓練中の推論ポリシーを最適化するためのステップレベルのフィードバックを提供する。
論文 参考訳(メタデータ) (2025-10-02T09:55:26Z) - Mitigating Backdoor Attacks using Activation-Guided Model Editing [8.00994004466919]
バックドア攻撃は、機械学習モデルの完全性と信頼性を損なう。
本研究では,そのようなバックドア攻撃に対抗するために,機械学習による新たなバックドア緩和手法を提案する。
論文 参考訳(メタデータ) (2024-07-10T13:43:47Z) - Extrapolation for Large-batch Training in Deep Learning [72.61259487233214]
我々は、バリエーションのホストが、我々が提案する統一されたフレームワークでカバー可能であることを示す。
本稿では,この手法の収束性を証明し,ResNet,LSTM,Transformer上での経験的性能を厳格に評価する。
論文 参考訳(メタデータ) (2020-06-10T08:22:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。