論文の概要: Multimodal Reward Hacking in Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.09492v1
- Date: Fri, 10 Jul 2026 15:06:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.879149
- Title: Multimodal Reward Hacking in Reinforcement Learning
- Title(参考訳): 強化学習におけるマルチモーダル・リワードハッキング
- Abstract要約: 強化学習(RL)は多モーダル大言語モデル(MLLM)の整合化に益々用いられている。
安全VQA,チャートVQA,ストレステスト設定のMLLM RLにおける報酬ハッキングについて検討した。
本稿では,代行報酬が向上するサンプル間の障害を測定するNRFR(Newly Rewarded Failure Rate)を紹介する。
- 参考スコア(独自算出の注目度): 25.776239829876065
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning (RL) is increasingly used to align multimodal large language models (MLLMs), but higher rewards do not always imply better task performance. This risk is amplified when visual evidence is evaluated by text-only or weakly grounded rewards. We study reward hacking in MLLM RL across safety VQA, chart VQA, and stress-test settings, varying reward design, data ambiguity, model scale (2B-32B), and RL algorithm (GRPO, RLOO, DAPO). We introduce Newly Rewarded Failure Rate (NRFR), which measures failures among samples whose proxy reward improves over the SFT baseline. Outcome-only rewards cause severe hacking, reaching 48.1% Reward Hacking Rate (RHR), while NRFR exceeding RHR shows that RL creates new failures rather than merely inheriting them. Scaling reduces but does not eliminate hacking: even the 32B model retains a 54.9% worse rate under outcome-only rewards, whereas answer-aware rewards improve the oracle trend at every scale. Robustness is also algorithm- and scale-dependent: GRPO is consistently most resistant, RLOO remains vulnerable, and DAPO improves substantially from 2B to 8B. Visual-evidence rewards help only with reliable verification: keyword-based checks increase hacking, while VLM-as-judge semantic verification reduces it. Overall, multimodal reward hacking is a systematic result of optimizing imperfect rewards, and robust alignment requires rewards and verifiers that remain reliable under optimization pressure.
- Abstract(参考訳): 強化学習(RL)はマルチモーダルな大規模言語モデル(MLLM)の整合にますます使われているが、より高い報酬は必ずしもタスク性能を向上させるものではない。
このリスクは、視覚的証拠がテキストのみまたは弱い根拠の報酬によって評価されるときに増幅される。
安全VQA, チャートVQA, ストレステスト設定, 様々な報酬設計, データあいまいさ, モデルスケール(2B-32B), RLアルゴリズム(GRPO, RLOO, DAPO)について, MLLM RLの報酬ハッキングについて検討した。
本稿では,SFTベースラインを上回り,代用報酬が向上するサンプル間の故障を計測するNRFR(Newly Rewarded Failure Rate)を紹介する。
出力のみの報酬は深刻なハッキングを引き起こし、48.1%のReward Hacking Rate (RHR)に到達した。
32Bモデルでさえ、結果のみの報酬で54.9%の低下率を維持しているのに対し、回答対応の報酬はあらゆるスケールでオラクルの傾向を改善している。
GRPOは一貫して最も耐性があり、ROOは脆弱であり、DAPOは2Bから8Bに大幅に改善されている。
キーワードベースのチェックはハッキングを増加させ、VLM-as-judgeセマンティック検証はそれを減少させる。
全体として、マルチモーダル報酬ハッキングは不完全な報酬を最適化する体系的な結果であり、ロバストなアライメントには、最適化圧力の下で信頼できる報酬と検証が必要である。
関連論文リスト
- Two is better than one: A Collapse-free Multi-Reward RLIF Training Framework [6.490241400619907]
内部フィードバックからの強化学習は、スケーラブルで教師なしの代替手段として最近登場した。
本稿では,学習信号を2つの補完成分に分解するマルチリワードRLIFフレームワークを提案する。
提案手法は,外部の地平監督に頼らずに,安定した長距離推論を支援することができることを示す。
論文 参考訳(メタデータ) (2026-05-21T15:30:47Z) - Mitigating Reward Hacking in RLHF via Advantage Sign Robustness [40.66292181512935]
報酬のハッキングは、しばしば有利な兆候によって引き起こされると仮定する。
RMパラメータ空間の対向摂動を考慮することにより、認証符号保存半径を導出できる。
本稿では,ポリシグラデーション更新における非ロバスト補完の低重み付けであるSign-Certified Policy Optimization (SignCert-PO)を提案する。
論文 参考訳(メタデータ) (2026-04-03T11:45:16Z) - IR$^3$: Contrastive Inverse Reinforcement Learning for Interpretable Detection and Mitigation of Reward Hacking [67.20568716300272]
Reinforcement Learning from Human Feedback (RLHF)は強力なLDMアライメントを実現するが、報酬ハッキングを導入することができる。
IR3(Interpretable Reward Reconstruction and Rectification)は,RLHFモデルを用いた暗黙的目標をリバースエンジニアリングし,解釈し,外科的に修復するフレームワークである。
我々は、IR3が地道報酬と0.89の相関を達成し、90%以上の精度でハッキング機能を識別し、元のモデルの3%以内の機能を維持しながら、ハッキングの挙動を著しく低減することを示した。
論文 参考訳(メタデータ) (2026-02-23T01:14:53Z) - Reward Under Attack: Analyzing the Robustness and Hackability of Process Reward Models [68.45272703833209]
現状のPRMは、逆最適化圧力下で体系的に利用可能であることを示す。
これらの脆弱性を定量化するために、敵の圧力を増大させる3段階の診断フレームワークを導入する。
我々は、PRM-BiasBenchと診断ツールキットをリリースし、デプロイ前にロバストネスの評価を可能にする。
論文 参考訳(メタデータ) (2026-02-20T23:38:03Z) - Adversarial Reward Auditing for Active Detection and Mitigation of Reward Hacking [69.06218054848803]
本稿では,報酬ハッキングを動的かつ競争的なゲームとして再認識するフレームワークであるAdrial Reward Auditing(ARA)を提案する。
まず、ハッカーポリシーは報酬モデルの脆弱性を発見し、監査人は潜伏表現からのエクスプロイトを検出することを学習する。
ARAはすべてのベースラインの中で最高のアライメントユーティリティトレードオフを実現しています。
論文 参考訳(メタデータ) (2026-02-02T07:34:57Z) - From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation [52.62655622099456]
検証基準ベース報酬(RLVRR)を用いた強化学習を提案する。
最後の答えをチェックする代わりに、RLVRRは高品質な参照(すなわち報酬連鎖)から順序付けられた言語信号を抽出する。
このようにして、RLVRRは報酬を2つの次元に分解する。
論文 参考訳(メタデータ) (2026-01-26T14:39:58Z) - GDRO: Group-level Reward Post-training Suitable for Diffusion Models [55.948229011478304]
グループレベルの報酬は、モデルを目標とする報酬と整合させるのに成功します。
Group-level Direct Reward Optimization (GDRO)は、グループレベルの報酬アライメントのための新しいトレーニング後のパラダイムである。
GDROは完全なオフライントレーニングをサポートし、画像ロールアウトサンプリングの大幅なコスト削減を実現する。
これは拡散サンプラー非依存であり、取得性に対するODE-to-SDE近似の必要性を排除している。
論文 参考訳(メタデータ) (2026-01-05T11:47:18Z) - Information-Theoretic Reward Modeling for Stable RLHF: Detecting and Mitigating Reward Hacking [78.69179041551014]
本稿では,インフォメーション・ボトルネックの原理に基づく情報理論報酬モデリングフレームワークを提案する。
InfoRMは、報酬の一般化を緩和するために、嗜好に無関係な情報をフィルタリングする。
IBLは分散レベルの正規化であり、そのような偏差を罰し、最適化の展望を効果的に拡張する。
論文 参考訳(メタデータ) (2025-10-15T15:51:59Z) - Stabilizing Long-term Multi-turn Reinforcement Learning with Gated Rewards [13.70228195630989]
本稿では,マルチターンインタラクション,dockerベースの実行,カスタマイズ可能な報酬関数をサポートする統合システムであるSWE指向RLフレームワークを紹介する。
Gated Reward Accumulation (G-RA) も提案する。これは,高位(長期)の報酬が予め定義された閾値を満たす場合にのみ,即時報酬を蓄積する新しい手法である。
論文 参考訳(メタデータ) (2025-08-14T11:37:02Z) - Stop Summation: Min-Form Credit Assignment Is All Process Reward Model Needs for Reasoning [36.320502608626896]
プロセス報酬モデル(PRM)は、大規模言語モデル(LLM)のテストタイムスケーリングにおいて、困難な推論タスクにおいて有効であることが証明されている。
しかしながら、PRMによる報酬ハッキング問題は、強化微調整における彼らの成功を制限している。
本稿では,PRMによる報酬ハッキングの主な原因を,強化学習における正準和形信用代入として同定する。
論文 参考訳(メタデータ) (2025-04-21T17:59:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。