論文の概要: LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking
- arxiv url: http://arxiv.org/abs/2604.15149v1
- Date: Thu, 16 Apr 2026 15:30:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-17 21:29:31.98348
- Title: LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking
- Title(参考訳): LLMのゲーム検証:RLVRはハッキングに繋がる
- Authors: Lukas Helff, Quentin Delfosse, David Steinmann, Ruben Härle, Hikaru Shindo, Patrick Schramowski, Wolfgang Stammer, Kristian Kersting, Felix Friedrich,
- Abstract要約: モデルが論理規則を導出し出力しなければならない帰納的推論タスクについて検討する。
RLVRで訓練されたモデルは規則誘導を体系的に放棄する。
この行動は理解の失敗ではなく、報酬ハックの一形態であることを示す。
- 参考スコア(独自算出の注目度): 43.633688879582714
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As reinforcement Learning with Verifiable Rewards (RLVR) has become the dominant paradigm for scaling reasoning capabilities in LLMs, a new failure mode emerges: LLMs gaming verifiers. We study this phenomenon on inductive reasoning tasks, where models must induce and output logical rules. We find that RLVR-trained models systematically abandon rule induction. Instead of learning generalizable patterns (e.g., ``trains carrying red cars go east''), they enumerate instance-level labels, producing outputs that pass verifiers without capturing the relational patterns required by the task. We show that this behavior is not a failure of understanding but a form of reward hacking: imperfect verifiers that check only extensional correctness admit false positives. To detect such shortcuts, we introduce Isomorphic Perturbation Testing (IPT), which evaluates a single model output under both extensional and isomorphic verification, where the latter enforces invariance under logically isomorphic tasks. While genuine rule induction remains invariant, shortcut strategies fail. We find that shortcut behavior is specific to RLVR-trained reasoning models (e.g., GPT-5, Olmo3) and absent in non-RLVR models (e.g., GPT-4o, GPT-4.5, Ministral). Moreover, shortcut prevalence increases with task complexity and inference-time compute. In controlled training experiments, extensional verification directly induces shortcut strategies, while isomorphic verification eliminates them. These results show that RLVR can incentivize reward hacking not only through overt manipulation but also by exploiting what the verifier fails to enforce.
- Abstract(参考訳): 強化学習と検証リワード(RLVR)がLLMの推論能力を拡張するための主要なパラダイムとなっているため、新しい障害モードが出現する。
モデルが論理規則を導出し出力する必要がある帰納的推論タスクにおいて、この現象を研究する。
RLVRで訓練されたモデルは規則誘導を体系的に放棄する。
一般化可能なパターンを学習する代わりに、インスタンスレベルのラベルを列挙し、タスクに必要なリレーショナルパターンをキャプチャせずに検証をパスする出力を生成します。
我々は、この行動は理解の失敗ではなく、報酬のハッキングの一形態であることを示す: 拡張正当性のみをチェックする不完全な検証者は偽陽性を認める。
このようなショートカットを検出するために、拡張的および同型検証の両方の下で単一のモデル出力を評価する等方摂動試験(IPT)を導入し、後者は論理的等方的タスクの下で不変性を強制する。
真のルール誘導は不変であるが、ショートカット戦略は失敗する。
ショートカット動作はRLVR学習推論モデル(例: GPT-5, Olmo3)に特有であり、RLVR以外のモデル(例: GPT-4o, GPT-4.5, Ministral)には存在しない。
さらに、タスクの複雑さと推論時間計算により、ショートカットの頻度が増加する。
制御された訓練実験では、拡張検証は直接ショートカット戦略を誘導するが、同型検証はそれらを排除する。
これらの結果から, RLVRは, オーバート操作だけでなく, 検証者が強制しないものを悪用することにより, 報酬のハッキングをインセンティブ化できることがわかった。
関連論文リスト
- When Reward Hacking Rebounds: Understanding and Mitigating It with Representation-Level Signals [11.280037154530847]
LLMの強化学習はハッキングに対して脆弱である。
本研究では,環境操作設定を用いたコーディング作業におけるこの現象について検討する。
本稿では,ショートカットのコンセプトスコアをGRPOの利点計算に統合したアドバンテージ修正を提案する。
論文 参考訳(メタデータ) (2026-04-01T23:33:08Z) - How Far Can Unsupervised RLVR Scale LLM Training? [57.44753418846446]
検証可能な報酬を伴う教師なし強化学習(URLVR)は、監督ボトルネックを越えてLLMトレーニングをスケールするための経路を提供する。
最近の研究は、モデル固有の信号を活用し、期待できる早期の利得を示しているが、その可能性と限界は未だ不明である。
我々は、URLVRメソッドを報酬源に基づく固有対外部に分類し、統一された理論的枠組みを確立する。
論文 参考訳(メタデータ) (2026-03-09T17:38:11Z) - From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation [52.62655622099456]
検証基準ベース報酬(RLVRR)を用いた強化学習を提案する。
最後の答えをチェックする代わりに、RLVRRは高品質な参照(すなわち報酬連鎖)から順序付けられた言語信号を抽出する。
このようにして、RLVRRは報酬を2つの次元に分解する。
論文 参考訳(メタデータ) (2026-01-26T14:39:58Z) - Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs [16.74831908818562]
最近の証拠は、Qwen 2.5のようなモデルは、急激な報酬や誤った報酬でも大きな利益を得られることを示している。
突発的なRLVRは、解答の難易度が低下し、プロンプト側コヒーレンスが低下する分岐を引き起こす。
我々はこのショートカットを容易にするアンカー・アダプタ回路を隠蔽した。
論文 参考訳(メタデータ) (2026-01-16T07:55:38Z) - Boosting Reasoning in Large Multimodal Models via Activation Replay [136.6522463570943]
RLVRは低エントロピーの活性化を予期せずシフトさせるが、高エントロピーの活性化は影響を受けないことを示す。
本稿では,学習後LMMのマルチモーダル推論を促進するトレーニングフリーアプローチであるActivation Replayを提案する。
論文 参考訳(メタデータ) (2025-11-25T06:31:57Z) - The Ends Justify the Thoughts: RL-Induced Motivated Reasoning in LLMs [2.583082967853897]
その結果,ほとんどのフロンティア推論モデルで動機付け推論が検出できることがわかった。
モデルが高度化するにつれて、モニターが検出することがますます困難になる可能性がある。
論文 参考訳(メタデータ) (2025-10-20T00:24:08Z) - The Surprising Effectiveness of Negative Reinforcement in LLM Reasoning [37.13807960501503]
検証可能な報酬を伴う強化学習(RLVR)は、言語モデル(LM)のトレーニングに有望なアプローチである
我々は学習信号を正しい応答の強化と正負の正負の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の
我々は、NSRが不正確な世代を抑え、確率質量を他の可算候補に向けて再分配することで、モデルの以前の信念に導かれることを示す。
論文 参考訳(メタデータ) (2025-06-02T06:10:54Z) - GTR: Guided Thought Reinforcement Prevents Thought Collapse in RL-based VLM Agent Training [62.536191233049614]
検証結果報酬(RLVR)を用いた強化学習は、大規模言語モデル(LLM)におけるチェーン・オブ・ソート(CoT)推論を効果的にスケールアップした。
本研究は、24点やALFWorldの具体化タスクなど、複雑なカードゲームに関する広範な実験を通じてこの問題を調査する。
報酬が行動結果にのみ基づく場合、RLはVLMにおけるCoT推論の動機付けに失敗し、代わりに思考崩壊と呼ばれる現象が生じる。
論文 参考訳(メタデータ) (2025-03-11T15:17:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。