論文の概要: Measuring Reward Hacking and Reasoning-Answer Decoupling Under Position-Confounded Optimization
- arxiv url: http://arxiv.org/abs/2608.15445v1
- Date: Sat, 15 Aug 2026 23:13:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.301236
- Title: Measuring Reward Hacking and Reasoning-Answer Decoupling Under Position-Confounded Optimization
- Title(参考訳): 位置整合最適化の下での逆ハックとReasoning-Answer Decouplingの測定
- Authors: Suyash Maniyar, Armaan Sandhu, Abhishek Mishra,
- Abstract要約: 正解が常にオプションAである数学問題に対してGRPOを用いて言語モデルを訓練し、不偏解位置を持つ未知のテストセットで評価する。
Qwen2.5、Llama 3.x、Gemma-3のモデルでは、より小さなモデルではオプションAレートが0.90を超えている。
有能なモデルは、Aを選択しながら正しい数値解に到達した推論を生成する。
- 参考スコア(独自算出の注目度): 1.1316247605466565
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When a reward is correct on every training example yet consistent with more than one goal, a model can acquire an unintended one, a failure known as goal misgeneralization. Endpoint accuracy on the training distribution cannot tell the two apart, because solving the task and exploiting a surface feature can satisfy the reward equally well. We treat this as a measurement problem: what does a benchmark score measure once a model has been optimized against a correct but confounded signal? We train language models with GRPO on multiple-choice math problems where the correct answer is always option A, then evaluate on an unseen test set with unbiased answer positions. Across Qwen2.5, Llama 3.x and Gemma-3 models, biased training often drives option-A rates above 0.90 in smaller models and collapses unbiased accuracy toward chance, so accuracy stops measuring math ability and instead measures an answer-position policy. We further find reasoning-answer decoupling: capable models generate reasoning that reaches the correct numeric answer while still selecting A. We track this with numeric extraction and an LLM judge (GPT-4.1-mini; Qwen2.5-3B decoupling rate is about 0.66). The broken construct generalizes beyond the training domain: biased models inflate A-rates on out-of-domain MMLU and value-laden prompts. Continued training on unbiased data reverses the in-domain shift unevenly and only partially reverses the out-of-domain one, so a model can appear restored on its training distribution while remaining biased on unseen inputs. Reasoning-answer decoupling rate, together with answer distributions and out-of-domain behavior, separates capability loss from a learned, transferable shortcut.
- Abstract(参考訳): トレーニングの例で報酬が正しいが、1つ以上のゴールに一致しない場合、モデルは意図しないゴール、すなわちゴールの一般化と呼ばれる失敗を取得することができる。
トレーニング分布の終点精度は、タスクの解決と表面的特徴の活用が同様に報酬を満足できるため、両者を区別できない。
モデルが正しいが確立された信号に対して最適化されたとき、ベンチマークスコアは何を測るのか?
正解が常にオプションAである多重選択数問題に対してGRPOを用いて言語モデルを訓練し、不偏解位置を持つ未知のテストセットで評価する。
Qwen2.5、Llama 3.x、Gemma-3のモデルでは、バイアスドトレーニングは小さなモデルでは0.90以上のオプションAレートを駆動し、不偏の精度をチャンスに向けて崩壊させるため、精度は数学の能力を測定するのをやめ、代わりに解答ポリシーを測る。
我々は、これを数値抽出とLLMジャッジ(GPT-4.1-mini; Qwen2.5-3Bデカップリング率は約0.66)で追跡する。
バイアス付きモデルは、ドメイン外のMMLUとバリューラデンプロンプトにAレートをインフレさせます。
バイアスのないデータのトレーニングは、ドメイン内のシフトを不均一に反転させ、ドメイン外のシフトを部分的に反転させるだけである。
Reasoning-Answer Decoupling rateは、応答分布とドメイン外動作とともに、学習可能な転送可能なショートカットから能力損失を分離する。
関連論文リスト
- LLMs as a Jury: Cross-Model Consensus Can Outperform Process Reward Models for LLM Reasoning [6.241883798820154]
モデル間コンセンサス(モデル間コンセンサス)について検討し、独立に訓練されたモデル(各モデルが一度解ける程度)が最終解に一致するかを検討した。
パネルをLCM判定として扱い、合意の構造は、他のモデルのスコアではなく、検証信号である。
3つのパネル統計値から平均絶対誤差0.03$までのコンセンサス精度を予測する。
論文 参考訳(メタデータ) (2026-07-11T05:57:54Z) - Learning Shrinks the Hard Tail: Training-Dependent Inference Scaling in a Solvable Linear Model [2.7074235008521246]
ニューラルネットワークのスケーリング法則を最終層微細チューニングの解法モデルで解析する。
学習がエラー分布の「ハードテール」を小さくすることを示す。
論文 参考訳(メタデータ) (2026-01-07T10:00:17Z) - Answer-Consistent Chain-of-thought Reinforcement Learning For Multi-modal Large Langauge Models [33.398631680508814]
本稿では,GRPOアルゴリズムを補助的整合性チェックで修正するAnswer-Consistent Reinforcement Learningを提案する。
我々は、オリジナルとポストシャッフルの両方の回答が一致して正しい場合にのみ高い報酬を与える一貫性検証報酬を設計する。
我々は、ACREを挑戦的なビデオ推論ベンチマークとマルチモーダル数学推論ベンチマークで評価し、平均2.2%と1.5%の改善を達成した。
論文 参考訳(メタデータ) (2025-10-11T08:32:52Z) - Mitigating Spurious Correlations Between Question and Answer via Chain-of-Thought Correctness Perception Distillation [25.195244084313114]
CoPeD (Chain-of-Thought Correctness Perception Distillation) は,学生モデルの推論品質の向上を目的としている。
CoPeDは学生モデルに対して、正しい合理性に基づいて回答を予測し、誤ったときに修正するよう推奨する。
論文 参考訳(メタデータ) (2025-09-06T05:33:17Z) - Bias Fitting to Mitigate Length Bias of Reward Model in RLHF [81.44256822500257]
人間のフィードバックからの強化学習は、大きな言語モデルと人間の好みを合わせるための報酬モデルに依存している。
バイアスパターンを自律的に学習し,修正するフレームワークであるFiMi-RMを提案する。
実験により,FiMi-RMはよりバランスの取れた長さ逆分布を実現することが示された。
論文 参考訳(メタデータ) (2025-05-19T08:29:28Z) - Value-Distributional Model-Based Reinforcement Learning [59.758009422067]
政策の長期的業績に関する不確実性の定量化は、シーケンシャルな意思決定タスクを解決するために重要である。
モデルに基づくベイズ強化学習の観点から問題を考察する。
本稿では,値分布関数を学習するモデルに基づくアルゴリズムであるEpicemic Quantile-Regression(EQR)を提案する。
論文 参考訳(メタデータ) (2023-08-12T14:59:19Z) - Robust Outlier Rejection for 3D Registration with Variational Bayes [70.98659381852787]
我々は、ロバストアライメントのための新しい変分非局所ネットワークベース外乱除去フレームワークを開発した。
そこで本稿では, 投票に基づく不整合探索手法を提案し, 変換推定のための高品質な仮説的不整合をクラスタリングする。
論文 参考訳(メタデータ) (2023-04-04T03:48:56Z) - Consistent Diffusion Models: Mitigating Sampling Drift by Learning to be
Consistent [97.64313409741614]
本稿では, モデルが生成したデータ上での予測が時間とともに一定であることを示す, 両立性特性を強制することを提案する。
CIFAR-10の条件および非条件生成とAFHQとFFHQのベースライン改良について,本研究の新たな訓練目標が得られた。
論文 参考訳(メタデータ) (2023-02-17T18:45:04Z) - Selective Question Answering under Domain Shift [90.021577320085]
モデルがドメイン外の入力に対して過度に信頼されているため、モデルのソフトマックス確率のみに基づくアテンションポリシーは不適切である。
キャリブレータをトレーニングして、QAモデルがアースする入力を識別し、エラーを予測した場合に停止する。
提案手法は,80%の精度を維持しながら56%の質問に回答するが,それに対してモデルの確率を直接使用する場合,80%の精度で48%しか回答しない。
論文 参考訳(メタデータ) (2020-06-16T19:13:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。