論文の概要: Abstention as an Action Can Kill Both the Reward Gradient and the KL Anchor: Collapse Law and Repair for Error-Penalized Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2608.00301v1
- Date: Fri, 31 Jul 2026 21:31:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.568001
- Title: Abstention as an Action Can Kill Both the Reward Gradient and the KL Anchor: Collapse Law and Repair for Error-Penalized Reinforcement Learning
- Title(参考訳): 逆勾配とKLアンカーの両方を阻害する行動の欠如--崩壊法則と誤りによる強化学習の修復
- Abstract要約: 誤判定ルール(正解は+1ドル、誤答は$$、棄権は$0ドル)は幻覚に対してますます規定されている。
我々は、KL-anchored学習者が逆のことができることを証明した。
- 参考スコア(独自算出の注目度): 5.990509154718772
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Error-penalized scoring rules ($+1$ for a correct answer, $-λ$ for a wrong one, $0$ for abstaining) are increasingly prescribed against hallucination: a rational agent facing such a rule answers exactly when its correctness probability exceeds Chow's threshold $t^\ast=λ/(1+λ)$. We prove that a KL-anchored gradient learner can do the opposite. When abstention is a discrete action, the reward gradient and the anchor's restoring force are throttled by the same gate-saturation factor and die together: under explicit conditions (among them, blanket answering loses score in expectation and prompts share a bounded readout) the model drifts toward refusing everything, its mean training reward rising to zero like $1/t$ in training time $t$, so the curve reads as improvement while coverage collapses. The advantage estimator compounds the failure: in its sparse-answer regime, group normalization silently replaces every designed penalty with an effective penalty of one, moving the learned threshold from $t^\ast$ to $1/2$. The repair is structural: train a mandatory confidence report with a strictly proper score plus a correctness reward, and abstain only at deployment by thresholding the report. The always-emitted report has no gate to saturate, so no shared factor can kill its reward gradient and its anchor together, and its calibrated optimum is attracting. Simulations confirm every prediction, and experiments on language models at two scales confirm the mechanism live: the rule silences questions the models demonstrably still solve within ten optimizer steps, an ablation isolates the cause, and report-level training raises coverage, accuracy, and calibration together.
- Abstract(参考訳): 正しい答えに+1$、間違った答えに$-λ$、棄権に$0$)は幻覚に対してますます規定される:そのような規則に直面する有理的エージェントは、その正しさの確率がChowのしきい値である$t^\ast=λ/(1+λ)$を超えると、正確に答える。
我々は、KL-アンコール勾配学習者が逆のことができることを証明した。
降格が離散的なアクションである場合、報酬勾配とアンカーの回復力が同じゲート飽和因子によって妨げられ、一緒に死ぬ:明示的な条件(それらと共に、毛布の解答は期待値のスコアを失い、有界な読み出しを促す)の下で、モデルは全てを再利用する方向にドリフトし、平均トレーニング報酬はトレーニング時間$t$$$1/t$のようにゼロになるので、カバレッジが崩壊するにつれて、曲線は改善として読み込まれる。
群正規化は、設計済みのすべてのペナルティを1の効果的なペナルティに静かに置き換え、学習しきい値を$t^\ast$から$/2$に移動させる。
修正は構造的であり、厳格な適切なスコアと正当性報酬で必須の信頼性レポートをトレーニングし、レポートをしきい値にすることでデプロイメントのみを中断する。
常に消耗しているレポートには飽和するゲートがないため、共有要因が報酬勾配とアンカーを同時に破壊することができず、校正された最適度が惹きつけられている。
シミュレーションはすべての予測を確認し、2つのスケールでの言語モデルの実験は、このメカニズムが生きていくことを裏付ける: ルールは、明らかに10の最適化ステップでモデルがまだ解決しているという疑問を沈黙させ、アブレーションは原因を隔離し、レポートレベルのトレーニングはカバレッジ、正確性、キャリブレーションを一緒に上げる。
関連論文リスト
- Constrained Online Learning with Noisy Constraint Values [55.29259818039367]
一般的な実現可能性の下では、我々のLEDGERアルゴリズムは、期待される損失$O(sqrt T)と期待される予算違反$O(sqrtTlog(eT))を達成します。
スレーター条件、フィードバックチャネル間の独立性、絶対的制約値境界は不要である。
論文 参考訳(メタデータ) (2026-09-07T01:38:41Z) - Convex-Hull-Neighborhood Smooth Dual Generalization: Controlling Local Correction Propagation in Offline RL [7.803284875836737]
ブートストラップは オフライン強化学習における 推定誤差を増幅する
本稿では,ベルマンのバックアップをサンプル値のターゲットとして表現し,CHN局所補正を行うConvex Hull Neborhood Smooth Dual Generalizationを提案する。
Gym-MuJoCoとAntMazeの実験は、強力な集約性能と安定した値推定を示す。
論文 参考訳(メタデータ) (2026-08-04T04:30:02Z) - H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - Transferred QAOA Parameters Remember the Penalty Scale: A $λ$-Resonance Law for Constrained Quantum Optimization [0.0]
我々は、制約がペナルティとしてエンコードされるたびに転送を管理する新しい独立した軸を同定する。
任意の固定QAOA角において深さ$p$のとき、実現可能な部分空間上の確率$F()$が有限実三角質量であることを証明する。
この定理は、任意の整数対価 QUBO に対してどのように角度が得られたかとは無関係である。
論文 参考訳(メタデータ) (2026-07-10T19:23:41Z) - A Pre-Registered Causal Partition of Self-Consistency Elicitation and Reward Design in RLVR [1.2958054117511815]
報酬からの強化学習は、報酬信号が刺激的であっても推論を改善する。
実践者は一般的に、報酬-設計効果として naive = acc(TRUE) - acc(R) を解釈する。
我々はこの推定が体系的に偏っていることを証明している。
論文 参考訳(メタデータ) (2026-06-04T09:35:54Z) - The Extrapolation Cliff in On-Policy Distillation of Near-Deterministic Structured Outputs [52.709361620508595]
ListOPDは、パラメータの5分の1で8B-SFTベースラインで、学生をドメイン内に持ち込む。
Amazon Fashionでは、3つの事前登録テスト — 細粒度崖間隔テスト、小さなクリップのクロス予測 — がロックされた予測ウィンドウ内に落下し、グリッド解像度以下のクローズドフォーム予測に一致する小さなクリップ値が設定されている。
論文 参考訳(メタデータ) (2026-05-09T06:48:00Z) - MEMSAD: Gradient-Coupled Anomaly Detection for Memory Poisoning in Retrieval-Augmented Agents [0.0]
検索強化エージェントに対するメモリ中毒攻撃を,統合評価フレームワークを用いたStackelbergゲームとして定式化する。
ASR-R: 0.25〜1.00$) による攻撃成功度を4倍に向上させる。
私たちの主な貢献は、勾配結合に接地したキャリブレーションに基づく防御であるMEMSADである。
論文 参考訳(メタデータ) (2026-05-05T08:15:41Z) - Optimal Unconstrained Self-Distillation in Ridge Regression: Strict Improvements, Precise Asymptotics, and One-Shot Tuning [61.07540493350384]
自己蒸留(英: Self-distillation, SD)とは、教師自身の予測と地道の混合で学生を訓練する過程である。
任意の予測リスクに対して、各正規化レベルにおいて、最適に混合された学生がリッジ教師に改善されることが示される。
本稿では,グリッド探索やサンプル分割,再構成なしに$star$を推定する一貫したワンショットチューニング手法を提案する。
論文 参考訳(メタデータ) (2026-02-19T17:21:15Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Honesty over Accuracy: Trustworthy Language Models through Reinforced Hesitation [12.503662455234954]
現代の言語モデルでは、誤った回答が破滅的な結果をもたらす場合でも、自信ある幻覚が生じることを示す。
RLVR(Reinforceed Hesitation)は,2進法ではなく3進法を用いた強化学習(Reinforcement Learning from Verifiable Rewards, RLVR)の修正である。
論文 参考訳(メタデータ) (2025-11-14T17:20:45Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。