論文の概要: Context-Grounding Gains Are Mediated by Pre-existing Machinery: Auditing GRPO, SFT, and DPO
- arxiv url: http://arxiv.org/abs/2609.00925v1
- Date: Tue, 01 Sep 2026 08:49:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.487054
- Title: Context-Grounding Gains Are Mediated by Pre-existing Machinery: Auditing GRPO, SFT, and DPO
- Title(参考訳): 既設機械による文脈移動利得の媒介:GRPO, SFT, DPOの検証
- Authors: Prakhar Gupta, Vaibhav Gupta,
- Abstract要約: GRPO, SFT, DPOにまたがる9つのトレーニング後腕を比較した。
5つの試験されたGRPOの変種のうち、グラウンドゲインは小さい。
Conflict-SFTとDPOは、主に開始モデルと同じ因果的注意セットを使用する。
- 参考スコア(独自算出の注目度): 8.407888369569324
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Language models can ignore prompt evidence when it conflicts with memorized knowledge. Post-training can make models follow such evidence more reliably, but it is unclear whether these gains require new machinery or strengthen machinery already present. We compare nine post-training arms spanning GRPO, SFT, and DPO from one starting checkpoint, with key comparisons extended across scales and families. We estimate a grounding direction from that checkpoint before training. Across five tested GRPO variants, grounding gains are small. For the two variants replicated across seeds, equivalence tests bound their effects below the conflict-SFT gain even as the rewarded metric improves. Conflict-SFT improves grounding moderately, while DPO drives grounding near ceiling on its matched distribution. Conflict-SFT and DPO largely use the same causal attention-head set as the starting model. Subtracting the starting-model direction suppresses both gains, while adding it to the starting model recovers 35% of DPO's gain at a dose passing all stated side-effect checks. After a supervised warm start makes the context answer appear in more rollouts, the same GRPO recipe adds essentially no further grounding gain. In our setting, grounding gains largely depend on machinery already present in the starting model.
- Abstract(参考訳): 言語モデルは、記憶された知識と矛盾する場合、プロンプトエビデンスを無視することができる。
ポストトレーニングでは、そのような証拠をより確実に追跡することができるが、これらが新しい機械を必要とするのか、既に存在する機械を強化する必要があるのかは不明だ。
GRPO, SFT, DPOにまたがる9つのトレーニング後腕を1つのスタートチェックポイントから比較し, 尺度および家族間で重要な比較を行った。
トレーニング前にそのチェックポイントから接地方向を推定する。
5つの試験されたGRPOの変種のうち、グラウンドゲインは小さい。
種子間で複製された2つの変種について、同値試験は、報酬されたメートル法が改善しても、コンフリクトSFTゲイン以下にその効果を束縛する。
Conflict-SFTはグラウンディングを適度に改善し、DPOはその一致した分布の天井付近でグラウンドングを駆動する。
Conflict-SFTとDPOは、主に開始モデルと同じ因果的注意セットを使用する。
開始モデル方向の減算は両方の利得を抑制する一方、開始モデルに加算すると、記述された副作用チェックを全て通過する線量でDPOの利得の35%を回復する。
監視されたウォームスタートがより多くのロールアウトでコンテキスト回答を表示させると、同じGRPOレシピは基本的にそれ以上のゲインを与えない。
我々の設定では、グラウンドゲインは、既に開始モデルに存在する機械に大きく依存する。
関連論文リスト
- OR Else: A Differentiable Trust Region for Policy Optimization [2.51067108081605]
我々は、スムーズな片側飽和ルールである出力リセット(OR)が、大規模言語モデルのポストトレーニングに有用な代替手段であるかどうかを問う。
PPO-Clip と PPO-OR をGAE で比較し,GRPO-OR とGRPO-OR をグループ相対的優位性で比較した。
論文 参考訳(メタデータ) (2026-07-20T17:07:40Z) - Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning [5.605622654870907]
ポストトレーニングは、言語モデルを有能な検索強化推論エージェントに変えるための主要なレシピとなっている。
そこで本稿では,バニラGRPOのみによる自己進化法である検索-E1を提案する。
Search-E1はQwen2.5-3Bで平均0.440EMに達し、両方のスケールですべてのオープンソースベースラインを超えた。
論文 参考訳(メタデータ) (2026-05-21T14:00:57Z) - Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing [79.88256756334327]
自己蒸留政策最適化(SDPO)は、より密集したロジットレベルの監視を提供することによってこの問題に対処する。
サンプル制御ポリシー最適化(SRPO)を提案する。
SRPOは、試料をGRPOの報酬整合強化に向け、サンプルをSDPOの目標ロジットレベルの補正に向ける。
論文 参考訳(メタデータ) (2026-04-02T17:29:18Z) - DyJR: Preserving Diversity in Reinforcement Learning with Verifiable Rewards via Dynamic Jensen-Shannon Replay [57.80564154223355]
既存のエクスペリエンスリプレイメソッドは、直接ポリシー更新のための正確なサンプルを再利用することで、この問題に対処する。
歴史的データは単に正確性を強化するのではなく、持続的な多様性を優先すべきである、と我々は主張する。
本稿では,シンプルで効果的な正規化フレームワークであるLEPJRを提案する。
論文 参考訳(メタデータ) (2026-03-17T06:20:56Z) - WS-GRPO: Weakly-Supervised Group-Relative Policy Optimization for Rollout-Efficient Reasoning [67.45237332694025]
グループ相対政策最適化は、複雑な推論に基づいて言語モデルを訓練するのに効果的である。
Weakly Supervised GRPOを提案し、端末報酬を正当性を考慮したガイダンスに変換することにより、ロールアウト効率を向上させる。
論文 参考訳(メタデータ) (2026-02-19T02:43:35Z) - Can GRPO Help LLMs Transcend Their Pretraining Origin? [42.200901132315636]
グループ相対政策最適化は、大規模言語モデル(LLM)の推論能力を高めるための主要なアプローチである
広く採用されているにもかかわらず、GRPOの利益はしばしば矛盾している。
GRPOはどの条件で推論を改善し、アウト・オブ・ディストリビューション(OOD)を一般化するのか?
まず、GRPOは基本モデルの分布に縛られ、完全に新しい解を見つけることができない保守的な再重み付けスキームであることを理論的に証明する。
論文 参考訳(メタデータ) (2025-10-14T00:37:52Z) - Rewarding the Unlikely: Lifting GRPO Beyond Distribution Sharpening [36.81125165911328]
強化学習は、言語モデルの推論能力を改善する主要な要因として現れています。
本稿では,現在の強化学習アルゴリズムが,すでに解いている問題に関するベースモデルの分布を単に研ぎ澄ましているだけかどうかを考察する。
差分報酬はランクバイアスを緩和し、合成定理と実定理の両方の証明設定において、多種多様な$N$でpass@N$を改善することを示す。
論文 参考訳(メタデータ) (2025-06-03T01:15:15Z) - A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce [68.99924691391048]
我々はGRPOを強化的なアルゴリズムの観点から再検討し、そのコアコンポーネントを分析する。
単純な拒絶サンプリングベースラインであるRAFTは,GRPOやPPOよりも競争性能が高いことがわかった。
この知見に触発されて、完全に正しくないサンプルと完全に正しいサンプルの両方をフィルタリングするポリシー勾配の最小限の拡張であるReinforce-Rejを提案する。
論文 参考訳(メタデータ) (2025-04-15T16:15:02Z) - Improved Diffusion-based Generative Model with Better Adversarial Robustness [65.38540020916432]
拡散確率モデル(DPM)は、生成タスクにおいて大きな成功を収めた。
デノナイジングプロセスでは、入力データ分布はトレーニングと推論の段階によって異なる。
論文 参考訳(メタデータ) (2025-02-24T12:29:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。