論文の概要: A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism
- arxiv url: http://arxiv.org/abs/2607.12640v1
- Date: Tue, 14 Jul 2026 11:17:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.124162
- Title: A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism
- Title(参考訳): 小言語・視覚言語モデルWebエージェントにおけるGRPOの学習段階的失敗:制御されたNullとそのメカニズム
- Authors: Chengguang Gan, Zhixi Cai, Yunhao Liang, Hanjun Wei, Shiwen Ni, Qinghao Zhang,
- Abstract要約: 検証可能な報酬を伴う強化学習は、より強力なエージェントを生み出すことを期待して、監督されたチェックポイントで日常的に実行される。
4Bから8Bのスケールで、小さな言語とビジョン言語モデルWebエージェントにスキルを追加するかどうかを問う。
エージェントがほとんどマスターしたタスクに対して、強力な教師付きベースラインの成功率を確実に改善する構成は存在しない。
- 参考スコア(独自算出の注目度): 11.543353599329675
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning with verifiable rewards, and Group Relative Policy Optimization (GRPO) in particular, is now run routinely on a supervised checkpoint in the hope of producing a stronger agent. We ask whether it adds skill to a small language and vision-language model web agent at the 4B to 8B scale, or whether it mostly reshapes behavior the supervised model already has. Across a control grid of 18 runs that varies learning rate, KL weight, seed, initialization, and clipping, no configuration credibly improves the success rate of a strong supervised baseline on tasks the agent has largely mastered. On the text track, moderate to high learning rates make it credibly worse. The null holds under paired testing, 25 evaluation seeds, 6 training seeds, changes to the recipe, both text and Set-of-Marks screenshot observations, and scaling the backbone to 8B; the credible harm is a text-track finding and is only nominal under Set-of-Marks. To show that the null reflects the setting and not a broken pipeline, we run the identical harness, reward, and recipe on tasks whose reward is reachable by sampling, and there the success rate rises by 22 points with a paired interval that excludes zero. GRPO therefore helps only when there is headroom to climb, meaning the sampled policy already succeeds more often than the greedy one. We then explain the failure. A middle learning rate degrades the agent and a high one collapses it, and the two regimes form a double dissociation: grafting localizes the degrade regime to the attention and MLP blocks, while the collapse regime cannot be traced to any single group, and the embedding change that dominates the weight movement is causally inert. At 4B, effective rank in the late layers tracks capability in both directions; at 8B the two come apart. This coupling is specific to the smaller model, so we report it as scale-dependent.
- Abstract(参考訳): 検証可能な報酬を伴う強化学習と、特にグループ相対政策最適化(GRPO)は、より強力なエージェントを生み出すために、監督されたチェックポイントで日常的に実行される。
4Bから8Bのスケールで、小さな言語と視覚言語モデルWebエージェントにスキルを追加するのか、あるいは、教師付きモデルがすでに持っている振る舞いをほとんど再認識しているかを問う。
学習率、KL重量、シード、初期化、クリッピングの異なる18回の制御グリッドを横切ると、エージェントがほとんどマスターしたタスクに対する強力な教師付きベースラインの成功率を確実に改善する構成は存在しない。
テキストトラックでは、中程度から高い学習率が、それを信じられないほど悪くする。
nullはペアテスト、25の評価シード、6つのトレーニングシード、レシピの変更、テキストとSet-of-Marksのスクリーンショットの観察、バックボーンを8Bにスケーリングする。
ヌルがパイプラインを壊さずに設定を反映していることを示すため、サンプリングによって報酬が到達可能なタスクに対して同じハーネス、報酬、レシピを実行し、0を除いたペア間隔で成功率が22ポイント上昇する。
したがってGRPOは、ヘッドルームがある場合にのみ有効であり、つまり、サンプリングされたポリシーは、グリーディーなポリシーよりもより頻繁に成功する。
そして、その失敗を説明します。
ミドルラーニングレートはエージェントを分解し、ハイレジームは崩壊し、2つのレジームは二重解離を形成する: 移植はデグレードレジームをアテンションとMLPブロックに局在させ、一方、崩壊レジームはどの単一グループにも追跡できず、重み移動を支配する埋め込み変化は因果的に不活性である。
4Bでは、後層の効果的なランクが両方の方向の能力を追跡し、8Bでは2つが分離する。
この結合はより小さなモデルに特化しており、スケール依存であると報告します。
関連論文リスト
- Amplitude-Only FFN Intervention for Tool-Structured LLM Inference Method: Gated Evaluation Protocol, and Cross-Model Empirical Results [10.526208975530054]
モデル重みをトレーニングせずに構造出力を改善するために,推定時フィードフォワードネットワーク(FFN)の介入について検討した。
増幅ゲーティング(Amplitude Gating, AG)は、未訓練のFFNの重量方向を保存し、生成時にのみ活性化の程度を調節する非破壊的な代替手段である。
これらの結果から,安全なFFNレベルの推論最適化のための最も信頼性の高い第1ターゲットとして,ツール構造推論が同定された。
論文 参考訳(メタデータ) (2026-07-13T07:28:55Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents [54.08846865906602]
ツール強化マルチモーダルサーチエージェントにおいて,クレジットミス割り当てをGRPOの系統的障害モードとして特徴付ける。
本稿では,情報取得ツールのパラメータ決定性を利用したツール・アウェア・ポリシー・オプティマイズ(TAPO)を提案する。
論文 参考訳(メタデータ) (2026-06-04T07:15:43Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL [10.399451281089318]
我々はMiniGridをコア評価として,MuJoCoを境界応力試験として用いたPPO訓練剤について検討した。
私たちの監査では、報酬の洪水とセマンティック/API誤解という、2つの主要なワンショット障害モードを見つけました。
本稿では,トレーニング診断と障害モード分類ガイドが報酬関数の修正を対象とする,診断駆動反復改善法を提案する。
論文 参考訳(メタデータ) (2026-05-27T17:57:43Z) - Revisiting DAgger in the Era of LLM-Agents [35.615579397673166]
ロングホライゾン LM エージェントはマルチターン相互作用から学習し、1つの早期誤りがその後の状態分布を変化させ、全軌道を脱線させる。
教師の微調整によって教師の監督が密集し、検証可能な報酬による強化学習は、この非政治的なミスマッチを避ける。
マルチターンLMエージェントのデータセットアグリゲーション(DAgger)を再検討することにより,このジレンマに対処する。
論文 参考訳(メタデータ) (2026-05-13T02:40:28Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。