論文の概要: SLCA-GRPO: Resolving Cross-Segment Credit Misattribution in Tool-Calling RL
- arxiv url: http://arxiv.org/abs/2609.29050v1
- Date: Thu, 24 Sep 2026 05:31:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.73724
- Title: SLCA-GRPO: Resolving Cross-Segment Credit Misattribution in Tool-Calling RL
- Title(参考訳): SLCA-GRPO:ツールカーリングRLにおけるクロスセグメントクレジットミストリビューションの解消
- Abstract要約: SLCA(Segment-Locked Credit Assignment)を組み込んだSLCA-GRPOを提案する。
SLCAはロールアウトの単一グループ内の構造セグメントレベルでの利点をデカップリングする。
ツールの冗長性とコストを低減して高い精度を実現する。
- 参考スコア(独自算出の注目度): 3.424504714391474
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Tool-calling agents produce heterogeneous outputs, interleaving structured tool invocations with user-facing natural language summaries. This output heterogeneity presents a structural failure mode in standard on-policy Reinforcement Learning (RL): algorithms like GRPO indiscriminately broadcast a homogeneous trajectory-level scalar advantage to all tokens. Consequently, gradient noise from summary generation leaks into tool-decision tokens, causing cross-segment credit misattribution and brittle optimization. In this work, we propose SLCA-GRPO, a framework incorporating Segment-Locked Credit Assignment (SLCA). To enable scalable exploration without costly real APIs and stable training, we first construct the Schema-Guided LLM Simulator (SGLS) as foundational training infrastructure. Building on this, SLCA decouples advantage estimation at the structural segment level within a single group of rollouts, without requiring additional rollouts from intermediate states. Supported by Hierarchical Rewards (HierR), SLCA routes execution advantages to tool tokens and preference advantages to summary tokens, eliminating advantage contamination (the dominant cross-segment credit misattribution channel) within each policy update. On a 7B backbone, SLCA-GRPO accelerates convergence and outperforms standard GRPO, ToolPO, and RLTR by +2.53 pp on in-domain evaluation, +1.36 pp on the Berkeley Function-Calling Leaderboard (BFCL), and +9.15 pp on $τ^2$-Bench under the same training budgets, achieving higher accuracy with reduced tool redundancy and costs.
- Abstract(参考訳): ツール呼び出しエージェントはヘテロジニアスな出力を生成し、構造化されたツール呼び出しとユーザ向きの自然言語要約をインターリーブする。
この出力ヘテロジニティは、標準的なオンライン強化学習(RL)における構造的障害モードを示し、GRPOのようなアルゴリズムは、全てのトークンに対して均質なトラジェクトリレベルのスカラーの利点を無差別にブロードキャストする。
その結果、要約生成からの勾配ノイズがツール決定トークンに漏れ、クロスセグメントクレジットの不寄与と不安定な最適化を引き起こす。
本稿では,Segment-Locked Credit Assignment (SLCA) を組み込んだフレームワークであるSLCA-GRPOを提案する。
そこで我々はまず,Schema-Guided LLM Simulator (SGLS) を基礎的なトレーニング基盤として構築する。
これに基づいて、SLCAは、中間状態からの追加のロールアウトを必要とせず、単一グループのロールアウトにおける構造セグメントレベルでの利点をデカップリングする。
Hierarchical Rewards (HierR) がサポートするSLCAは,ツールトークンに対する実行上のメリットと要約トークンに対する優先的なメリットをルートする。
7Bバックボーンでは、SLCA-GRPOがコンバージェンスを加速し、標準GRPO、ToolPO、RLTRを2.53pp、バークレー・ファンクション・カリング・リーダーボード(BFCL)+1.36pp、および+9.15ppの$τ^2$-Benchを同じトレーニング予算で高速化し、ツールの冗長性とコストを低減した。
関連論文リスト
- When Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPO [25.979415525596007]
検証可能な報酬(RLVR)を用いた強化学習
我々は、この挙動を多重性による構造レベルの信用集中として定式化する。
Cue-GRPOは補助モデル推論でこのルールをインスタンス化する。
論文 参考訳(メタデータ) (2026-08-04T11:02:26Z) - Signal Reshaping for GRPO in Weak-Feedback Agentic Code Repair [36.31472731207028]
このようなフィードバックの下で,標準GRPOの信号再構成について検討する。
完全な信号整形GRPOは、厳密なコンパイルとシーケンスの精度を改善する。
論文 参考訳(メタデータ) (2026-05-08T05:41:25Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical Reasoning [60.00161035836637]
グループ相対政策最適化は、推論タスクのための有望な批判のない強化学習パラダイムとして登場した。
我々は,各トークンがモデルの最終回答にどの程度影響するかに基づいて,利益を再分配する,きめ細かい信用割当機構であるOutcome-grounded Advantage Reshaping (OAR)を紹介した。
OAR-Gは計算オーバーヘッドを無視して同等のゲインを達成し、どちらも強力なGRPOベースラインをはるかに上回っている。
論文 参考訳(メタデータ) (2026-01-12T10:48:02Z) - On GRPO Collapse in Search-R1: The Lazy Likelihood-Displacement Death Spiral [59.14787085809595]
この障害を引き起こす中核的なメカニズムとしてLazy Likelihood Displacement(LLD)を同定する。
LDDは早期に出現し、自己強化性LDDデススパイラル(LDD Death Spiral)を引き起こす。
本稿では,GRPO のための軽量な確率保存正則化 LLDS を提案する。
論文 参考訳(メタデータ) (2025-12-03T19:41:15Z) - Principled RL for Diffusion LLMs Emerges from a Sequence-Level Perspective [85.06838178922791]
強化学習(RL)は自己回帰言語モデルに非常に効果的であることが証明されている。
しかし、これらの手法を拡散大言語モデル(dLLM)に適応させることは、根本的な課題を提起する。
本稿では,全シーケンス生成を単一アクションとして扱い,ELBOを抽出可能なシークエンスレベル確率プロキシとして利用する,原則的RLフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-03T13:05:32Z) - Group-in-Group Policy Optimization for LLM Agent Training [17.243181792126563]
Group-in-Group Policy Optimization (GiGPO) は、LLMエージェントのきめ細かいクレジット割り当てを実現する新しいRLアルゴリズムである。
我々は, ALFWorld や WebShop などのエージェントベンチマークに対する GiGPO の評価と,検索強化されたQA タスクに対するツール統合推論を行った。
論文 参考訳(メタデータ) (2025-05-16T08:26:59Z) - REBEL: Reinforcement Learning via Regressing Relative Rewards [59.68420022466047]
生成モデルの時代における最小限のRLアルゴリズムであるREBELを提案する。
理論的には、自然ポリシーグラディエントのような基本的なRLアルゴリズムはREBELの変種と見なすことができる。
我々はREBELが言語モデリングと画像生成に一貫したアプローチを提供し、PPOやDPOとより強くあるいは類似した性能を実現することを発見した。
論文 参考訳(メタデータ) (2024-04-25T17:20:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。