論文の概要: Semantic Consistency Policy Optimization for Reinforcement Learning of LLM Agents
- arxiv url: http://arxiv.org/abs/2606.25852v1
- Date: Wed, 24 Jun 2026 14:02:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.353925
- Title: Semantic Consistency Policy Optimization for Reinforcement Learning of LLM Agents
- Title(参考訳): LLMエージェントの強化学習のための意味一貫性ポリシー最適化
- Abstract要約: グループベース強化学習は、軌道上の結果からステップレベルクレジットを導出することにより、長期的・疎逆的タスクの訓練後エージェントを効果的に活用する。
この矛盾は、競合する勾配を同様のアクションに送信し、失敗するロールアウト内の部分的に正しい進捗を無駄にする。
本稿では,この矛盾を緩和する価値のない報酬形成手法であるセマンティック一貫性ポリシー最適化(SCPO)を提案する。
SCPOは、失敗した各ステップを、成功した兄弟姉妹に対してスコアし、その兄弟姉妹に沿った新しい進歩に対してプラスのステップレベルクレジットを追加する。
- 参考スコア(独自算出の注目度): 45.62262776712415
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Group-based reinforcement learning effectively post-trains LLM agents for long-horizon, sparse-reward tasks by deriving step-level credit from trajectory outcomes. However, this ties a step's credit to its rollout's final outcome: semantically near-identical intermediate steps receive opposite credit depending on whether their trajectory eventually succeeded or failed. Such semantic credit inconsistency sends conflicting gradients to similar actions and wastes the partially-correct progress inside failed rollouts. Motivated by this, we propose Semantic Consistency Policy Optimization (SCPO), a value-free reward-shaping method that mitigates this inconsistency by recovering step-level credit from successful siblings in the same rollout group. Concretely, SCPO scores each failed step against a successful sibling and adds positive step-level credit for new progress along that sibling. On ALFWorld and WebShop, SCPO matches or exceeds strong group-based baselines, reaching 93.7+/-4.1 percent success on ALFWorld and 74.8+/-2.0 percent on WebShop at 1.5B parameters, with gains concentrated on the hardest multi-step tasks.
- Abstract(参考訳): グループベース強化学習は、軌道上の結果からステップレベルクレジットを導出することにより、長い水平、スパース・リワードタスクのためのLLMエージェントを効果的に後処理する。
しかし、これはロールアウトの最終結果にステップのクレジットを結び付けている:意味論的にほぼ同一の中間ステップは、彼らの軌道が最終的に成功したか失敗したかによって、反対のクレジットを受け取る。
このようなセマンティッククレジットの不整合は、類似のアクションに矛盾する勾配を送信し、ロールアウト失敗の内部で部分的に正しい進捗を無駄にする。
そこで我々は,この不整合を緩和する価値のない報酬形成手法であるセマンティック・コンシスタンス・ポリシー・最適化(SCPO)を提案する。
具体的には、SCPOは、失敗した各ステップを、成功した兄弟姉妹に対してスコアし、その兄弟姉妹に沿った新しい進歩に対してプラスのステップレベルクレジットを追加する。
ALFWorld と WebShop では、SCPO は強いグループベースのベースラインを破り、ALFWorld では93.7+/-4.1%、WebShop では 74.8+/-2.0 で1.5B のパラメータで成功し、最も難しいマルチステップタスクに集中している。
関連論文リスト
- PGPO: Potential-Guided Policy Optimization for Multi-Turn Agentic Tasks [41.82007055765541]
マルチターンエージェントタスクに対する潜在的誘導型ポリシー最適化を提案する。
各ロールアウトグループ内のアンカー状態群戻り統計から経験的状態ポテンシャルを推定する。
その後、隣接する状態間の潜在的な差異から行動上の利点を導き出し、軌道間クレジットの伝播を可能にする。
論文 参考訳(メタデータ) (2026-09-02T07:44:16Z) - MileGPO: Milestone Inference with Local Evidence for Graph-Based Policy Optimization of Long-Horizon LLM Agents [26.262385802144323]
プロセスレベルの信用を3つの設計を通じてグループ化されたオン・ポリティクス・ロールアウトから導き出すMileGPOを提案する。
MileGPOは補助モデルも追加の環境相互作用も必要としない。
論文 参考訳(メタデータ) (2026-08-20T08:58:27Z) - TRCA: Transition-wise Rubric Credit Assignment for Long-horizon LLM Agents [22.01777615106231]
Long-Horizon Large Language Model (LLM) エージェントは通常、スパース終端結果に最適化される。
本稿では、ステップレベルの監督を行動誘発遷移から直接引き出すトランジッションワイド・クレジット・アサインメントを提案する。
ALFWorld、WebShop、および7つの検索拡張された質問回答ベンチマークの実験は、評価されたベースラインよりも一貫した改善を示している。
論文 参考訳(メタデータ) (2026-08-17T06:19:12Z) - AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning [58.76655851910778]
AgentOPSDは、エージェント強化学習におけるターンレベルのクレジット割り当てのための、批判のない再帰的手法である。
ALFWorld, WebShop, Search-QA上のAgentOPSDを2つのスケールでQwen2.5モデルを用いて評価する(3B, 7B)。
論文 参考訳(メタデータ) (2026-08-06T13:00:59Z) - Hierarchical Advantage Weighting for Online RL Fine-Tuning of VLAs from Sparse Episode Outcomes [40.20394793623452]
事前トレーニングされたVLAポリシーがオンラインRLを介して微調整されると、各ロールアウトエピソードは単一のバイナリ結果のみを生成する。
階層的アドバンテージ・重み付き行動クローン (HABC) を提案する。
HABCは教師付き微調整(SFT)ベースラインを36%、44%、12%から92%、88%、38%で成功している。
論文 参考訳(メタデータ) (2026-06-15T17:57:14Z) - When Denser Credit Is Not Enough: Evidence-Calibrated Policy Optimization for Long-Horizon LLM Agent Training [8.367896852036699]
Evidence-Calibrated Policy Optimization (ECPO) は、ポリシー更新の前にステップレベルのクレジットを校正する、批判のないポリシー最適化アルゴリズムである。
ECPOは強いベースラインを一貫して上回り、Qwen2.5-1.5BでALFWorld/WebShopでGGPOを+5.2/+7.3成功点で改善した。
論文 参考訳(メタデータ) (2026-06-04T08:54:09Z) - StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning [6.365332042924078]
本稿では,ロールアウト後の自己蒸留フレームワークであるStepOPSDについて紹介する。
StepOPSDは、軌跡をアクション中心のステップセグメントに分解し、後見豊かな教師コンテキスト下でそれらを再構成する。
より小さい_clipは広範囲に安定化された局所信頼領域として作用するが、最適な大域混合強度_mixはタスク依存のままである。
論文 参考訳(メタデータ) (2026-05-26T15:07:03Z) - Milestone-Guided Policy Learning for Long-Horizon Language Agents [67.87164829944238]
我々は,長軸言語エージェントを訓練するためのマイルストーン誘導型政策学習フレームワークBEACONを紹介する。
ALFWorld、WebShop、ScienceWorldでは、BEACONはGRPOとGiGPOを一貫して上回っている。
これらの結果から,長期言語エージェントの訓練に有効なパラダイムとして,マイルストーン・アチョンド・クレジット・アサインが確立された。
論文 参考訳(メタデータ) (2026-05-07T12:00:40Z) - Truncated Step-Level Sampling with Process Rewards for Retrieval-Augmented Reasoning [32.295907409325615]
強化学習による検索エンジンの推論のための大規模言語モデルの訓練は、信用代行問題によって妨げられる。
2つの相補的なアイデアに基づいて構築されたフレームワークであるSLATEを提案する。
7つのQAベンチマークの実験では、SLATEがスパース・リワードとプロセス・リワードのベースラインを一貫して上回っていることが確認された。
論文 参考訳(メタデータ) (2026-02-26T19:05:40Z) - Verified Critical Step Optimization for LLM Agents [67.05296684575445]
クリティカルステップ最適化は、検証されたクリティカルステップに優先学習を集中する。
メソッドは、専門家のデモンストレーションではなく、失敗するポリシーの軌道から始まります。
GAIA-Text-103とXBench-DeepSearchの実験では、CSOはSFTベースラインよりも37%、相対的に26%改善している。
論文 参考訳(メタデータ) (2026-02-03T11:41:02Z) - ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking [84.07076200941474]
ArenaRLは、ポイントワイドスカラースコアからグループ内相対ランクにシフトする強化学習パラダイムである。
我々は,グループ内対角アリーナを構築し,安定した有利な信号を得るためのトーナメントベースのランキングスキームを考案する。
実験により、ArenaRLは標準のRLベースラインを大幅に上回っていることが示された。
論文 参考訳(メタデータ) (2026-01-10T08:43:07Z) - Agentic Reinforcement Learning with Implicit Step Rewards [92.26560379363492]
大規模言語モデル (LLMs) は強化学習 (agentic RL) を用いた自律的エージェントとして発展している。
我々は,標準RLアルゴリズムとシームレスに統合された一般的なクレジット割り当て戦略であるエージェントRL(iStar)について,暗黙的なステップ報酬を導入する。
我々は,WebShopとVisualSokobanを含む3つのエージェントベンチマークと,SOTOPIAにおける検証不可能な報酬とのオープンなソーシャルインタラクションについて評価した。
論文 参考訳(メタデータ) (2025-09-23T16:15:42Z) - Group-in-Group Policy Optimization for LLM Agent Training [17.243181792126563]
Group-in-Group Policy Optimization (GiGPO) は、LLMエージェントのきめ細かいクレジット割り当てを実現する新しいRLアルゴリズムである。
我々は, ALFWorld や WebShop などのエージェントベンチマークに対する GiGPO の評価と,検索強化されたQA タスクに対するツール統合推論を行った。
論文 参考訳(メタデータ) (2025-05-16T08:26:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。