論文の概要: ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents
- arxiv url: http://arxiv.org/abs/2606.31392v1
- Date: Tue, 30 Jun 2026 09:19:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.164079
- Title: ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents
- Title(参考訳): ReGRPO: ツール利用エージェントのリフレクション強化ポリシー最適化
- Authors: Binjie Zhang, Mike Zheng Shou,
- Abstract要約: Supervised Fine-tuning (SFT) は主に軌道軌道上で構築されており、ツール故障後の回復のための信号はほとんど得られない。
ツール使用エージェントの反射誘導補正を学習するフレームワークであるReGRPOを紹介する。
GTAとGAIAの実験では、同じバックボーンとツールスイートの下で、ReGRPOは一貫して強力なオープンソースベースラインを上回っている。
- 参考スコア(独自算出の注目度): 52.531681772560724
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Tool-augmented vision-language models (VLMs) can solve multimodal, multi-step tasks by calling external tools, yet they remain fragile in practice. Existing works have two common gaps. Supervised fine-tuning (SFT) is built mostly on successful trajectories and offers little signal for recovery after tool failures, while sparse trajectory-level RL rewards provide limited guidance on which step failed and how to repair it. We introduce ReGRPO (Reflection-augmented Group Relative Policy Optimization), a framework that learns reflection-guided correction in tool-using agents. ReGRPO starts with a structured reflective data engine: we execute near-miss actions to collect grounded failure observations, then build Reflection-of-Thought triplets (ErrorType, Evidence, FixPlan) paired with corrected actions for warm-start SFT. We then optimize reflection tokens and corrective actions jointly within local trajectories using group-relative advantages, and include a reflection-cost term to reduce unnecessary reflection. Experiments on GTA and GAIA show that, under the same backbone and tool suite, ReGRPO consistently outperforms strong open-source baselines and achieves the best results among the compared open-source controllers. Code and RoT data are available at https://github.com/showlab/ReGRPO.
- Abstract(参考訳): ツール拡張視覚言語モデル(VLM)は、外部ツールを呼び出すことでマルチモーダルでマルチステップなタスクを解決できるが、実際には脆弱である。
現存する作品には2つの共通点がある。
Supervised Fine-tuning (SFT) は主に成功した軌道上に構築され、ツール故障後の回復のための信号はほとんど提供されないが、低軌道レベルのRL報酬はどのステップが失敗したか、どのように修復するかの限られたガイダンスを提供する。
ReGRPO(Reflection-augmented Group Relative Policy Optimization)は,ツール使用エージェントの反射誘導補正を学習するフレームワークである。
ReGRPOは構造化されたリフレクティブデータエンジンから始まります。我々は、地上の障害観測を収集するためにニアミスアクションを実行し、その後、ウォームスタートSFTのために修正されたアクションと組み合わせて、リフレクション・オブ・サート・トリガレット(ErrorType、Evidence、FixPlan)を構築します。
次に、グループ相対的優位性を用いて、局所軌道内における反射トークンと補正動作を協調的に最適化し、不必要な反射を減らすための反射コスト項を含む。
GTAとGAIAの実験によると、同じバックボーンとツールスイートの下で、ReGRPOは一貫して強力なオープンソースベースラインを上回り、比較したオープンソースコントローラの中で最高の結果を得る。
コードとRoTデータはhttps://github.com/showlab/ReGRPO.comで公開されている。
関連論文リスト
- Closing the Reflection Gap: A Free Calibration Bonus for Agentic RL [12.234169944475537]
RefGRPOは、標準的なRLアルゴリズムを2つの重要な要素で強化する、シンプルだが効果的な修正である。
エージェント自身の反射と実際の結果とを対比して計算した自由キャリブレーションボーナス。
結果の反射は、エージェントを環境フィードバックに基づく独自の検証器に変える。
論文 参考訳(メタデータ) (2026-06-12T07:47:15Z) - TopoCurate:Modeling Interaction Topology for Tool-Use Agent Training [53.93696896939915]
訓練用ツール使用エージェントは一般的に、パスレート選択されたタスクに対して、軌道変更の成功と強化学習(RL)に依存している。
TopoCurateは,同一タスクから多段階的なロールアウトを統一的な意味的商トポロジに投影する対話型フレームワークである。
TopoCurateは最先端のベースラインに対して4.2%(SFT)と6.9%(RL)という一貫したゲインを達成している。
論文 参考訳(メタデータ) (2026-03-02T10:38:54Z) - Empowering Multi-Turn Tool-Integrated Reasoning with Group Turn Policy Optimization [20.004150645050537]
Group Turn Policy Optimization (GTPO) は、多ターンツール統合推論タスクにおける大規模言語モデル(LLM)のトレーニング用に設計された、新しい強化学習アルゴリズムである。
GTPOは、各ターンに対してきめ細かいフィードバックを提供するターンレベルの報酬割り当て、リターンベースの利点推定、自己監督型報酬形成という3つの重要なイノベーションを導入している。
総合評価の結果、GTPOは様々な推論ベンチマークでGRPOを平均3.0%上回っていることがわかった。
論文 参考訳(メタデータ) (2025-11-18T19:01:16Z) - PROPA: Toward Process-level Optimization in Visual Reasoning via Reinforcement Learning [30.44007644340425]
本稿では,モンテカルロ木探索 (MCTS) とGRPOを統合した新しいフレームワーク PROPA について紹介する。
7つのベンチマークと4つのVLMバックボーンで、PROPAはSFTとRLVRベースのベースラインを一貫して上回っている。
ドメイン内タスクで最大17.0%、ドメイン外タスクで最大21.0%のゲインを達成する。
論文 参考訳(メタデータ) (2025-11-13T13:06:12Z) - Failure Makes the Agent Stronger: Enhancing Accuracy through Structured Reflection for Reliable Tool Interactions [10.598440138966028]
現在の自己回帰のプラクティスは、プロンプトや一方的な推論に依存しています。
提案する構造的リフレクションは, エラーから修復までの経路を明示的で制御可能な, 訓練可能な動作に変換する。
BFCL v3とTool-Reflection-Benchの実験では、マルチターンツールコールの成功とエラー回復、冗長呼び出しの削減が大幅に向上した。
論文 参考訳(メタデータ) (2025-09-23T09:35:49Z) - Agentic Reinforced Policy Optimization [66.96989268893932]
検証可能な報酬付き大規模強化学習(RLVR)は,大規模言語モデル(LLM)を単一ターン推論タスクに活用する効果を実証している。
現在のRLアルゴリズムは、モデル固有のロングホライゾン推論能力と、マルチターンツールインタラクションにおけるその習熟性のバランスが不十分である。
エージェント強化ポリシー最適化(ARPO: Agentic Reinforced Policy Optimization)は,マルチターンLDMエージェントを学習するためのエージェントRLアルゴリズムである。
論文 参考訳(メタデータ) (2025-07-26T07:53:11Z) - REBEL: Reinforcement Learning via Regressing Relative Rewards [59.68420022466047]
生成モデルの時代における最小限のRLアルゴリズムであるREBELを提案する。
理論的には、自然ポリシーグラディエントのような基本的なRLアルゴリズムはREBELの変種と見なすことができる。
我々はREBELが言語モデリングと画像生成に一貫したアプローチを提供し、PPOやDPOとより強くあるいは類似した性能を実現することを発見した。
論文 参考訳(メタデータ) (2024-04-25T17:20:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。