論文の概要: Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry
- arxiv url: http://arxiv.org/abs/2607.03702v1
- Date: Sat, 04 Jul 2026 04:45:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.685362
- Title: Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry
- Title(参考訳): Pivotal-Aware Self-Feedback Retryによるエージェント強化学習
- Authors: Weiyang Guo, Zesheng Shi, Longhui Zhang, Zeen Zhu, Min Zhang, Jing Li,
- Abstract要約: 本稿では,大規模言語モデル (LLM) エージェントにおける経験的活用のための自己フィードバック再試行フレームワークであるPivoARLを提案する。
PivoARLは、構造的反射によるピボットの誤った回転を識別し、対応するピボット状態からのみ局所的な再試行を行う。
PivoARLはすべてのタスクでPass@2/3の大幅な改善を実現しており、MetaRLよりも平均11.5%向上している。
- 参考スコア(独自算出の注目度): 14.02751159295063
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model (LLM) agents have shown strong decision-making capabilities in long-horizon interactive tasks, yet they still struggle to effectively leverage failed trajectories: full retries incur high interaction costs, while experience retrieval tends to dilute critical experience signals. To address this, we propose PivoARL, a self-feedback retry framework for experience exploitation in LLM agents. PivoARL identifies the pivotal erroneous turn through structured reflection and performs local retry only from the corresponding pivotal state, thereby reusing the correct prefix and reducing redundant interactions. From an information-gain perspective, we further show that pivotal retry concentrates useful experience signals near the error boundary, mitigating the signal dilution caused by state-agnostic experience utilization. Based on this insight, we design a pivotal-aware credit assignment mechanism that rewards correct prefixes while isolating erroneous suffixes, and optimize reflection quality through implicit reflection returns. We conduct a systematic evaluation on 4 agent tasks and 7 search-based QA benchmarks. Results show that PivoARL achieves significant improvements on Pass@2/3 across all tasks, with an average gain of about 11.5\% over MetaRL. Moreover, benefiting from contrastive preference signals induced by pivotal turns, PivoARL also consistently improves Pass@1 on over 80\% of the tasks. On Minesweeper environment, PivoARL improves over GiGPO by more than 45\% and reduces interaction turns by about 42\% on average compared with full-retry methods. Code is available at https://github.com/yuki-younai/PivoARL.
- Abstract(参考訳): 大言語モデル(LLM)エージェントは、長期の対話的なタスクにおいて強力な意思決定能力を示してきたが、失敗した軌道を効果的に活用することに苦慮している。
そこで本研究では,LLMエージェントの自己フィードバック再試行フレームワークであるPivoARLを提案する。
PivoARLは、構造化された反射を通して中心的な誤った方向を識別し、対応する中心状態からのみ局所的な再試行を行い、正しい接頭辞を再利用し、冗長な相互作用を減少させる。
情報ゲインの観点からは、重要な再試行は、エラー境界付近で有用な経験信号に集中することを示し、状態に依存しない経験利用による信号の希釈を緩和する。
この知見に基づいて、誤接尾辞を分離しながら正しい接頭辞を報知し、暗黙の反射を返すことで反射品質を最適化するピボット・アウェア・クレジット割り当て機構を設計する。
4つのエージェントタスクと7つの検索ベースQAベンチマークを体系的に評価する。
その結果、PivoARLはすべてのタスクでPass@2/3を大幅に改善し、MetaRLよりも平均11.5\%向上した。
さらに、ピボットターンによって引き起こされるコントラスト的な選好信号の恩恵を受け、PivoARLはタスクの80%以上でPass@1を一貫して改善する。
Minesweeper 環境では、PivoARL は GiGPO を 45 % 以上改善し、フルリトライ法と比較して平均42 % ほど相互作用を減少させる。
コードはhttps://github.com/yuki-younai/PivoARLで公開されている。
関連論文リスト
- ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents [52.531681772560724]
Supervised Fine-tuning (SFT) は主に軌道軌道上で構築されており、ツール故障後の回復のための信号はほとんど得られない。
ツール使用エージェントの反射誘導補正を学習するフレームワークであるReGRPOを紹介する。
GTAとGAIAの実験では、同じバックボーンとツールスイートの下で、ReGRPOは一貫して強力なオープンソースベースラインを上回っている。
論文 参考訳(メタデータ) (2026-06-30T09:19:38Z) - Closing the Reflection Gap: A Free Calibration Bonus for Agentic RL [12.234169944475537]
RefGRPOは、標準的なRLアルゴリズムを2つの重要な要素で強化する、シンプルだが効果的な修正である。
エージェント自身の反射と実際の結果とを対比して計算した自由キャリブレーションボーナス。
結果の反射は、エージェントを環境フィードバックに基づく独自の検証器に変える。
論文 参考訳(メタデータ) (2026-06-12T07:47:15Z) - What and When to Distill: Selective Hindsight Distillation for Multi-Turn Agents [70.6980022118038]
強化学習は、緩やかなタスク報酬からLLMエージェントを訓練することができるが、長期的なクレジット割り当ては依然として困難である。
既存の方法は、ステップごとの環境フィードバックを完全に活用することなく、軌道レベルの報酬やプロキシ信号に依存している。
環境重み付け学習フレームワークであるSERLを紹介する。
論文 参考訳(メタデータ) (2026-05-19T07:00:55Z) - Utilizing and Calibrating Hindsight Process Rewards via Reinforcement with Mutual Information Self-Evaluation [50.696688705287755]
我々は、強化学習におけるスパース報酬課題を克服するために、相互情報自己評価を提案する。
MISEにより、エージェントは、疎外的信号を補う高密度な内部報酬から自律的に学習することができる。
我々は、後見自己評価報酬を利用することは、政策と代行報酬政策の間のKL分散項と相互情報を組み合わせた目的を最小化することと等価であることを示す。
論文 参考訳(メタデータ) (2026-04-13T15:18:51Z) - Internalizing Agency from Reflective Experience [20.650609947690196]
LEAFEは、リカバリエージェンシーをリフレクティブエクスペリエンスから内部化するフレームワークである。
ベースモデルよりも一貫してPass@1を改善し、結果駆動ベースラインよりも高いPass@kを実現している。
論文 参考訳(メタデータ) (2026-03-17T17:50:47Z) - RetroAgent: From Solving to Evolving via Retrospective Dual Intrinsic Feedback [54.39884046754265]
RetroAgentは、エージェントが複雑なインタラクティブ環境をマスターできるオンラインRLフレームワークである。
実験の結果,RetroAgentはSOTA(State-of-the-art)の性能を達成できた。
論文 参考訳(メタデータ) (2026-03-09T16:23:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。