論文の概要: SPyCE: Skill-Policy Co-evolution for Multimodal Agents
- arxiv url: http://arxiv.org/abs/2607.13854v1
- Date: Wed, 15 Jul 2026 14:01:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.791756
- Title: SPyCE: Skill-Policy Co-evolution for Multimodal Agents
- Title(参考訳): SPyCE: マルチモーダルエージェントのためのスキルポリティクスの共進化
- Authors: Ru Zhang, Weijie Qiu,
- Abstract要約: 階層型スキルライブラリにトラジェクトリを蒸留し,強化学習を通じて更新するフレームワークであるSPyCEを提案する。
トレーニング中、ポリシーモデルはそのロールアウトをガイドするために回収されたスキルに条件を課し、スキルライブラリはポリシーによって生成された貴重なロールアウトを使用して進化する。
8つのベンチマークの実験では、SPyCEはRLベースとメモリベースの両方のベースラインを一貫して上回っている。
- 参考スコア(独自算出の注目度): 12.105041985483167
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal agents that think with images iteratively manipulate visual evidence and invoke tools across many steps. Existing reinforcement learning methods reduce trajectories to scalar rewards, forcing the policy to discover reusable tool-use patterns from scratch on every new task; memory-based alternatives retain past experience, yet they rely on test-time retrieval, without updating the policy to absorb reusable patterns from that experience. Our key insight is that multimodal reasoning trajectories should be distilled into reusable skills that co-evolve with the policy during training, rather than being consumed as rewards or retrieved from a static store. To this end, we propose SPyCE (Skill-Policy Co-evolution), a framework that distills trajectories into a hierarchical skill library and updates it throughout reinforcement learning. Execution skills capture local visual operations, while workflow skills encode high-level priors that orchestrate tool use. During training, the policy model conditions on retrieved skills to guide its rollouts, while the skill library evolves using valuable rollouts generated by the policy. This creates a closed loop in which improved policies yield better skills, and the evolving skill library, in turn, provides stronger priors for policy rollouts. Experiments across eight benchmarks demonstrate that SPyCE consistently outperforms both RL-based and memory-based baselines. Further analysis reveals that both the hierarchical skill design and the co-evolution mechanism are critical to our design. These results suggest joint skill-policy optimization as a promising paradigm for building capable multimodal agents.
- Abstract(参考訳): 画像で考えるマルチモーダルエージェントは、視覚的証拠を反復的に操作し、多くのステップにわたってツールを呼び出す。
既存の強化学習手法は、軌道をスカラー報酬に還元し、新しいタスク毎に再利用可能なツールの使用パターンをスクラッチから発見することをポリシーに強制する;メモリベースの代替手段は過去の経験を維持し、その経験から再利用可能なパターンを吸収するポリシーを更新することなくテスト時間検索に依存する。
私たちの重要な洞察は、マルチモーダル推論は、報酬として消費されるか、静的ストアから回収されるかではなく、トレーニング中にポリシーと共進化する再利用可能なスキルに蒸留されるべきであるということです。
この目的のために,提案するSPyCE (Skill-Policy Co-evolution) は,トラジェクトリーを階層的なスキルライブラリに蒸留し,強化学習を通じて更新するフレームワークである。
実行スキルはローカルなビジュアル操作をキャプチャし、ワークフロースキルはツールが使用するハイレベルな事前情報をエンコードする。
トレーニング中、ポリシーモデルはそのロールアウトをガイドするために回収されたスキルに条件を課し、スキルライブラリはポリシーによって生成された貴重なロールアウトを使用して進化する。
これにより、改善されたポリシーがより良いスキルをもたらすクローズドループが生成され、進化するスキルライブラリは、ポリシーのロールアウトに対してより強力な優先順位を提供する。
8つのベンチマークの実験では、SPyCEはRLベースとメモリベースの両方のベースラインを一貫して上回っている。
さらに分析した結果,階層的スキル設計と共進化機構の両方が設計に不可欠であることが判明した。
これらの結果から,有能なマルチモーダルエージェント構築のパラダイムとして,協調型スキル・ポリティクスの最適化が期待される。
関連論文リスト
- RL Forgets! Towards Continual Policy Optimization [57.4336338996653]
継続的なポストトレーニングは、進化するタスクに視覚言語モデルを適用するための中心的なパラダイムになりつつある。
最近の研究は、強化学習が本質的に忘れやすいという信念から、教師付き微調整よりも強化学習を好んでいる。
我々は,事前タスク動作KL目標に基づくリプレイフリーフレームワークである継続ポリシー最適化(CPO)を提案する。
論文 参考訳(メタデータ) (2026-07-05T15:46:11Z) - ReSkill: Reconciling Skill Creation with Policy Optimization in Agentic RL [24.65745354725497]
本稿では,RL-in-the-loopスキル作成フレームワークであるReSkillを紹介する。
ReSkillはGRPOの群構造を利用して、3つのメカニズムを埋め込む。
いくつかのドメインで、ReSkillは既存のメモリとスキルベースのRLメソッドを一貫して上回っている。
論文 参考訳(メタデータ) (2026-06-01T03:12:05Z) - You Live More Than Once: Towards Hierarchical Skill Meta-Evolving [92.6633152185458]
テストタイムスキルの進化はエージェントシステムを強化するための新しいパラダイムと見なされている。
エージェントシステムの継続的改善には,スキル進化フレームワークの試験時間改善が不可欠であることを示す。
軽量な階層型スキルメタ進化ソリューションであるHiSMEを提案する。
論文 参考訳(メタデータ) (2026-05-27T12:26:49Z) - ARISE: Agent Reasoning with Intrinsic Skill Evolution in Hierarchical Reinforcement Learning [17.98540130851038]
ARISE(Agent Reasoning via Intrinsic Skill Evolution)は階層的な強化学習フレームワークである。
共有ポリシを使用して、ハイレベルなスキルを管理し、低レベルなレスポンスを生成する。
階層的な報酬設計は、推論能力と図書館品質の共進化を導く。
論文 参考訳(メタデータ) (2026-03-17T02:03:17Z) - SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning [83.98129545309277]
生経験と政策改善のギャップを埋めるフレームワークであるSkillRLを提案する。
本手法では,階層型スキルライブラリであるSkillBankを構築するために,経験に基づく蒸留機構を導入する。
ALF、WebShop、および7つの検索強化タスクの実験結果は、SkillRLが最先端のパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2026-02-09T03:17:17Z) - Scalable In-Context Q-Learning [68.9917436397079]
textbfScalable textbfIn-textbfContext textbfQ-textbfLearning (textbfSICQL)を提案する。
textbfSICQLは動的プログラミングとワールドモデリングを利用して、ICRLを効率的な報酬とタスクの一般化に向けて制御する。
論文 参考訳(メタデータ) (2025-06-02T04:21:56Z) - Meta-Reinforcement Learning Robust to Distributional Shift via Model
Identification and Experience Relabeling [126.69933134648541]
本稿では,テスト時にアウト・オブ・ディストリビューション・タスクに直面した場合に,効率よく外挿できるメタ強化学習アルゴリズムを提案する。
我々の手法は単純な洞察に基づいており、動的モデルが非政治データに効率的かつ一貫して適応可能であることを認識している。
論文 参考訳(メタデータ) (2020-06-12T13:34:46Z) - Efficient Deep Reinforcement Learning via Adaptive Policy Transfer [50.51637231309424]
強化学習(RL)を促進するための政策伝達フレームワーク(PTF)の提案
我々のフレームワークは、いつ、いつ、どのソースポリシーがターゲットポリシーの再利用に最適なのか、いつそれを終了するかを学習する。
実験結果から,学習過程を著しく加速し,最先端の政策伝達手法を超越していることが判明した。
論文 参考訳(メタデータ) (2020-02-19T07:30:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。