論文の概要: SCOUT: Per-Context Reset Curricula for Sparse-Reward Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.26417v1
- Date: Wed, 29 Jul 2026 02:59:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.52914
- Title: SCOUT: Per-Context Reset Curricula for Sparse-Reward Reinforcement Learning
- Title(参考訳): SCOUT:スパース・リワード強化学習のためのコンテキストごとのリセットカリキュラム
- Abstract要約: リセットカリキュラムは、足場と呼ばれる、より簡単な中間状態から、いくつかのトレーニングロールアウトを開始することで、この問題に対処する。
タスクインスタンスやコンテキストが違うレートで学習した場合、失敗する可能性がある。
SCOUTは学習者に依存しないオンラインリセットコントローラで、各コンテキストに独自のカリキュラムを与える。
- 参考スコア(独自算出の注目度): 0.05475997486212839
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Sparse-reward reinforcement learning often fails because rollouts from the unassisted evaluation start rarely reach later task stages. Reset curricula address this by starting some training rollouts from easier intermediate states, called scaffolds. Such a curriculum faces two decisions: scaffold access, obtaining informative starts, and scaffold allocation, deciding how quickly that assistance is removed. Most prior curricula pace removal on one shared schedule, which can fail when task instances, or contexts, learn at different rates. We introduce SCOUT, an online, learner-agnostic reset controller that gives every context its own curriculum. Using only binary rollout success, SCOUT removes assistance after sustained success, restores it after failure, and cautiously tests a harder start when progress stalls, without changing the reward, optimizer, or learner. A counting construction shows that synchronized global pacing can be insufficient when contexts need conflicting amounts of assisted practice. Across six navigation and manipulation settings, scaffold access improves learning and enables success in three where unassisted training fails within the reported budget. In a constructed pacing conflict, each tested global schedule leaves one group unsolved, while SCOUT solves both. Average success can conceal this failure, so we also report the least successful group. Group-level pacing works when learning differences follow known groups but can fail when they occur within one group. SCOUT needs no group labels and remains consistently strong in both cases. A reset curriculum should remove assistance at the scale where learning progress differs.
- Abstract(参考訳): スパース・リワード強化学習は、未支援評価からのロールアウトが後続のタスクステージに到達することは滅多にないため、しばしば失敗する。
リセットカリキュラムは、足場と呼ばれるより簡単な中間状態からいくつかのトレーニングロールアウトを開始することで、この問題に対処する。
このようなカリキュラムは、足場へのアクセス、情報提供開始、足場割り当ての2つの決定に直面する。
タスクインスタンスやコンテキストが違うレートで学習した場合、失敗する可能性がある。
SCOUTは学習者に依存しないオンラインリセットコントローラで、各コンテキストに独自のカリキュラムを与える。
SCOUTはバイナリロールアウトの成功のみを使用して、成功を継続した後の支援を取り除き、失敗後に修復し、報酬やオプティマイザ、学習者を変更することなく、進捗が停止した場合に慎重に開始をテストします。
カウント構成は、コンテキストが相反する量の補助練習を必要とする場合、同期されたグローバルペーシングが不十分であることを示している。
6つのナビゲーションと操作設定で、足場アクセスは学習を改善し、報告された予算内で非支援トレーニングが失敗する3つの成功を可能にする。
構築されたペーシング競合では、テストされた各グローバルスケジュールは1つのグループを未解決のままにし、SCOUTは両方を解決する。
平均的な成功は、この失敗を隠蔽する可能性があるので、最も成功率の低いグループも報告します。
グループレベルのペアリングは、学習の違いが既知のグループに従えば機能するが、それがひとつのグループ内で発生すると失敗する可能性がある。
SCOUTにはグループラベルは必要ない。
リセットカリキュラムは、学習の進歩が異なるスケールで支援を取り除くべきである。
関連論文リスト
- Phase-and-First-Arrival VLM Feedback for Sparse-Reward Reinforcement Learning in Surgical Manipulation [18.513281440175113]
スパース・リワード強化学習では、終末報酬は同じ結果にそのような試みが崩壊する。
記録されたエピソードごとの1つのVLMクエリは、最も視覚的に検証されたタスクフェーズを識別する。
5つのシミュレートされたタスクにおいて,提案手法は平均75.2%に到達し,コントラスト言語-画像事前学習に基づく報酬は52.1%となった。
論文 参考訳(メタデータ) (2026-09-07T08:29:59Z) - What is Missing from AI Post-Training AI: An Empirical Analysis [74.56398070411755]
この図は実行レベル能力と戦略レベル能力という2つの異なる能力を混在させています。
エージェントのトレーニング戦略は、さまざまなタスクにおいて、最初からロックインされていることが分かりました。
次に,欠席経験,指導の欠如,推論の不十分な3つの自然な説明と介入のエスカレートについて検討した。
論文 参考訳(メタデータ) (2026-08-19T16:17:39Z) - Temporal GRPO: Beyond Trajectory-Level Credit in Vision-Language-Action Reinforcement Learning [27.507258147328]
アウトカム駆動強化学習は、タスク・サクセスの少ないフィードバックから、視覚-言語-アクション(VLA)ポリシーをトレーニング後処理するスケーラブルな方法を提供する。
RoboTwin 2.0では、Temporal GRPOがタスク成功とサンプル効率を改善し、タスク水平線を一貫したゲインを実現している。
論文 参考訳(メタデータ) (2026-08-13T09:54:14Z) - Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning [21.808015281498076]
批判のないグループベース強化学習は、大規模言語モデルの訓練後においてスケーラブルなアプローチとなっている。
最近の研究は、ロールアウト生成を適応的な決定として扱うようになったが、2つの重要な制限が残っている。
本稿では,各介入が生み出す改善に基づき,ロールアウトの生成方法を学ぶ訓練時フレームワークであるRecoverability-Aware Learning (RAIL)を提案する。
論文 参考訳(メタデータ) (2026-08-05T17:22:02Z) - A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism [11.543353599329675]
検証可能な報酬を伴う強化学習は、より強力なエージェントを生み出すことを期待して、監督されたチェックポイントで日常的に実行される。
4Bから8Bのスケールで、小さな言語とビジョン言語モデルWebエージェントにスキルを追加するかどうかを問う。
エージェントがほとんどマスターしたタスクに対して、強力な教師付きベースラインの成功率を確実に改善する構成は存在しない。
論文 参考訳(メタデータ) (2026-07-14T11:17:35Z) - Learning More from Less: Reinforcement Learning from Hindsight [19.802783289526598]
強化学習(Reinforcement Learning, RL)は、視覚-言語-行動モデル(VLA)の訓練後モデルに使用される。
我々は、実際に達成したタスクに対するロールアウトの失敗を評価して、後向きの学習をVLAの訓練後のRLにもたらすLearning from Hindsight(LfH)を紹介する。
論文 参考訳(メタデータ) (2026-07-10T02:17:41Z) - When Does Continual Learning Require Learning [68.55508958298942]
継続的学習は単一の能力ではないことを示す。
環境変化の異なるパターンは、根本的に異なる更新動作を必要とする。
それぞれの手法が成功するか、失敗するかを理解することが、より強力な継続的学習システムの設計を導くことを願っている。
論文 参考訳(メタデータ) (2026-07-08T18:27:40Z) - AI-Integrated Learning Management System for Middle School: A Longitudinal Study of Learning Outcomes Through High School and Beyond [0.0]
中学校は中核的な学問的スキルを構築するための重要な窓口である。
多くの学生は、ヘルプが制限されることが多く、しばらく立ち往生した後、遅すぎるため遅れています。
本研究では,中等教育のためのAI統合LMSを提案する。
論文 参考訳(メタデータ) (2026-05-02T05:10:36Z) - LLM Chatbots in High School Programming: Exploring Behaviors and Interventions [0.6308539010172308]
本研究は,大規模言語モデル(LLM)の高次プログラミング教育における統合を改良するために,デザインベース研究サイクルを用いた。
最初の問題は、インタベンション・グループ(Intervention Group)で特定され、インタベーション・グループ(Intervention Group)では、インタベーション・グループ(Intervention Group)では、インタベーション・グループ(Intervention Group)では、エグゼクティブ、ソリューション・サーキング・クエリの比率が、試験のパフォーマンスと強く負の相関をとっていた。
論文 参考訳(メタデータ) (2025-11-24T10:58:06Z) - ML-LMCL: Mutual Learning and Large-Margin Contrastive Learning for
Improving ASR Robustness in Spoken Language Understanding [55.39105863825107]
本稿では,ML-LMCL(Multual Learning and Large-Margin Contrastive Learning)を提案する。
微調整では、相互学習を適用し、手書き文字とASR文字の2つのSLUモデルを訓練する。
3つのデータセットの実験では、ML-LMCLは既存のモデルより優れ、新しい最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2023-11-19T16:53:35Z) - REBAR: Retrieval-Based Reconstruction for Time-series Contrastive Learning [64.08293076551601]
正の対を識別する学習尺度を新たに提案する。
検索ベースレコンストラクションは2つのシーケンス間の類似度を測定する。
本稿では,REBAR誤差が相互クラスメンバシップの予測因子であることを示す。
論文 参考訳(メタデータ) (2023-11-01T13:44:45Z) - Self-Paced Absolute Learning Progress as a Regularized Approach to
Curriculum Learning [4.054285623919103]
絶対学習プログレス(ALP)に基づくカリキュラムは、異なる環境で成功したが、新しいタスクで既に学習された振る舞いを繰り返すことによるムダ計算は成功している。
我々は,SPALP(Self-Paced Absolute Learning Progress)と呼ばれる,自己完結型(Deep)学習に基づく新たな正規化手法を導入することで,この問題を解決する。
提案手法は,全ての場合においてオリジナルALPに匹敵する性能を達成し,その2つの場合においてALPよりも高速に到達する。
論文 参考訳(メタデータ) (2023-06-09T09:17:51Z) - Active Continual Learning: On Balancing Knowledge Retention and
Learnability [43.6658577908349]
一連のタスクで学んだことを忘れずに新しい知識を取得することは、継続学習(CL)の中心的焦点である。
本稿では, 能動連続学習(ACL)の課題の列における未探索問題について考察する。
ドメイン,クラス,タスクインクリメンタルシナリオにおける複数のALアルゴリズムとCLアルゴリズムの有効性と相互作用について検討する。
論文 参考訳(メタデータ) (2023-05-06T04:11:03Z) - You Only Live Once: Single-Life Reinforcement Learning [124.1738675154651]
多くの現実世界の状況では、そのタスクを繰り返し実行できるポリシーを学ぶことではなく、単一のトライアルで1回だけ新しいタスクを成功させることが目的である。
エージェントが介入なしにひとつのエピソード内でタスクを完了しなければならない問題設定を形式化する。
本稿では,分散マッチング戦略を用いたQ$-weighted adversarial Learning (QWALE)を提案する。
論文 参考訳(メタデータ) (2022-10-17T09:00:11Z) - vCLIMB: A Novel Video Class Incremental Learning Benchmark [53.90485760679411]
本稿では,ビデオ連続学習ベンチマークvCLIMBを紹介する。
vCLIMBは、ビデオ連続学習における深層モデルの破滅的な忘れを解析するための標準化されたテストベッドである。
本稿では,メモリベース連続学習法に適用可能な時間的整合性正規化を提案する。
論文 参考訳(メタデータ) (2022-01-23T22:14:17Z) - Persistent Reinforcement Learning via Subgoal Curricula [114.83989499740193]
VaPRL(Value-accelerated Persistent Reinforcement Learning)は、初期状態のカリキュラムを生成する。
VaPRLは、エピソード強化学習と比較して、3桁の精度で必要な介入を減らす。
論文 参考訳(メタデータ) (2021-07-27T16:39:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。