論文の概要: Stage-Transition Dense Reward Modeling for Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2606.31377v1
- Date: Tue, 30 Jun 2026 09:07:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.150991
- Title: Stage-Transition Dense Reward Modeling for Reinforcement Learning
- Title(参考訳): 強化学習のための段階遷移線量リワードモデリング
- Abstract要約: 長距離ロボット操作のための強化学習は、しばしばスパースと遅延報酬によって制限される。
この研究は、未構造化のエキスパートビデオから論理的に根拠の深い報酬に変換し、RLエージェントをゼロから訓練するための視覚的な報酬学習フレームワークであるStage-Transition Dense Reward (STDR)を提案する。
STDRは、オンライントレーニング中に2つの補完的な学習信号を提供する: (i)目標指向の報酬を提供する段階遷移フィードバック、(ii)各段階の完了に向けた詳細なガイダンスを提供する段階内進捗フィードバック。
- 参考スコア(独自算出の注目度): 22.634812963829194
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning for long-horizon robotic manipulation is often limited by sparse and delayed rewards, while manually designing dense shaping signals is costly and brittle to changes in environments and object configurations. This work proposes Stage-Transition Dense Reward (STDR), a visual reward-learning framework that converts unstructured expert videos into logically grounded dense rewards for training RL agents from scratch. STDR leverages semantic understanding to infer a task's stage structure from demonstrations, and delivers two complementary learning signals during online training: (i) stage-transition feedback that provides goal-directed reward, and (ii) within-stage progress feedback that supplies fine-grained guidance toward completing each stage. Furthermore, an out-of-distribution (OOD) detection mechanism and a grasping regulation module are integrated to enhance robustness and prevent reward hacking. Experiments on 14 manipulation tasks across MetaWorld, ManiSkill, and Franka Kitchen show that STDR consistently improves sample efficiency and success rates over multiple baselines, and matches or surpasses handcrafted dense rewards on several challenging tasks. Real-robot evaluations further indicate that STDR assigns stable, progress-aligned rewards on successful executions while producing appropriately low rewards for failures, suggesting robustness to visual noise and better-calibrated reward assignment across settings.
- Abstract(参考訳): 長距離ロボット操作のための強化学習は、しばしばスパースと遅延報酬によって制限されるが、手動で密な整形信号を設計することは、環境や物体の構成の変化に対してコストがかかり、脆弱である。
この研究は、未構造化のエキスパートビデオから論理的に根拠の深い報酬に変換し、RLエージェントをゼロから訓練するための視覚的な報酬学習フレームワークであるStage-Transition Dense Reward (STDR)を提案する。
STDRは、意味理解を活用して、デモンストレーションからタスクのステージ構造を推測し、オンライントレーニング中に2つの補完的な学習信号を提供する。
(i)ゴール指向報酬を提供する段階転換フィードバック、
(II)各段階の完了に向けたきめ細かいガイダンスを提供する段階内進捗フィードバック。
さらに、ロバスト性を高め、報酬ハッキングを防止するために、アウト・オブ・ディストリビューション(OOD)検出機構とグリップ制御モジュールを統合する。
MetaWorld、ManiSkill、Franka Kitchenの14の操作タスクの実験では、STDRは複数のベースラインでサンプル効率と成功率を一貫して改善し、いくつかの困難なタスクにおいて手作りの密集した報酬にマッチまたは超えている。
リアルロボットの評価は、STDRが安定した進行順の報酬を成功に割り当てる一方で、失敗に対して適切に低い報酬を出力し、視覚ノイズに対する堅牢性や、設定間でのより良い報酬割り当てを示唆していることを示している。
関連論文リスト
- Iron: Intent-Aligned and Retrospective Dual Learning Framework for Enhancing Generalist Virtual Agents [31.811763840603614]
我々は、GUIエージェントをトレーニングするための意図に沿ったフレームワークであるIronを紹介します。
鉄は、低レベルアクションと高レベルインテントの微粒なアライメントを達成するために、段階的にサイクル一貫性の報酬を用いる。
鉄を訓練したジェネリストエージェントは、クロス環境およびクロスデバイスタスクのパフォーマンスを一貫して改善することを示した。
論文 参考訳(メタデータ) (2026-08-28T03:15:11Z) - DenseReward: Dense Reward Learning via Failure Synthesis for Robotic Manipulation [67.08835970838996]
強化学習は模倣学習の限界を超えてロボットポリシーを改善するための大きな約束である。
2つの重要な課題は、さまざまな障害データを大規模に取得し、スパース軌道レベルの成功ラベルを超えて、きめ細かい報酬信号を取得することである。
両課題に対処する高密度ロボット報酬モデルであるDenseRewardを紹介した。
論文 参考訳(メタデータ) (2026-07-14T17:59:29Z) - RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents [24.215311212134882]
本稿では,高密度なプロセス報酬から得られる豊富な情報を活用して,結果報酬によるトレーニングを容易にするために,Reward-Swap Policy Optimization (RSPO)を提案する。
RSPOは、最適化目標と真の結果報酬との整合性を確保しつつ、サンプル軌跡の多様性を保証する。
論文 参考訳(メタデータ) (2026-07-06T06:32:39Z) - RARM: Confidence-Gated Progress Reward Modeling for RL in Manipulation [12.756156905476503]
ロボット操作のための強化学習は報酬設計によってボトルネックとなることが多い。
本稿では,RARM(Reference-Anchored Reward Model)について紹介する。
RARMはその後のRLトレーニングにおいて最高の総合的な成功率を達成し、特に布の折り畳みのような長い水平タスクにおいて大きな成果を上げている。
論文 参考訳(メタデータ) (2026-06-20T13:03:21Z) - ProgAgent:A Continual RL Agent with Progress-Aware Rewards [0.07646713951724009]
ProgAgentは、プログレッシブアウェアの報酬学習をJAXネイティブシステムアーキテクチャと統合する継続的強化学習エージェントである。
これは、初期、現在、および目標観測におけるタスクの進捗を推定する知覚モデルを通じて、ラベルなしのエキスパートビデオから、密集した形をした報酬を導き出す。
ProgAgentは、非常に並列なロールアウトと完全に異なる更新をサポートし、洗練された統合された目標の実現を可能にする。
論文 参考訳(メタデータ) (2026-03-08T19:58:07Z) - Adaptive Milestone Reward for GUI Agents [38.548364518806046]
本稿では,Adaptive Milestone Reward (ADMIRE) 機構を提案する。
ADMIREは、軌道をマイルストーンに固定することで、検証可能な適応的な報酬システムを構築する。
実験によると、ADMIREは成功率において10%以上の絶対的な改善をもたらす。
論文 参考訳(メタデータ) (2026-02-12T03:31:40Z) - Benchmarking Multimodal CoT Reward Model Stepwise by Visual Program [96.79600297158271]
ステップレベルの多次元Chain-of-Thought(CoT)報酬モデルを自動的に学習する新しい手法であるSVIPを提案する。
視覚的なタスクを解決するためのコードを生成し、コードブロックの分析をトレーニングサンプルとしてCoTステップの評価に変換する。
SVIP-Rewardは、トレーニングや推論時間スケーリングにおけるMLLMのパフォーマンスを向上させる。
論文 参考訳(メタデータ) (2025-04-09T06:09:40Z) - Subtask-Aware Visual Reward Learning from Segmented Demonstrations [97.80917991633248]
本稿では,新しい報酬学習フレームワークであるReward Learning from Demonstration with Demonstrationsを紹介する。
我々は,映像セグメントとそれに対応するサブタスクに条件付けされた高密度報酬関数を訓練し,地道報酬信号との整合性を確保する。
実験の結果,REDSはメタワールドにおける複雑なロボット操作タスクのベースライン手法よりも優れていた。
論文 参考訳(メタデータ) (2025-02-28T01:25:37Z) - Curriculum Reinforcement Learning for Complex Reward Functions [5.78463306498655]
本稿では,まず簡単な報奨関数を最大化し,次に完全かつ複雑な報奨に遷移する2段階の報奨カリキュラムを提案する。
我々はDeepMindコントロールスイート上で,報酬定義に付加的な制約項を含むように修正した手法を評価する。
以上の結果から, 複雑な報酬を伴う環境において, 効率的かつ安定したRLに対する2段階報酬キュリキュラの可能性が示された。
論文 参考訳(メタデータ) (2024-10-22T08:07:44Z) - Affordance-Guided Reinforcement Learning via Visual Prompting [51.361977466993345]
Keypoint-based Affordance Guidance for Improvements (KAGI) は、視覚言語モデル(VLM)によって形成される報酬を自律的なRLに活用する手法である。
自然言語記述によって指定された多様な実世界の操作タスクにおいて、KAGIは自律的なRLのサンプル効率を改善し、30Kのオンライン微調整ステップでタスク完了を成功させる。
論文 参考訳(メタデータ) (2024-07-14T21:41:29Z) - RILe: Reinforced Imitation Learning [60.63173816209543]
RILe(Reinforced Learning)は、模倣学習と逆強化学習の強みを組み合わせて、高密度報酬関数を効率的に学習するフレームワークである。
本フレームワークは, 直接模倣が複雑な動作を再現できないような高次元タスクにおいて, 高い性能のポリシーを生成する。
論文 参考訳(メタデータ) (2024-06-12T17:56:31Z) - Towards Sequence-Level Training for Visual Tracking [60.95799261482857]
本研究は、強化学習に基づく視覚追跡のためのシーケンスレベルのトレーニング戦略を導入する。
4つの代表的な追跡モデル、SiamRPN++、SiamAttn、TransT、TrDiMPは、提案手法をトレーニングに取り入れることで一貫して改善されている。
論文 参考訳(メタデータ) (2022-08-11T13:15:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。