論文の概要: DenseReward: Dense Reward Learning via Failure Synthesis for Robotic Manipulation
- arxiv url: http://arxiv.org/abs/2607.13033v1
- Date: Tue, 14 Jul 2026 17:59:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.247358
- Title: DenseReward: Dense Reward Learning via Failure Synthesis for Robotic Manipulation
- Title(参考訳): DenseReward:ロボットマニピュレーションのための失敗合成によるDense Reward Learning
- Authors: Yu Fang, Wanxi Dong, Jiaqi Liu, Yue Yang, Mingxiao Huo, Yao Mu, Huaxiu Yao, Li Erran Li, Daniel Szafir, Mingyu Ding,
- Abstract要約: 強化学習は模倣学習の限界を超えてロボットポリシーを改善するための大きな約束である。
2つの重要な課題は、さまざまな障害データを大規模に取得し、スパース軌道レベルの成功ラベルを超えて、きめ細かい報酬信号を取得することである。
両課題に対処する高密度ロボット報酬モデルであるDenseRewardを紹介した。
- 参考スコア(独自算出の注目度): 67.08835970838996
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning holds great promise for improving robot policies beyond the limits of imitation learning. However, its practical adoption remains bottlenecked by the lack of reliable vision-language reward models that provide dense and informative feedback. Two key challenges remain: acquiring diverse failure data at scale and obtaining fine-grained reward signals beyond sparse trajectory-level success labels. Collecting failure trajectories typically requires laborious human effort, while pseudo-failures constructed by relabeling successful demonstrations fail to capture the diverse physical failure modes that arise during robot execution. Meanwhile, existing reward models often predict sparse binary or trajectory-level rewards, which provide limited guidance for efficient policy optimization. We introduce DenseReward, a dense robotic reward model that addresses both challenges. To train DenseReward, we develop an automated failure data generation pipeline that synthesizes physically realistic failure trajectories in simulation without human labeling, covering diverse failure modes such as collisions, missed grasps, object drops, and recovery behaviors. DenseReward predicts dense frame-level reward scores from visual observations and language instructions, enabling fine-grained estimation of task progress throughout an episode. Experiments show that DenseReward outperforms general-purpose VLMs and existing robotic reward models in dense reward prediction across both simulated and real-world manipulation. We further demonstrate that DenseReward provides effective reward guidance for downstream model predictive control and reinforcement learning. We release the dataset, trained reward models, and evaluation suite to support the development of failure-aware dense reward modeling for robot learning.
- Abstract(参考訳): 強化学習は模倣学習の限界を超えてロボットポリシーを改善するための大きな約束である。
しかし、その実践的採用は、密集した情報的フィードバックを提供する信頼性の高い視覚言語報酬モデルが欠如していることによって、いまだボトルネックになっている。
2つの重要な課題は、さまざまな障害データを大規模に取得し、スパース軌道レベルの成功ラベルを超えて、きめ細かい報酬信号を取得することである。
失敗軌道の収集は通常、人間の努力を要するが、成功例を再現して構築された擬似障害は、ロボットの実行中に発生する様々な物理的障害モードを捉えることに失敗する。
一方、既存の報酬モデルは、しばしばスパースバイナリやトラジェクトリレベルの報酬を予測し、効率的な政策最適化のための限られたガイダンスを提供する。
両課題に対処する高密度ロボット報酬モデルであるDenseRewardを紹介した。
DenseRewardを訓練するために、人間のラベルを付けずにシミュレーションで物理的に現実的な故障軌跡を合成する自動故障データ生成パイプラインを開発した。
DenseRewardは、視覚的な観察と言語指示から高密度なフレームレベルの報酬スコアを予測し、エピソード全体を通してタスクの進捗をきめ細やかな推定を可能にする。
実験により、DenseRewardはシミュレーションと実世界の両方の操作において、汎用的なVLMと既存のロボット報酬モデルよりも高い性能を示すことが示された。
さらに、DenseRewardは、下流モデル予測制御と強化学習に効果的な報酬ガイダンスを提供することを示した。
我々は,ロボット学習のための高密度報酬モデルの開発を支援するために,データセット,トレーニングされた報酬モデル,評価スイートをリリースする。
関連論文リスト
- Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation [38.88183703128359]
混在型ロボットのデモから誤検知値関数を学習するフレームワークであるReTVL(ReTry-Supervised Value Learning)を提案する。
ReTVLは、グローバルプログレスキャリブレーションとローカルなペアワイズ選好学習を組み合わせることで、ミスに伴う局所的な劣化・回復構造をキャプチャする。
実ロボット操作タスクの実験では、ReTVLは進捗ベースのベースラインよりもよりきめ細かな値推定を生成する。
論文 参考訳(メタデータ) (2026-06-23T14:27:10Z) - RARM: Confidence-Gated Progress Reward Modeling for RL in Manipulation [12.756156905476503]
ロボット操作のための強化学習は報酬設計によってボトルネックとなることが多い。
本稿では,RARM(Reference-Anchored Reward Model)について紹介する。
RARMはその後のRLトレーニングにおいて最高の総合的な成功率を達成し、特に布の折り畳みのような長い水平タスクにおいて大きな成果を上げている。
論文 参考訳(メタデータ) (2026-06-20T13:03:21Z) - From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models [40.30751311757326]
強化学習は正確な報酬関数に依存しており、しばしば手作りやロボット工学のような現実世界の応用では利用できない。
近年の研究では、前訓練された視覚言語モデル(VLM)を報酬モデルとしてゼロショット推論能力について検討している。
Demo2Rewardは、シミュレーションされたロボットタスクやポリシーバックボーンで、既存のゼロショットと少数ショットのVLM報酬モデルより一貫して優れています。
論文 参考訳(メタデータ) (2026-05-22T16:04:22Z) - Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons [69.87766750714945]
汎用ロボット報酬モデルは通常、専門家によるデモンストレーションから絶対的なタスク進捗を予測するために訓練される。
本稿では、軌道内進行監視と軌道間優先監視を組み合わせたスケーラブルな報酬モデリングフレームワークRobometerを紹介する。
ロビオメーターは、専門家データに報酬等級を固定するフレームレベルのプログレス・ロスと、グローバルな順序制約を課す軌跡比較優先損失という2つの目的で訓練されている。
論文 参考訳(メタデータ) (2026-03-02T17:38:58Z) - Guardian: Detecting Robotic Planning and Execution Errors with Vision-Language Models [53.20969621498248]
本稿では,多種多様な計画および実行障害を生成するために,軌道を手続き的に乱す自動ロボット故障合成手法を提案する。
RLBench-Fail, BridgeDataV2-Fail, UR5-Failの3つの新しい故障検出ベンチマークを構築した。
次に、詳細な障害推論と検出のためのマルチビューイメージを備えたVLMであるGuardianをトレーニングします。
論文 参考訳(メタデータ) (2025-12-01T17:57:27Z) - GenFlowRL: Shaping Rewards with Generative Object-Centric Flow in Visual Reinforcement Learning [79.68241687396603]
本稿では,多種多様な組織間データセットから学習した生成フローから,形状の報酬を導出するGenFlowRLを提案する。
GenFlowRLは、生成したオブジェクト中心の流れから抽出した操作機能を効果的に活用できることを、シミュレーションと実世界のクロスエボディメント評価の両方で実証した。
論文 参考訳(メタデータ) (2025-08-14T20:19:20Z) - Affordance-Guided Reinforcement Learning via Visual Prompting [51.361977466993345]
Keypoint-based Affordance Guidance for Improvements (KAGI) は、視覚言語モデル(VLM)によって形成される報酬を自律的なRLに活用する手法である。
自然言語記述によって指定された多様な実世界の操作タスクにおいて、KAGIは自律的なRLのサンプル効率を改善し、30Kのオンライン微調整ステップでタスク完了を成功させる。
論文 参考訳(メタデータ) (2024-07-14T21:41:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。