論文の概要: WARP-RM: A Warp-Augmented Relative Progress Reward Model for Data Curation
- arxiv url: http://arxiv.org/abs/2606.28320v1
- Date: Fri, 26 Jun 2026 17:58:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.554968
- Title: WARP-RM: A Warp-Augmented Relative Progress Reward Model for Data Curation
- Title(参考訳): WARP-RM: データキュレーションのためのワープ強化相対的プログレッシブ・リワードモデル
- Authors: Justin Yu, Andrew Goldberg, Kavish Kondap, Karim El-Refai, Ethan Ransing, Qianzhong Chen, Mac Schwager, Fred Shentu, Philipp Wu, Ken Goldberg,
- Abstract要約: 本稿では,密集度,符号付き相対進行度を学習するための完全自己教師付きアルゴリズムであるWARP(Warp-Augmented Relative Progress)を提案する。
WARPは、実演の時間ワープ拡張によりフレームごとの進捗目標を生成し、WARP-RMをトレーニングし、入力フレーム間の正規化経過時間を予測する。
次に,これらのスカラー報酬推定値を利用したWARP-BCを導入する。
- 参考スコア(独自算出の注目度): 16.464426150252255
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Scaling imitation learning requires large datasets, yet human teleoperation inevitably produces mixed-quality demonstrations containing hesitations and recoveries. Prior frame-level progress reward models supervise on absolute temporal progress proxies that suffer from label noise, or require costly human annotations to define subtask boundaries. We present WARP (Warp-Augmented Relative Progress), a novel fully self-supervised algorithm for learning dense, signed relative progress magnitudes directly from successful demonstrations. WARP generates per-frame progress targets via time-warp augmentations of demonstrations (variable playback speeds and reversals) and we train WARP-RM to predict the normalized elapsed time between input frames. Aggregating these predictions across overlapping windows yields a dense frame-level progress signal. We then introduce WARP-BC, which leverages these scalar reward estimates to upweight high-advantage action chunks during behavior cloning, where chunk-level advantage is obtained by aggregating per-frame rewards. We evaluate our approach on a physical bimanual robot system performing a long-horizon deformable object manipulation task: folding T-shirts from a random crumpled start. To evaluate policy robustness against suboptimal data, we construct training datasets of varying quality using episode length as a proxy for teleoperation sub-optimality. As the dataset is widened to admit more inefficiencies, WARP-BC maintains a 19/20 success rate compared to vanilla BC's collapse to 2/20, improving throughput by up to 18x.
- Abstract(参考訳): 模倣学習をスケールするには大規模なデータセットが必要であるが、人間による遠隔操作は必然的に、ヒューズやリカバリを含む混合品質のデモンストレーションを生成する。
以前のフレームレベルの進歩報酬モデルでは、ラベルノイズに苦しむ絶対時間進行プロキシを監督するか、サブタスク境界を定義するのに人為的なアノテーションを必要とする。
本稿では,実演から得られた相対進行度を直接学習する完全自己教師型アルゴリズムWARP(Warp-Augmented Relative Progress)を提案する。
WARPは、フレームごとの進行目標を、デモ(再生速度や逆転)の時間ワープ拡張により生成し、WARP-RMをトレーニングし、入力フレーム間の正規化経過時間を予測する。
これらの予測を重なり合うウィンドウに集約すると、フレームレベルの進行信号が高密度になる。
次に,これらのスカラー報酬推定値を利用したWARP-BCを導入する。
本研究では,Tシャツをランダムに折り畳むという,長い水平変形可能な物体操作作業を行う物理的バイマニュアルロボットシステムに対するアプローチを評価する。
準最適データに対する政策ロバスト性を評価するため,遠隔操作型準最適性のプロキシとして,エピソード長を用いて様々な品質のトレーニングデータセットを構築した。
データセットがより効率の悪さを認めるように拡張されているため、WARP-BCは、BCが崩壊したバニラに比べて19/20の成功率を維持し、スループットを最大18倍向上させる。
関連論文リスト
- RODS: Reward-Driven Online Data Synthesis for Multi-Turn Tool-Use Agents [13.362388357375082]
マルチターンツール利用RLは、静的データセットにおける情報的サンプルの迅速な枯渇によってボトルネックとなる。
本稿では, RODS (Reward-driven Online Data Synthesis) を提案する。
論文 参考訳(メタデータ) (2026-06-17T13:13:32Z) - DIRECT: When and Where Should You Allocate Test-Time Compute in Embodied Planners? [57.585275546688116]
VLM(Vision-Language Models)は、エンボディエージェントの高レベルプランナーとしてますます普及している。
テストタイムの計算をいつ、どこで使うかを選択することは、実際の世界にフロンティアパフォーマンスをもたらす中心である、と私たちは主張する。
我々はマルチモーダルシーンコンテキストを用いてプロンプト毎に計算を割り当てるルーティングフレームワークであるDIRECTを紹介した。
論文 参考訳(メタデータ) (2026-06-10T17:58:49Z) - TapSampling: Inference-Time Sampling with a Task-Progress-Understanding Verifier for Robotic Manipulation [61.35569005726248]
既存の具体的制御研究は、トレーニングデータとモデルサイズをスケールすることで、顕著なパフォーマンス向上を示す。
拡散や自己回帰モデルのような非決定論的生成モデルは、エンボディドコントロールの分野で広く採用されている。
推測時間サンプリングのためのプラグイン・アンド・プレイフレームワークである textbfTapSampling を提案する。
論文 参考訳(メタデータ) (2026-05-25T08:03:31Z) - ProgressVLA: Progress-Guided Diffusion Policy for Vision-Language Robotic Manipulation [57.07494675832939]
ロボット操作のための既存の視覚言語アクション(VLA)モデルは、進歩意識を欠いている。
本研究では,textbf vla という新しいモデルを提案し,タスク進捗の推定と統合について検討する。
CALVINとLIBEROベンチマークの実験は、実世界のロボットの展開とともに、成功率の大幅な改善を一貫して示している。
論文 参考訳(メタデータ) (2026-03-29T12:38:11Z) - OmniSAT: Compact Action Token, Faster Auto Regression [70.70037017501357]
我々は、コンパクトで転送可能なアクション表現を学ぶOmni Swift Action Tokenizerを紹介する。
その結果、離散トークン化はトレーニングシーケンスを6.8$times$に短縮し、ターゲットエントロピーを低下させる。
論文 参考訳(メタデータ) (2025-10-08T03:55:24Z) - Streaming Looking Ahead with Token-level Self-reward [50.699168440048716]
本稿では,トークンレベルの自己回帰モデリング(TRM)機能を備えたポリシーモデルを提案する。
さらに,検索効率を向上し,並列化を向上するストリーミング・ルック・アヘッド (SLA) アルゴリズムを提案する。
SLAとDPOなどの強化微調整技術を組み合わせると、全体の勝利率は89.4%となる。
論文 参考訳(メタデータ) (2025-02-24T22:35:53Z) - Time-series Generation by Contrastive Imitation [87.51882102248395]
モーメントマッチングの目的によってモチベーションされ、複合的エラーを軽減し、局所的(しかし前方的な)遷移ポリシーを最適化する。
推論において、学習されたポリシーは反復的なサンプリングのジェネレータとして機能し、学習されたエネルギーはサンプルの品質を評価するための軌道レベル尺度として機能する。
論文 参考訳(メタデータ) (2023-11-02T16:45:25Z) - Large Scale Time-Series Representation Learning via Simultaneous Low and
High Frequency Feature Bootstrapping [7.0064929761691745]
本稿では,非コントラスト型自己教師型学習手法を提案する。
提案手法は生の時系列データを入力として、モデルの2つのブランチに対して2つの異なる拡張ビューを生成する。
モデルの堅牢性を実証するために,5つの実世界の時系列データセットに関する広範な実験とアブレーション研究を行った。
論文 参考訳(メタデータ) (2022-04-24T14:39:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。