論文の概要: UR-VC: Unsupervised Robotic Value Correction for Time-Derived Progress Proxies
- arxiv url: http://arxiv.org/abs/2607.12892v1
- Date: Tue, 14 Jul 2026 15:33:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.195837
- Title: UR-VC: Unsupervised Robotic Value Correction for Time-Derived Progress Proxies
- Title(参考訳): UR-VC:時間依存プログレッシブプロキシのための教師なしロボット価値補正
- Abstract要約: 非教師付きロボット価値補正(UR-VC: Unsupervised Robotic Value Correction)は、時間由来の進捗ラベルを修正するオフラインでトレーニング不要な手法である。
UR-VCは、デモデータの単純な規則性を利用する: 同様の状態は、しばしば異なるエピソード間で再帰するが、異なるタイムスタンプで発生する。
UR-VCは、タスクの全体的な傾向を保ちながら、正規化された時間では表現できない局所回帰と非一様進行をキャプチャする。
- 参考スコア(独自算出の注目度): 38.09629148382951
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern robot learning systems increasingly rely on dense progress or value signals to evaluate intermediate states, guide policy learning, and detect task completion, making the quality of these signals critical. Since such dense labels are rarely available at scale, normalized time within a demonstration is often used as a scalable substitute: later frames are treated as higher progress. However, this time-derived label is only a noisy proxy for physical task progress. In contact-rich manipulation, a robot may make progress and then lose it through slips, failed grasps, or partial undoing, while the time-derived label continues to increase monotonically. We introduce Unsupervised Robotic Value Correction (UR-VC), an offline, training-free method for correcting time-derived progress labels. UR-VC exploits a simple regularity in demonstration data: similar states often recur across different episodes, but at different timestamps. Instead of trusting the timestamp from a single trajectory, UR-VC retrieves similar states from other episodes and aggregates their time-derived labels to obtain a corrected progress estimate. UR-VC requires no manual progress labels, reward annotations, or additional value model. We evaluate UR-VC on real bimanual cloth flatten-and-fold data, a long-horizon deformable-object manipulation task with visible intermediate progress. The corrected labels capture local regressions and non-uniform progress that normalized time cannot represent, while preserving the overall task trend. We further use the corrected signal to construct advantage labels for VLA training, following recent advantage-conditioned policy learning. UR-VC shows a positive trend in real-robot task success under matched data, model, and training settings.
- Abstract(参考訳): 現代のロボット学習システムは、中間状態の評価、政策学習の指導、タスク完了の検知に高密度な進歩や価値信号にますます依存し、これらの信号の品質を重要視している。
このような高密度ラベルを大規模に利用することは滅多にないため、デモ内での正規化時間はスケーラブルな代替品としてしばしば使用され、後続のフレームはより高い進歩として扱われる。
しかし、この時間由来のラベルは、物理的なタスクの進行に対するノイズの多いプロキシに過ぎない。
接触に富んだ操作では、ロボットは前進し、スリップやグリップの失敗、あるいは部分的な解凍によって失う。
非教師付きロボット価値補正(UR-VC: Unsupervised Robotic Value Correction)は、時間由来の進捗ラベルを修正するオフラインでトレーニング不要な手法である。
UR-VCは、デモデータの単純な規則性を利用する: 同様の状態は、しばしば異なるエピソード間で再帰するが、異なるタイムスタンプで発生する。
1つの軌跡からタイムスタンプを信頼する代わりに、UR-VCは他のエピソードから類似した状態を回収し、時間由来ラベルを集約して修正された進捗推定値を得る。
UR-VCは手動の進捗ラベル、報酬アノテーション、付加価値モデルを必要としない。
両面の布を平らかつ折りたたみしたデータに対してUR-VCを評価し, 中間進行を可視化した長軸変形可能な物体操作タスクについて検討した。
修正されたラベルは、タスクの全体的な傾向を保ちながら、正規化された時間では表現できない局所回帰と非一様進行をキャプチャする。
また,近年のベネフィット条件付き政策学習に続いて,VLAトレーニングのためのベネフィットラベルを構築するために,補正信号を用いた。
UR-VCは、マッチしたデータ、モデル、トレーニング設定下での実際のロボットタスクの成功の傾向を示す。
関連論文リスト
- RoboDrop: Curating VLA Post-Training Data via Local Gradient Compatibility [17.469738521824905]
データキュレーションフレームワークであるtextscRoboDropを導入し、トレーニング軌道に沿って測定された局所的な勾配互換性を用いて監督を監査する。
我々は,RoboDropを制御された観測行動の破損,シミュレーションにおける自然な準最適実証,および非専門的なコレクションエラーを含む実ロボットデータセットで評価した。
論文 参考訳(メタデータ) (2026-09-09T10:55:10Z) - FailureSpot: Label-Efficient Timestamp-Level Failure Detection for Vision-Language-Action Models [12.030216781017558]
視覚言語アクション(VLA)ポリシーは、長時間の水平実行中に予測不可能に失敗する可能性がある。
本稿では、まずラベルのないVLAアクションチャンクを利用して弱い監視信号を構築するデータ効率のフレームワークを提案する。
次に、アクティブラーニングを使用して、タイムスタンプレベルのアノテーションに対して最も不確実な軌跡のみを選択する。
論文 参考訳(メタデータ) (2026-09-03T00:04:06Z) - Decoding Task Progress from VLA Representations [12.825554247171903]
我々は,残余の$_0.5$を探索し,正常化時間であるタスク進行が活性化から線形に可読であることを示す。
単一の線形プローブは、目に見えないタスクに一般化し、マルチプロンプトデータで訓練された場合、言語カウンターファクトの下で変化する。
我々はこのプローブを単純なラベルのないOOD検出器として使用し、停止したタスクの進捗を検知し、最先端の手法と競合することを示す。
論文 参考訳(メタデータ) (2026-08-13T16:58:29Z) - WARP-RM: A Warp-Augmented Relative Progress Reward Model for Data Curation [16.464426150252255]
本稿では,密集度,符号付き相対進行度を学習するための完全自己教師付きアルゴリズムであるWARP(Warp-Augmented Relative Progress)を提案する。
WARPは、実演の時間ワープ拡張によりフレームごとの進捗目標を生成し、WARP-RMをトレーニングし、入力フレーム間の正規化経過時間を予測する。
次に,これらのスカラー報酬推定値を利用したWARP-BCを導入する。
論文 参考訳(メタデータ) (2026-06-26T17:58:06Z) - Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation [38.88183703128359]
混在型ロボットのデモから誤検知値関数を学習するフレームワークであるReTVL(ReTry-Supervised Value Learning)を提案する。
ReTVLは、グローバルプログレスキャリブレーションとローカルなペアワイズ選好学習を組み合わせることで、ミスに伴う局所的な劣化・回復構造をキャプチャする。
実ロボット操作タスクの実験では、ReTVLは進捗ベースのベースラインよりもよりきめ細かな値推定を生成する。
論文 参考訳(メタデータ) (2026-06-23T14:27:10Z) - ProgressVLA: Progress-Guided Diffusion Policy for Vision-Language Robotic Manipulation [57.07494675832939]
ロボット操作のための既存の視覚言語アクション(VLA)モデルは、進歩意識を欠いている。
本研究では,textbf vla という新しいモデルを提案し,タスク進捗の推定と統合について検討する。
CALVINとLIBEROベンチマークの実験は、実世界のロボットの展開とともに、成功率の大幅な改善を一貫して示している。
論文 参考訳(メタデータ) (2026-03-29T12:38:11Z) - CLAM: Continuous Latent Action Models for Robot Learning from Unlabeled Demonstrations [11.604546089466734]
模倣学習を用いたロボットポリシーの学習には、高価なアクションラベル付きエキスパートのデモを大量に収集する必要がある。
有望なアプローチは、例えばビデオデモから教師なしの方法で潜在アクションラベルを学習するといった、ラベルなしの観測の多さを活用することである。
我々は、ラベルのない観測データから複雑な連続制御タスクを解くのに必要な2つの重要な要素を組み込んだ連続潜時行動モデル(CLAM)を設計する。
論文 参考訳(メタデータ) (2025-05-08T07:07:58Z) - PTCL: Pseudo-Label Temporal Curriculum Learning for Label-Limited Dynamic Graph [22.78831582526477]
動的ノード分類は、金融トランザクションや学術的なコラボレーションのような進化するシステムをモデル化するために重要である。
アノテーションのコストとラベルの不確実性のため,すべての動的ラベルを現実のシナリオで収集することは困難である。
本稿では,ラベル制限付き動的ノード分類の先駆的手法であるPTCLを提案する。
論文 参考訳(メタデータ) (2025-04-24T15:11:41Z) - Vision Language Models are In-Context Value Learners [89.29486557646624]
本稿では、視覚言語モデル(VLM)に埋め込まれた世界的知識を活用してタスクの進捗を予測する普遍的価値関数推定器である生成価値学習(GVL)を提案する。
ロボットやタスク固有のトレーニングがなければ、GVLは300以上の異なる現実世界のタスクに対して、ゼロショットと数ショットの効果的な値をインコンテキストで予測することができる。
論文 参考訳(メタデータ) (2024-11-07T09:17:50Z) - Label Delay in Online Continual Learning [77.05325581370893]
しばしば見過ごされる重要な側面はラベルの遅延であり、遅くてコストのかかるアノテーションプロセスのために新しいデータがラベル付けされない可能性がある。
本稿では,データとラベルストリーム間のラベル遅延を,時間経過とともに明示的にモデル化した新しい連続学習フレームワークを提案する。
提案手法はラベル遅延係数に最も影響を受けていないことを示し、場合によっては非遅延の精度を回復させる。
論文 参考訳(メタデータ) (2023-12-01T20:52:10Z) - Losses over Labels: Weakly Supervised Learning via Direct Loss
Construction [71.11337906077483]
プログラム可能な弱い監視は、機械学習のパラダイムとして成長している。
ラベルの中間ステップを経由することなく,直接損失を発生させるため,ラベルのロバスト・オーバー・ラベル(Losses over Labels, LoL)を提案する。
いくつかのベンチマークテキストおよび画像分類タスクにおいて、LoLは既存の弱い監督手法を改善していることを示す。
論文 参考訳(メタデータ) (2022-12-13T22:29:14Z) - A Closer Look at Temporal Sentence Grounding in Videos: Datasets and
Metrics [70.45937234489044]
2つの広く使用されているTSGVデータセット(Charades-STAとActivityNet Captions)を再編成し、トレーニング分割と異なるものにします。
基本的なIoUスコアを校正するために、新しい評価基準「dR@$n$,IoU@$m$」を導入する。
すべての結果は、再編成されたデータセットと新しいメトリクスがTSGVの進捗をよりよく監視できることを示している。
論文 参考訳(メタデータ) (2021-01-22T09:59:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。