論文の概要: It's Not Just More Demos: Counterfactual Action Sensitivity Coverage for Data-Efficient Robust Robot Imitation
- arxiv url: http://arxiv.org/abs/2607.27261v1
- Date: Wed, 29 Jul 2026 05:55:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.273213
- Title: It's Not Just More Demos: Counterfactual Action Sensitivity Coverage for Data-Efficient Robust Robot Imitation
- Title(参考訳): データ効率の良いロバスト・ロボット・イミテーションのための非現実的行動感度カバー
- Authors: Giovanni D'urso, Kaushik Roy, Nicholas Lawrance, Brendan Tidd,
- Abstract要約: 補修の堅牢性を目標としたCFNBC(Counterfactual Nuisance Behaviour Cloning)を提案する。
CFNBCは、クリーンなデモンストレーションで訓練された名目上のポリシーから始まり、ペア化されたクリーンでニュアンスな観察を生成する。
We show in MuJoCo bimanual cube transfer and SimplerEnv stacking that action drift correlation with nuisance-induced failure。
- 参考スコア(独自算出の注目度): 6.656753488329094
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visuomotor imitation learning has demonstrated success for manipulation tasks. However, the trained policies remain brittle to visual `nuisances', with even minor task-preserving variations such as lighting, distractions or changes in colour result in heavy degradation of the trained policy's performance. While increasing data diversity can improve robustness, it is unclear which additional demonstrations are informative for a particular trained policy. We propose Counterfactual Nuisance Behaviour Cloning (CFNBC), an offline data-selection framework for targeted robustness repair. Starting from a nominal policy trained on `clean' demonstrations, CFNBC generates paired clean and nuisance observations that preserve the expert action, then measures \emph{action drift}: the change in the policy's predicted action under a nuisance that should not alter the desired behaviour. This provides a policy-specific sensitivity signal for selecting a compact, response-diverse repair set from a larger candidate pool, without requiring rollout success labels or online policy execution. We show in MuJoCo bimanual cube transfer and SimplerEnv cube stacking that action drift correlates with nuisance-induced failure, and that response-guided repair with only $20$--$30$ selected candidates substantially outperforms matched-budget random selection while approaching the performance of much larger random repair budgets. These results support a data-centric view of robustness repair: the most useful data are not necessarily the most numerous, visually diverse, or obviously difficult, but the examples that cover fragile response modes of the current policy.
- Abstract(参考訳): 視覚運動模倣学習は操作タスクに成功している。
しかし、訓練されたポリシーは視覚的な「問題」に対して脆弱であり、照明、注意散らし、色の変化といった小さなタスク保存のバリエーションでさえも、訓練されたポリシーのパフォーマンスを著しく低下させる。
データ多様性の増大はロバスト性を改善することができるが、特定の訓練されたポリシーに対して、どのような追加のデモンストレーションが有益なのかは不明だ。
本稿では,ロバストネス修復を目的としたオフラインデータ選択フレームワークCFNBCを提案する。
CFNBCは、'クリーン'なデモンストレーションで訓練された名目上のポリシーから始まり、専門家の行動を保存するためのペア化されたクリーンかつニュアンスな観察を生成し、次に、望まれる行動を変更すべきでないニュアンスの下で、ポリシーの予測されたアクションの変化を測る。
これは、ロールアウト成功ラベルやオンラインポリシー実行を必要とせず、より大きな候補プールからコンパクトでレスポンスの異なる修復セットを選択するためのポリシー固有の感度信号を提供する。
両立方体移動とSimplerEnv立方体積み重ねにおいて、動作ドリフトはニュアンスによる故障と相関し、応答誘導型補修は20ドル~30ドルしかなく、より大きなランダムな補修予算の性能に近づきつつ、一致したランダム選択を実質的に上回っていることを示す。
これらの結果は、ロバストネス修復に関するデータ中心の見解を支持している。最も有用なデータは、必ずしも最も多く、視覚的に多様で、明らかに難しいものではなく、現在のポリシーの脆弱な応答モードをカバーする例である。
関連論文リスト
- Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training [50.86545293331458]
強化学習は、教師付き学習よりも構造的に難しい。
本稿では,固定クリッピングを政策比率の正規化された有効サンプルサイズに置き換える,単純かつ効果的なバッチ適応目的を提案する。
論文 参考訳(メタデータ) (2026-05-12T16:44:47Z) - DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation [45.9370934377402]
強化学習は、大きな言語モデルの推論能力を改善するが、コストがかかり、サンプル非効率である。
我々は,自己正規化重要度サンプリングを通じて,政策と難易度推定を共進化させるフレームワーク**Dare*を提案する。
複数のモデルやドメインにわたる実験では、**Dare**はトレーニング効率、最終的な有効性、推論効率において、既存のメソッドよりも一貫して優れています。
論文 参考訳(メタデータ) (2026-05-09T22:05:59Z) - Behaviour Policy Optimization: Provably Lower Variance Return Estimates for Off-Policy Reinforcement Learning [52.97053840476386]
我々は、よく設計された行動ポリシーを用いて、分散リターン推定を確実に低くするために、政治外のデータを収集できることを示します。
我々は、この重要な洞察を、政策評価と改善の両方がインターリーブされるオンライン強化学習環境に拡張する。
論文 参考訳(メタデータ) (2025-11-13T23:06:40Z) - Mind the Gap: Data Rewriting for Stable Off-Policy Supervised Fine-Tuning [33.899779762210976]
大規模言語モデルの教師付き微調整(SFT)は、非政治的な学習問題と見なすことができる。
既存の方法では、ギャップを積極的に減らすのではなく、パッシブに更新するKLペナルティやクリッピングによってこの問題を軽減する。
本稿では,トレーニング前の政策ギャップを積極的に縮小する,シンプルで効果的なデータ書き換えフレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-18T17:02:30Z) - Towards Model Resistant to Transferable Adversarial Examples via Trigger Activation [95.3977252782181]
知覚不能な摂動によって特徴づけられる敵対的な例は、彼らの予測を誤解させることで、ディープニューラルネットワークに重大な脅威をもたらす。
本稿では,移動可能な敵例(TAE)に対して,より効率的かつ効果的に堅牢性を高めることを目的とした,新たなトレーニングパラダイムを提案する。
論文 参考訳(メタデータ) (2025-04-20T09:07:10Z) - DiveR-CT: Diversity-enhanced Red Teaming Large Language Model Assistants with Relaxing Constraints [68.82294911302579]
DiveR-CTを導入し、目的と意味の報酬に対する従来の制約を緩和し、多様性を高める政策により大きな自由を与える。
実験では,1)様々な攻撃成功率の多様な多様性指標において優れたデータを生成すること,2)収集したデータに基づく安全性チューニングによる青チームモデルのレジリエンスの向上,3)信頼性と制御可能な攻撃成功率に対する目標重みの動的制御,3)報酬過大化に対する感受性の低下など,ベースラインよりも優れたDiveR-CTの顕著な優位性を実証した。
論文 参考訳(メタデータ) (2024-05-29T12:12:09Z) - Bayesian Inverse Transition Learning for Offline Settings [30.10905852013852]
強化学習は、医療や教育などの領域におけるシーケンシャルな意思決定に一般的に用いられる。
我々は、遷移力学の後方分布を確実に学習するために、デシダラタを捕捉する新しい制約ベースのアプローチを提案する。
その結果、制約を用いることで、高いパフォーマンスのポリシーを学習し、異なるデータセットに対するポリシーのばらつきを著しく低減することを示した。
論文 参考訳(メタデータ) (2023-08-09T17:08:29Z) - Offline Imitation Learning with Suboptimal Demonstrations via Relaxed
Distribution Matching [109.5084863685397]
オフライン模倣学習(IL)は、環境と相互作用することなく、事前にコンパイルされたデモからパフォーマンスポリシーを学習する機能を提供する。
非対称な f-分割を明示的なサポート正規化に用いたRelaxDICEを提案する。
提案手法は,6つの標準連続制御環境において,最上位のオフライン手法を著しく上回っている。
論文 参考訳(メタデータ) (2023-03-05T03:35:11Z) - Sales Channel Optimization via Simulations Based on Observational Data
with Delayed Rewards: A Case Study at LinkedIn [4.6405223560607105]
ランダム化実験から得られたデータに関するトレーニングモデルは、良い決定を下すのに最適である。
しかし、ランダム化実験は、しばしば時間を要する、コストがかかる、リスクが高い、実現不可能、または非倫理的である。
問題の特徴を扱える離散時間シミュレーションを構築し、異なるポリシーを評価するために使用します。
シミュレーションの結果,シンプルなMABポリシであるLinUCBは,他のポリシよりも一貫して優れていたことが示唆された。
論文 参考訳(メタデータ) (2022-09-16T07:08:37Z) - DDPG++: Striving for Simplicity in Continuous-control Off-Policy
Reinforcement Learning [95.60782037764928]
過大評価バイアスが制御される限り、単純な決定論的政策勾配は著しく機能することを示す。
第二に、非政治的なアルゴリズムの典型であるトレーニングの不安定性を、欲張りのポリシー更新ステップに向ける。
第3に、確率推定文学におけるアイデアは、リプレイバッファからの重要サンプル遷移や、性能劣化を防ぐためのポリシー更新に利用できることを示す。
論文 参考訳(メタデータ) (2020-06-26T20:21:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。