論文の概要: Memorize, Adapt, Ignore: Diagnosing Robot Learning Mechanisms under Training Data Variation
- arxiv url: http://arxiv.org/abs/2609.38401v1
- Date: Tue, 29 Sep 2026 18:57:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:26.618884
- Title: Memorize, Adapt, Ignore: Diagnosing Robot Learning Mechanisms under Training Data Variation
- Title(参考訳): 記憶・適応・イグノア:学習データ変化によるロボット学習メカニズムの診断
- Abstract要約: トレーニングデータのバリエーションは、ロボット操作ポリシーの堅牢性を改善するためのレバーである。
本研究では,ケーススタディによるランダム化機構,オブジェクトサイズ,色,タイプ,シーンライティング,言語的プロンプトなどを検討した。
これらの診断法を用いて、DRスキームの設計、モデルの選択、ショートカット学習の検出のための実践的なガイダンスを開発する。
- 参考スコア(独自算出の注目度): 17.25277846805701
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Training data variation, whether through designing a domain randomization (DR) scheme in simulation or curating demonstrations for imitation learning, is a primary lever for improving the robustness of robotic manipulation policies. Yet its underlying mechanisms remain poorly understood, and practitioners typically select randomization parameters through expensive trial and error. We investigate these mechanisms through a series of case studies, randomizing object size, color, and type as well as scene lighting and linguistic prompts across settings including pick-and-place RL in ManiSkill and fine-tuning of vision-language-action (VLA) models on LIBERO and RoboTwin. We examine both model behavior and internal representations, using the empirical neural tangent kernel (NTK) as our primary diagnostic tool. We show that the NTK distinguishes a shift in the internal learning mechanism from \textit{memorizing} different situations with insufficient variation (e.g.\ learning what to do for a large cube, and what to do for a small cube) to \textit{adapting} to the situation at hand with sufficient variation. An NTK-based signal-to-noise ratio also helps distinguish when policies have learned to \emph{ignore} task-irrelevant factors (e.g.\ treating blue and red cubes identically, instead of learning a blue sub-policy and a red sub-policy). We use these diagnostics to develop practical guidance for designing DR schemes, selecting models, and detecting shortcut learning. We further compare different kinds of representations and validate our findings with real-world hardware experiments using ACT-based imitation learning.
- Abstract(参考訳): シミュレーションにおいてドメインランダム化(DR)スキームを設計したり、模倣学習のための実演をキュレートしたりすることで、データのばらつきを訓練することは、ロボット操作ポリシーの堅牢性を改善するための主要なレバーである。
しかし、その基盤となるメカニズムは理解されていないままであり、実践者は一般的に高価な試行錯誤によってランダム化パラメータを選択する。
LIBERO と RoboTwin を用いた視覚言語モデル (VLA) の微調整や,マニスキルのピック・アンド・プレース・RL など,シーンライティングや言語的プロンプトなどの一連のケーススタディを通じて,これらのメカニズムを検証した。
実験的ニューラルネットワークカーネル (NTK) を主診断ツールとして, モデル行動と内部表現の両方について検討した。
NTKは,内部学習機構を,大立方体に対して何をすべきか,小立方体に対して何をすべきかを学習するなど,変化が不十分な状況(例えば,大きな立方体に対して何をすべきかを学習する)から,十分な変動を伴う状況へのシフトを区別する。
NTKベースの信号対雑音比は、政策がタスク非関連因子(例えば、青と赤の立方体を同じ扱いをする。
これらの診断法を用いて、DRスキームの設計、モデルの選択、ショートカット学習の検出のための実践的なガイダンスを開発する。
さらに,様々な種類の表現を比較し,ACTを用いた模倣学習を用いて実世界のハードウェア実験と比較した。
関連論文リスト
- An offline approach to fNIRS-guided reinforcement learning for robot behavior [2.933736356368701]
ヒューマン・イン・ザ・ループ強化学習(Human-in-the-loop Reinforcement Learning)は、ロボットの動作をユーザの好みに合わせて訓練、微調整、調整するための一般的なアプローチとなっている。
本稿では,FNIRS(Functional near-infrared spectroscopy)による脳信号を用いたシミュレーションロボット学習の実現可能性について検討する。
論文 参考訳(メタデータ) (2026-07-15T22:12:39Z) - Diversity You Can Actually Measure: A Fast, Model-Free Diversity Metric for Robotics Datasets [12.45101201787042]
ロボット模倣学習におけるデータセットの多様性が一般化性能に与える影響について検討する。
本稿では、エントロピーを最大化するデモのサブセットを選択するデータキュレーションアルゴリズムであるFAKTUALを紹介する。
FAKTUALは,ロボット模倣学習において,データセットの多様性を理解し,改善するための実用的なツールであることが示唆された。
論文 参考訳(メタデータ) (2026-03-12T07:54:43Z) - Rethinking Visual-Language-Action Model Scaling: Alignment, Mixture, and Regularization [65.37179698521766]
VLA(Vision-Language-Action)モデルは、ジェネラリストロボットの制御を強く約束する。
標準的な「スケールデータ」レシピがロボット工学に翻訳されるかどうかはまだ不明だ。
本稿では,多様なロボットを対象とした事前学習のためのコアトレーニング選択を再考する,VLAスケーリングの体系的かつ制御された研究を提案する。
論文 参考訳(メタデータ) (2026-02-10T12:25:43Z) - Learning Causal Structure Distributions for Robust Planning [53.753366558072806]
構造情報の不確実性を考慮しながら,機能的関係を学習することで,より堅牢な力学モデルがもたらされることがわかった。
これは、因果構造を無視し、ロボットシステムにおける相互作用の空間性を活用するのに失敗する一般的なモデル学習手法とは対照的である。
本稿では,本モデルを用いてロボットの力学を学習し,新しい環境下での新たな作業を行うためのサンプリング・ベース・プランナーを併用することを提案する。
論文 参考訳(メタデータ) (2025-08-08T22:43:17Z) - Internal Causal Mechanisms Robustly Predict Language Model Out-of-Distribution Behaviors [61.92704516732144]
正当性予測の最も堅牢な特徴は、モデルの振舞いに特徴的な因果的役割を果たすものであることを示す。
モデル出力の正しさを予測するために因果メカニズムを利用する2つの手法を提案する。
論文 参考訳(メタデータ) (2025-05-17T00:31:39Z) - Shortcut Learning Susceptibility in Vision Classifiers [11.599035626374409]
ショートカット学習は、機械学習モデルが意味のある特徴をキャプチャする代わりに、データの急激な相関を利用する場所である。
本研究では,クラスラベルと位置と強度の相関関係にあるデータセットに意図的にショートカットを導入する。
異なる学習率で学習をショートカットする可能性を評価する。
論文 参考訳(メタデータ) (2025-02-13T10:25:52Z) - Real-to-Sim: Predicting Residual Errors of Robotic Systems with Sparse
Data using a Learning-based Unscented Kalman Filter [65.93205328894608]
我々は,動的・シミュレータモデルと実ロボット間の残差を学習する。
学習した残差誤差により、動的モデル、シミュレーション、および実際のハードウェア間の現実的ギャップをさらに埋めることができることを示す。
論文 参考訳(メタデータ) (2022-09-07T15:15:12Z) - Multi-Branch Deep Radial Basis Function Networks for Facial Emotion
Recognition [80.35852245488043]
放射状基底関数(RBF)ユニットによって形成された複数の分岐で拡張されたCNNベースのアーキテクチャを提案する。
RBFユニットは、中間表現を用いて類似のインスタンスで共有される局所パターンをキャプチャする。
提案手法は,提案手法の競争力を高めるためのローカル情報の導入であることを示す。
論文 参考訳(メタデータ) (2021-09-07T21:05:56Z) - On the Robustness of Active Learning [0.7340017786387767]
Active Learningは、機械学習アルゴリズムをトレーニングする上で最も有用なサンプルを特定する方法に関するものだ。
十分な注意とドメイン知識を持っていないことがよくあります。
そこで本研究では,Simpson の多様性指標に基づく新たな "Sum of Squared Logits" 手法を提案する。
論文 参考訳(メタデータ) (2020-06-18T09:07:23Z) - Learning What Makes a Difference from Counterfactual Examples and
Gradient Supervision [57.14468881854616]
ニューラルネットワークの一般化能力を改善するための補助的学習目標を提案する。
我々は、異なるラベルを持つ最小差の例のペア、すなわち反ファクトまたはコントラストの例を使用し、タスクの根底にある因果構造を示す信号を与える。
このテクニックで訓練されたモデルは、配布外テストセットのパフォーマンスを向上させる。
論文 参考訳(メタデータ) (2020-04-20T02:47:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。