論文の概要: Distillation for Efficient Multitask Manipulation Policies via Conditional Flow Matching
- arxiv url: http://arxiv.org/abs/2609.28107v2
- Date: Thu, 24 Sep 2026 10:40:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.364982
- Title: Distillation for Efficient Multitask Manipulation Policies via Conditional Flow Matching
- Title(参考訳): 条件付きフローマッチングによる効率的なマルチタスクマニピュレーションポリシの蒸留
- Abstract要約: 専門的なデモンストレーションで訓練された条件付きフローマッチング(CFM)は、ロボット操作ベンチマークにおける既存の手法より優れていることが示されている。
タスク毎の独立モデルのトレーニングは計算コストがかかるため,マルチタスクの観点から問題を考察する。
我々は,学習速度場を伝達することで,単一タスクのCFM専門家から知識を共有マルチタスクポリシーに抽出することを提案する。
- 参考スコア(独自算出の注目度): 14.907781271119061
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Advances in generative modeling have recently been extensively employed in robotics for policy learning. In particular, Conditional Flow Matching (CFM) trained with expert demonstrations has been shown to outperform existing methods on robot manipulation benchmarks. While prior work has mainly focused on single-task settings, we study the problem from a multi-task perspective, as training independent models for each task is computationally expensive. Multi-Task policy learning comes with its own set of challenges, as naively training on a concatenated dataset of demonstrations would either require increased model capacity to accommodate the added complexity or result in drops in performance. We propose to distill knowledge from single-task CFM experts into a shared multi-task policy by transferring their learned velocity fields. We combine this distillation signal with the original CFM objective to retain fidelity to the demonstrations. Experiments on RLBench show that our approach improves multi-task policy performance over naive training while maintaining a fixed model size.
- Abstract(参考訳): 生成モデリングの進歩は、政策学習のためのロボティクスに広く採用されている。
特に、専門的なデモンストレーションで訓練された条件付きフローマッチング(CFM)は、ロボット操作ベンチマークにおける既存の手法よりも優れていることが示されている。
従来の作業は主にシングルタスク設定に重点を置いてきたが,タスク毎に独立したモデルをトレーニングすることは計算コストがかかるため,マルチタスクの観点から問題を研究している。
マルチタスクのポリシ学習には独自の課題が伴う。複合的なデータセットのトレーニングは、追加の複雑さに対応するためにモデルのキャパシティを増大させるか、パフォーマンスの低下をもたらす。
我々は,学習速度場を移譲することで,単一タスクのCFM専門家の知識を共有マルチタスクポリシーに抽出することを提案する。
我々は,この蒸留信号を元のCFM目標と組み合わせて,実演への忠実性を維持する。
RLBenchの実験から,本手法はモデルサイズを一定に保ちながら,ナイーブトレーニングよりもマルチタスクポリシーの性能を向上させることが示された。
関連論文リスト
- Building Multi-Task Agentic LLMs via Two-Phase Distillation [21.49278503690581]
まず、個別のタスクに対してRLエキスパートを個別に訓練し、蒸留により統合することで、そのようなモデルを構築する方法を示す。
我々は, 前方KLのモード被覆特性により, マルチタスク環境下での非政治蒸留が劣化することを示す。
本稿では, オフ・ポリケーション蒸留とオン・ポリケーション精製という2段階の手法を提案する。
論文 参考訳(メタデータ) (2026-06-29T09:36:24Z) - Data-Efficient Multitask DAgger [15.497645748861913]
多くのタスクを実行できる汎用的なロボットポリシーは、訓練に広範囲な専門的なデータやシミュレーションを必要とする。
本稿では,複数のタスク固有の専門家ポリシーから単一のマルチタスクポリシーを抽出する,データ効率の良いマルチタスクDAggerフレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-29T20:17:35Z) - Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners [60.75160178669076]
オンライン強化学習におけるタスク干渉の問題に対して,クロスエントロピーを用いて訓練し,学習可能なタスク埋め込みを条件とした高容量値モデルの使用が課題であることを示す。
280以上のユニークなタスクを持つ7つのマルチタスクベンチマークで、高い自由度ヒューマノイド制御と離散視覚ベースのRLにまたがるアプローチを検証した。
論文 参考訳(メタデータ) (2025-05-29T06:41:45Z) - SyMerge: From Non-Interference to Synergistic Merging via Single-Layer Adaptation [28.417947631789783]
SyMergeは1つのタスク固有のレイヤとマージ係数を共同で最適化する軽量フレームワークである。
SyMergeは、ビジョン、密度予測、NLPベンチマークを越えて最先端の結果を達成する。
論文 参考訳(メタデータ) (2024-12-26T07:42:06Z) - Mastering Robot Manipulation with Multimodal Prompts through Pretraining and Multi-task Fine-tuning [49.92517970237088]
我々はマルチモーダルなプロンプトを理解するためにロボットを訓練する問題に取り組む。
このようなタスクは、視覚と言語信号の相互接続と相補性を理解するロボットの能力にとって大きな課題となる。
マルチモーダルプロンプトを用いてロボット操作を行うためのポリシーを学習する効果的なフレームワークを提案する。
論文 参考訳(メタデータ) (2023-10-14T22:24:58Z) - AdaMerging: Adaptive Model Merging for Multi-Task Learning [68.75885518081357]
本稿では,Adaptive Model Merging (AdaMerging)と呼ばれる革新的な手法を紹介する。
本来のトレーニングデータに頼ることなく、タスクレベルでも階層的にも、モデルマージの係数を自律的に学習することを目指している。
AdaMergingは、現在の最先端のタスク演算のマージ方式と比較すると、パフォーマンスが11%向上している。
論文 参考訳(メタデータ) (2023-10-04T04:26:33Z) - Diffusion Model is an Effective Planner and Data Synthesizer for
Multi-Task Reinforcement Learning [101.66860222415512]
Multi-Task Diffusion Model (textscMTDiff) は、トランスフォーマーのバックボーンを組み込んだ拡散に基づく手法であり、生成計画とデータ合成のための素早い学習を行う。
生成計画において、textscMTDiffはMeta-World上の50のタスクとMaze2D上の8のマップで最先端のアルゴリズムより優れています。
論文 参考訳(メタデータ) (2023-05-29T05:20:38Z) - Effective Adaptation in Multi-Task Co-Training for Unified Autonomous
Driving [103.745551954983]
本稿では,3つの下流タスクにおけるMoCoやSimCLRなど,多種多様な自己監督手法の転送性能について検討する。
彼らのパフォーマンスは、サブ最適か、あるいはシングルタスクベースラインよりもはるかに遅れていることに気付きました。
汎用マルチタスクトレーニングのための,単純かつ効果的な事前訓練-適応-ファインチューンパラダイムを提案する。
論文 参考訳(メタデータ) (2022-09-19T12:15:31Z) - TempLe: Learning Template of Transitions for Sample Efficient Multi-task
RL [18.242904106537654]
TempLeはマルチタスク強化学習のための最初のPAC-MDP法である。
オンライン" と "有限モデル" の2つのアルゴリズムをそれぞれ提示する。
提案したTempLeアルゴリズムは,シングルタスク学習者や最先端のマルチタスク手法よりもはるかに低いサンプリング複雑性を実現する。
論文 参考訳(メタデータ) (2020-02-16T19:46:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。