論文の概要: Macro-Operator Generation and Predicate Selection for TAMP Operator Learning
- arxiv url: http://arxiv.org/abs/2608.23629v2
- Date: Fri, 28 Aug 2026 10:25:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.070174
- Title: Macro-Operator Generation and Predicate Selection for TAMP Operator Learning
- Title(参考訳): TAMP演算子学習のためのマクロ演算子生成と述語選択
- Authors: Can Emir Bora, Emre Ugur,
- Abstract要約: 手動でシンボリック演算子を作成することは、タスク・アンド・モーション・プランニングシステムのデプロイにおける主要なボトルネックの1つです。
しかし、既存のメソッドは通常、それぞれのアクションを独立して学習し、操作タスクの繰り返し発生するマルチステップ構造をキャプチャできない。
本稿では,マクロ演算子の自動生成を主成分とするシステムを提案する。
- 参考スコア(独自算出の注目度): 1.3177681589844814
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Creating symbolic operators by hand is one of the main bottlenecks in deploying Task and Motion Planning systems (TAMP). Recent works show that these operators can instead be learned directly from demonstration data. Existing methods, however, typically learn each action in isolation and cannot capture the recurring multi-step structure of manipulation tasks, so the search becomes intractable on long sequential tasks. A further inefficiency arises in the symbolic state: every provided predicate is evaluated at every search node, even when it never appears in any learned operator. We present a system that addresses both problems together. Its central component is the automatic generation of macro-operators, composite actions that compress a recurring sequence of individual actions into a single planning step. Our system discovers causally linked action pairs directly from the training data, where one action produces exactly the condition that the next one requires, and turns each pair into a new operator. Alongside this, our system prunes every predicate that no learned operator references, which shrinks the symbolic state evaluated at each search node. Together, these changes shorten the effective planning horizon, and the benefit they bring grows with the length of the task. Across four TAMP domains, our method reaches up to a 4.6x planning speedup compared to the baseline method, namely Learning Operators for TAMP. More importantly, it solves a long sequential task that the baseline cannot solve. Macro-operator discovery thus not only accelerates planning but, in certain domains, determines solvability in practice.
- Abstract(参考訳): 手動でシンボル演算子を作成することは、タスク・アンド・モーション・プランニング・システム(TAMP)のデプロイにおける主要なボトルネックの1つである。
近年の研究では、これらの演算子を直接実演データから学習できることが示されている。
しかし、既存の手法では、通常、各アクションを個別に学習し、繰り返し発生する操作タスクのマルチステップ構造をキャプチャできないため、長いシーケンシャルなタスクでは検索が難しくなる。
与えられたすべての述語は、学習した演算子に現れない場合でも、全ての探索ノードで評価される。
両問題を共に扱うシステムを提案する。
その中心となるコンポーネントはマクロ演算子の自動生成であり、個々のアクションの繰り返しシーケンスを単一の計画ステップに圧縮する複合アクションである。
我々のシステムはトレーニングデータから直接因果的にリンクされたアクションペアを発見し、そこでは1つのアクションが次のアクションが要求する条件を正確に生成し、各ペアを新しい演算子に変える。
これに加えて、我々のシステムは、学習した演算子参照がないという全ての述語を抽出し、各探索ノードで評価されたシンボル状態を縮小する。
同時に、これらの変更は効果的な計画の地平を短くし、それらがもたらす利益はタスクの長さとともに成長します。
4つのTAMPドメインに対して,提案手法は基本手法である学習演算子に比べて最大4.6倍の高速化を実現している。
さらに重要なのは、ベースラインが解決できない長いシーケンシャルなタスクを解決することだ。
したがってマクロオペレーター発見は計画の加速だけでなく、特定の領域において実際に可解性を決定する。
関連論文リスト
- TaPeR: Probabilistic Recovery of Sparse Task Precedence Graphs from a Handful of Demonstrations [16.604293152314995]
ロングホライゾン操作タスクは、部分的にのみ順序付けされることが多い。
既存のアプローチは典型的には、時間的および象徴的な監督の両方を用いて人間のデモンストレーションからタスク構造を推測する。
本稿では,単純なキネマティックグラフと相対的なオブジェクトポーズ上の分布のみを用いて,実演からタスク依存構造を抽出する手法を提案する。
論文 参考訳(メタデータ) (2026-08-21T12:31:50Z) - Unified Learning of Temporal Task Structure and Action Timing for Bimanual Robot Manipulation [11.051601535345819]
時間的タスク構造は、バイマニュアル操作の基本である。
既存のアプローチでは、これらの2つのレベルを分離しています。
本研究は,人間の実演から象徴的・象徴的な時間的制約を学習するためのアプローチを提案する。
論文 参考訳(メタデータ) (2026-03-06T18:25:42Z) - Multi Agent Reinforcement Learning for Sequential Satellite Assignment Problems [5.896440476510869]
割り当て問題は、エージェントのグループをタスクのグループに割り当てる古典的な最適化問題である。
衛星、電力網、移動ロボットスケジューリングといった現代の多くの応用において、割り当て問題は時間とともに展開される。
この問題にマルチエージェント強化学習を適用し、既知のRL時間グリージーソルバからのブートストラップによる代入値の学習を行う。
我々は,本アルゴリズムが理論的に正当化され,他のアルゴリズムが経験した落とし穴を回避することを実証した。
論文 参考訳(メタデータ) (2024-12-20T05:10:34Z) - Coarse-to-fine Q-Network with Action Sequence for Data-Efficient Robot Learning [62.3886343725955]
本稿では,行動列上のQ値を出力する批判ネットワークを学習する,新しい値に基づく強化学習アルゴリズムを提案する。
実験により、CQN-ASは、様々なスパース逆ヒューマノイド制御およびテーブルトップ操作タスクにおいて、いくつかのベースラインより優れていることが示された。
論文 参考訳(メタデータ) (2024-11-19T01:23:52Z) - ImpressLearn: Continual Learning via Combined Task Impressions [0.0]
本研究は、破滅的な忘れを苦しめることなく、複数のタスクでディープニューラルネットワークを逐次訓練する新しい手法を提案する。
ランダムなバックボーンネットワーク上で少数のタスク固有のマスクの線形結合を学習するだけで、以前に学習したタスクの精度を維持したり、新しいタスクの精度を高めることができることを示す。
論文 参考訳(メタデータ) (2022-10-05T02:28:25Z) - Fast Inference and Transfer of Compositional Task Structures for
Few-shot Task Generalization [101.72755769194677]
本稿では,タスクがサブタスクグラフによって特徴づけられる,数発の強化学習問題として定式化する。
我々のマルチタスクサブタスクグラフ推論器(MTSGI)は、トレーニングタスクから、まず、サブタスクグラフの観点から、一般的なハイレベルなタスク構造を推測する。
提案手法は,2次元グリッドワールドおよび複雑なWebナビゲーション領域において,タスクの共通基盤構造を学習し,活用し,未知のタスクへの適応を高速化する。
論文 参考訳(メタデータ) (2022-05-25T10:44:25Z) - Distribution Matching for Heterogeneous Multi-Task Learning: a
Large-scale Face Study [75.42182503265056]
マルチタスク学習は、共有学習アルゴリズムによって複数のタスクを共同で学習する方法論として登場した。
我々は異種mtlに対処し,検出,分類,回帰問題を同時に解決する。
大規模な顔分析のための最初のフレームワークであるFaceBehaviorNetを構築し、すべての顔行動タスクを共同で学習する。
論文 参考訳(メタデータ) (2021-05-08T22:26:52Z) - Learning Task Decomposition with Ordered Memory Policy Network [73.3813423684999]
OMPN(Ordered Memory Policy Network)を提案し、デモから学習することでサブタスク階層を発見する。
ompnは部分的に観測可能な環境に適用でき、高いタスク分解性能を達成できる。
私たちの視覚化は、サブタスク階層がモデルに出現できることを確認します。
論文 参考訳(メタデータ) (2021-03-19T18:13:35Z) - Dynamic Multi-Robot Task Allocation under Uncertainty and Temporal
Constraints [52.58352707495122]
本稿では,不確実性およびマルチエージェント協調の下での逐次意思決定における重要な計算課題を分離するマルチロボット割当アルゴリズムを提案する。
都市におけるマルチアームコンベヤベルトピック・アンド・プレイスとマルチドローン配送ディスパッチの2つの異なる領域における広範囲なシミュレーション結果について検証を行った。
論文 参考訳(メタデータ) (2020-05-27T01:10:41Z) - Hierarchical Reinforcement Learning as a Model of Human Task
Interleaving [60.95424607008241]
我々は、強化学習によって駆動される監督制御の階層モデルを開発する。
このモデルは、タスクインターリービングの既知の経験的効果を再現する。
その結果、階層的RLがタスクインターリービングのもっともらしいモデルとして支持された。
論文 参考訳(メタデータ) (2020-01-04T17:53:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。