論文の概要: Inference-Time Robot Behavior Steering through Physically-Aware Reconfiguration of Task-Structure
- arxiv url: http://arxiv.org/abs/2606.26588v1
- Date: Thu, 25 Jun 2026 04:20:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.157025
- Title: Inference-Time Robot Behavior Steering through Physically-Aware Reconfiguration of Task-Structure
- Title(参考訳): タスクストラクチャの物理的再構成による推論時間ロボット動作のステアリング
- Authors: Yiyuan Pan, Hanjiang Hu, Shangtao Li, Xusheng Luo, Changliu Liu,
- Abstract要約: ReStructは、オブジェクト中心の仕様から時間論理的な制約まで、幅広い好みを操縦します。
タスクの成功と選好フォローの両方でVLAモデルを上回る。
- 参考スコア(独自算出の注目度): 13.442250004542581
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A central challenge in deploying learned robot policies is inference-time behavior steering: redirecting a policy at test time to satisfy user preferences not anticipated during training, without retraining. Existing methods fail in two modes: end-to-end methods require fine-tuning or expert-level guidance, while neuro-symbolic methods rely on predefined symbols whose edits can result in logically reasonable but physically infeasible plans. To address this challenge, we propose ReStruct, which builds upon a neural automaton policy that decomposes a visuomotor policy into a high-level state-machine skeleton capturing task structure and a low-level continuous controller represented as a residual policy. Specifically, ReStruct adopts the automaton to represent the preference and incorporates it into the skeleton through a synchronous product, thereby reconfiguring the task structure. With the controller kept frozen, the action priors provided by the skeleton are updated accordingly to enable physically-aware control under a modified task structure. Extensive experiments from simulation and real-world show that ReStruct steers a wide range of preferences, from object-centric specifications to temporal-logic constraints, and after steering surpasses existing methods, exceeding VLA models in both task success and preference-following by up to 25%.
- Abstract(参考訳): 学習したロボットポリシーのデプロイにおける中心的な課題は、推論時行動ステアリング(inference-time behavior steering)である。
既存の手法は2つのモードで失敗する: エンドツーエンドの手法は微調整や専門家レベルのガイダンスを必要とするが、ニューロシンボリックな手法は事前に定義されたシンボルに依存しており、編集は論理的に合理的だが物理的に実現不可能な計画をもたらす。
この課題に対処するため、我々は、ビジュモータポリシーをタスク構造をキャプチャする高レベルな状態マシンスケルトンと、残留ポリシーとして表される低レベルな連続コントローラに分解する神経オートマトンポリシーに基づくReStructを提案する。
具体的には、ReStructはオートマトンを採用して好みを表現し、同期製品を通じてスケルトンに組み込んでタスク構造を再構成する。
コントローラが凍結し続けると、スケルトンによって提供されるアクション先を更新して、修正されたタスク構造の下で物理的に認識される制御を可能にする。
シミュレーションと実世界の大規模な実験により、ReStructはオブジェクト中心仕様から時間論理的制約まで幅広い好みを操縦し、ステアリングが既存の手法を超越した後、タスク成功と選好フォローの両方においてVLAモデルを超えることが示されている。
関連論文リスト
- CoStream: Composing Simple Behaviors for Generalizable Complex Manipulation [61.25264898597319]
複雑な操作能力は、単純で独立した振る舞いの合成から自然に現れることを示す。
基礎モデルと多種多様な感覚的モダリティを複数の構成可能なコア動作に編成するフレームワークである ourshort を提案する。
我々は,日常的な操作と高精度な組み立てにまたがる8つの実世界のタスクについて,コンタクトリッチなアセンブリとオブジェクト転送において,最も大きな成果を上げていることを実証する。
論文 参考訳(メタデータ) (2026-06-24T22:25:19Z) - Learning Reactive Dexterous Grasping via Hierarchical Task-Space RL Planning and Joint-Space QP Control [50.28263951510334]
本稿では,リアクティブなデクスタリーグルーピングのためのハイブリッド階層型制御フレームワークを提案する。
提案手法は,低レベル共同実行から高レベル空間意図を明示的に分離する。
我々は厳密なシミュレーションと現実のパイプラインを通して提案したフレームワークを広範囲に検証する。
論文 参考訳(メタデータ) (2026-05-05T04:49:38Z) - Emergent Neural Automaton Policies: Learning Symbolic Structure from Visuomotor Trajectories [14.475289544849007]
ENAP(Emergent Neural Automaton Policy)は、バイスモータのデモンストレーションから適応的に2段階のニューロシンボリックポリシーを実現するためのフレームワークである。
タスク構造を離散的な遷移と連続的な残差で明示的にモデル化することにより、ENAPはタスク固有のラベルを必要とせずに高いサンプル効率と解釈性を達成する。
論文 参考訳(メタデータ) (2026-03-26T20:50:36Z) - Closed-Loop Verbal Reinforcement Learning for Task-Level Robotic Planning [1.6641413441634143]
本稿では,モバイルロボットシステムにおけるタスクレベル計画の解釈のための新しい言語強化学習フレームワークを提案する。
このフレームワークはクローズドループアーキテクチャに従い、物理的環境との相互作用を通じて反復的なポリシー改善を可能にする。
提案手法は,実行不確実性下で複数段操作およびナビゲーションタスクを行う実移動ロボット上で検証される。
論文 参考訳(メタデータ) (2026-03-23T16:28:36Z) - LDHP: Library-Driven Hierarchical Planning for Non-prehensile Dexterous Manipulation [3.829270241398111]
非包括的操作は、非構造化設定で、細く、大きく、または、その他の非移植不可能なオブジェクトを扱うのに不可欠である。
事前の計画と探索に基づく手法は、しばしばアドホックな手動設計に依存するか、物理的に実現不可能な動作を生成する。
本稿では,ライブラリ駆動型階層型プランナ(LDHP)を提案する。
論文 参考訳(メタデータ) (2026-03-14T08:54:49Z) - RADAR: Closed-Loop Robotic Data Generation via Semantic Planning and Autonomous Causal Environment Reset [48.645870795753105]
ロボットのためのロバスト自動データ取得(RADAR)について紹介する。
RADARは完全に自律的でクローズドループのデータ生成エンジンで、収集サイクルから人間の介入を完全に取り除きます。
シミュレーションでは、複雑な長期タスクにおいて、最大90%の成功率を達成する。
論文 参考訳(メタデータ) (2026-03-12T11:18:52Z) - Zero-Shot Instruction Following in RL via Structured LTL Representations [50.41415009303967]
マルチタスク強化学習では、エージェントが訓練中に見えない新しいタスクをゼロショットで実行しなければならない。
この設定では、最近、時間的に拡張された構造化タスクを特定するための強力なフレームワークとして線形時間論理が採用されている。
既存のアプローチはジェネラリストの政策を訓練することに成功しているが、仕様に固有のリッチな論理的・時間的構造を効果的に捉えるのに苦労することが多い。
論文 参考訳(メタデータ) (2026-02-15T23:22:50Z) - ToolSelf: Unifying Task Execution and Self-Reconfiguration via Tool-Driven Intrinsic Adaptation [60.25542764389203]
LLM(Large Language Models)を利用したエージェントシステムは、複雑で長期のタスクに対処する上で、顕著な可能性を示している。
既存のアプローチでは、手動のオーケストレーションやランタイムベースのパッチを頼りにしており、一般化の貧弱さと最適化の断片化に悩まされることが多い。
ツール駆動の自己修正を可能にする新しいパラダイムであるToolSelfを提案する。
論文 参考訳(メタデータ) (2026-02-08T09:27:18Z) - Constrained Decoding for Robotics Foundation Models [12.916330118607918]
本稿では,自動回帰ロボット基盤モデルのための制約付き復号化フレームワークであるSafeDecを紹介する。
タスク固有の安全ルールはSignal Temporal Logic (STL) 公式として表現され、最小限のオーバーヘッドで推論時に強制される。
提案手法は,実行時に仮定された動的条件下でのSTL仕様を,再トレーニングなしで確実に満たすものである。
論文 参考訳(メタデータ) (2025-09-01T19:17:40Z) - Learning Robust Policy against Disturbance in Transition Dynamics via
State-Conservative Policy Optimization [63.75188254377202]
深層強化学習アルゴリズムは、ソースとターゲット環境の相違により、現実世界のタスクでは不十分な処理を行うことができる。
本研究では,前もって乱れをモデル化せずにロバストなポリシーを学習するための,モデルフリーなアクター批判アルゴリズムを提案する。
いくつかのロボット制御タスクの実験では、SCPOは遷移力学の乱れに対する堅牢なポリシーを学習している。
論文 参考訳(メタデータ) (2021-12-20T13:13:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。