論文の概要: STeP: Signal Temporal Logic for Precise Specifications for Action Generation with Vision Language Models
- arxiv url: http://arxiv.org/abs/2607.18580v1
- Date: Mon, 20 Jul 2026 23:26:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.275806
- Title: STeP: Signal Temporal Logic for Precise Specifications for Action Generation with Vision Language Models
- Title(参考訳): STeP:視覚言語モデルを用いた行動生成のための精密仕様のための信号時間論理
- Authors: Kasra Torshizi, Anukriti Singh, Sidharth Mathur, Khuzema Habib, Leo Du, Pratap Tokekar,
- Abstract要約: 視覚言語アクション(VLA)モデルは印象的な一般化を示すが、しばしば解釈可能性に欠ける。
本稿では,信号時間論理(STL)を高レベル言語理解と低レベルロボット実行を結合した共有表現として用いる階層型フレームワークを提案する。
実世界のテーブルトップドメインに対するアプローチを評価し,言語調和型ロボット計画の精度,信頼性,解釈性を改善するための正式な仕様について述べる。
- 参考スコア(独自算出の注目度): 9.560201418658144
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language-action (VLA) models have shown impressive generalization, but often lack interpretability and can struggle to follow precise natural language instructions that encode spatial, temporal, and logical requirements. We propose a hierarchical framework that uses Signal Temporal Logic (STL) as a shared representation connecting high-level language understanding with low-level robot execution. A high-level policy leverages a VLM to decompose language instructions into high-level subtasks, generate STL specifications for each subtask, and choose a low-level policy for executing each subtask. The STL specifications translate language-derived intent into precise constraints, and the low-level policy selection determines whether those constraints are enforced directly through STL-guided model-predictive control or monitored during execution of a learned policy for perceptually complex, or contact-rich behaviors. By integrating STL into plan validation, low-level policy, subtask monitoring, and replanning, our framework enables language-derived plans to be checked, optimized, and revised at runtime using a common formal structure. We evaluate the approach on a real-world tabletop domain, demonstrating how formal specifications can improve the precision, reliability, and interpretability of language-conditioned robot planning.
- Abstract(参考訳): 視覚言語アクション(VLA)モデルは印象的な一般化を示しているが、しばしば解釈可能性に欠け、空間的、時間的、論理的要求を符号化する正確な自然言語命令に従うのに苦労する。
本稿では,信号時間論理(STL)を高レベル言語理解と低レベルロボット実行を結合した共有表現として用いる階層型フレームワークを提案する。
高レベルポリシーは、VLMを利用して言語命令を高レベルなサブタスクに分解し、各サブタスクのSTL仕様を生成し、各サブタスクを実行するための低レベルポリシーを選択する。
STL仕様は言語由来の意図を厳密な制約に翻訳し、低レベルポリシー選択は、これらの制約がSTL誘導型モデル予測制御を介して直接実施されるか、あるいは、知覚的に複雑または接触豊富な行動のための学習ポリシーの実行中に監視されるかを決定する。
STLを計画検証、低レベルポリシー、サブタスク監視、再計画に統合することにより、我々のフレームワークは共通の形式構造を用いて言語由来の計画を実行時にチェック、最適化、修正することができる。
実世界のテーブルトップドメインに対するアプローチを評価し,言語調和型ロボット計画の精度,信頼性,解釈性を改善するための正式な仕様について述べる。
関連論文リスト
- HELP: Hierarchical Embodied Language Planner for Household Tasks [75.38606213726906]
複雑なシナリオを扱うエージェントは、堅牢な計画能力に大きく依存する。
広範な言語知識を備えた大規模言語モデルは、この役割を果たすことができる。
LLMをベースとした一組のエージェントからなる階層型エンボディード言語プランナーHELPを提案する。
論文 参考訳(メタデータ) (2025-12-25T15:54:08Z) - Zero-Shot Instruction Following in RL via Structured LTL Representations [54.08661695738909]
リニア時間論理(LTL)は、強化学習(RL)エージェントのための複雑で構造化されたタスクを特定するための魅力的なフレームワークである。
近年の研究では、命令を有限オートマトンとして解釈し、タスク進捗を監視する高レベルプログラムと見なすことができ、テスト時に任意の命令を実行することのできる1つのジェネラリストポリシーを学習できることが示されている。
本稿では,この欠点に対処する任意の命令に従うために,マルチタスクポリシーを学習するための新しいアプローチを提案する。
論文 参考訳(メタデータ) (2025-12-02T10:44:51Z) - LangPert: Detecting and Handling Task-level Perturbations for Robust Object Rearrangement [21.236557779562794]
LangPertはTLP(Task-Level Perturbations)の検出と緩和を目的とした言語ベースのフレームワークである。
LangPertはVisual Language Model (VLM)を統合し、ポリシーのスキル実行と環境TLPを包括的に監視する。
実験の結果,LangPertはベースライン法よりも多種多様なTLP状況を効果的に処理できることがわかった。
論文 参考訳(メタデータ) (2025-04-14T05:39:15Z) - Aligning LLM+PDDL Symbolic Plans with Human Objective Specifications through Evolutionary Algorithm Guidance [1.8974443450771445]
我々は,記号的目標仕様の集団を生成するための進化的アプローチを開発する。
本研究は,海上災害復旧作業における原型仕様の収集に対するアプローチを評価するものである。
論文 参考訳(メタデータ) (2024-11-30T00:58:48Z) - CoT-TL: Low-Resource Temporal Knowledge Representation of Planning Instructions Using Chain-of-Thought Reasoning [1.433758865948252]
我々は、自然言語仕様を表現に変換するためのデータ効率のよいインコンテキスト学習フレームワークであるCoT-TLを紹介した。
CoT-TLは、ローデータシナリオで3つの多様なデータセット間で最先端の精度を達成する。
我々はCoT-TLの実用性を自然言語命令に基づく多段階ドローン計画のためのQuadCopterに組み込む。
論文 参考訳(メタデータ) (2024-10-21T17:10:43Z) - Nl2Hltl2Plan: Scaling Up Natural Language Understanding for Multi-Robots Through Hierarchical Temporal Logic Task Representation [8.180994118420053]
Nl2Hltl2Planは自然言語コマンドを階層線形時間論理(LTL)に変換するフレームワーク
まず、LLMは命令を階層的なタスクツリーに変換し、論理的および時間的関係をキャプチャする。
次に、微調整されたLLMは、サブタスクをフラットな公式に変換し、階層的な仕様に集約する。
論文 参考訳(メタデータ) (2024-08-15T14:46:13Z) - From LLMs to Actions: Latent Codes as Bridges in Hierarchical Robot Control [58.72492647570062]
我々は,制限を克服する代替アーキテクチャとして,Learningable Latent Codes as Bridges (LCB)を導入した。
methodoutperforms baselines that leverage pure language as the interface layer on tasks that requires reasoning and multi-step behaviors。
論文 参考訳(メタデータ) (2024-05-08T04:14:06Z) - Learning adaptive planning representations with natural language
guidance [90.24449752926866]
本稿では,タスク固有の計画表現を自動構築するフレームワークであるAdaについて述べる。
Adaは、プランナー互換の高レベルアクション抽象化と、特定の計画タスク領域に適応した低レベルコントローラのライブラリを対話的に学習する。
論文 参考訳(メタデータ) (2023-12-13T23:35:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。