論文の概要: APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts
- arxiv url: http://arxiv.org/abs/2607.08024v1
- Date: Thu, 09 Jul 2026 01:02:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.381735
- Title: APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts
- Title(参考訳): APIVOT: インターリーブなビジョンランゲージ思考による適応的プランニング
- Authors: Emily Jin, Joy Hsu, Yiqing Xu, Weiyu Liu, Nick Haber, Jiajun Wu,
- Abstract要約: ロングホライズンロボット計画には、意味的タスク構造と幾何学的実現可能性に関する共同推論が必要である。
本稿では,長期計画のための言語と視覚的思考を適応的にインターリーブするVLMベースのプランナであるAPIVOTを提案する。
- 参考スコア(独自算出の注目度): 31.4625895558506
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-horizon robot planning requires jointly reasoning over semantic task structure and geometric feasibility. To successfully execute a task, a robot must decompose goals, select task-relevant objects, and sequence actions, while ensuring that plans satisfy spatial constraints such as limited free space and object collisions. In this work, we propose APIVOT, a VLM-based planner that adaptively interleaves language and visual thoughts for long-horizon planning. APIVOT learns to leverage language for semantic reasoning, while using visual thoughts as imagined future states for internal verification of geometric feasibility. On long-horizon kitchen tasks, APIVOT outperforms general-purpose VLMs and prior planning frameworks, achieving the largest gains in spatially constrained settings. We find that APIVOT learns meaningful modality selection behavior, demonstrating that adaptive interleaving of vision-language thoughts improves both planning success and reasoning efficiency.
- Abstract(参考訳): ロングホライズンロボット計画には、意味的タスク構造と幾何学的実現可能性に関する共同推論が必要である。
タスクをうまく実行するには、ロボットは目標を分解し、タスク関連オブジェクトを選択し、シーケンスアクションを選択し、計画が限られた自由空間や物体衝突のような空間的制約を満たすことを保証する必要がある。
本研究では,長期計画のための言語と視覚的思考を適応的にインターリーブするVLMベースのプランナであるAPIVOTを提案する。
APIVOTは、意味論的推論に言語を活用することを学び、幾何学的実現可能性の内的検証のために、将来の想像状態として視覚的思考を使用する。
長期のキッチンタスクでは、APIVOTは汎用VLMや事前計画フレームワークよりも優れており、空間的に制約された設定で最大の利益を得ている。
APIVOTは意味のあるモダリティ選択の振る舞いを学習し、視覚言語思考の適応的インターリーブが計画の成功と推論効率の両方を改善することを示す。
関連論文リスト
- Any House Any Task: Scalable Long-Horizon Planning for Abstract Human Tasks [46.59814877000871]
AHAT(Any House Any Task)は、大規模環境における長期計画に最適化された家庭用タスクプランナーである。
AHATは、タスク命令とテキストシーングラフを計画ドメイン定義言語(PDDL)で定義された接地サブゴールにマッピングするために訓練されたLLMを利用する
複雑で曖昧な意図を分解するモデルの能力を高めるために,新しい強化学習アルゴリズムであるTGPOを導入する。
論文 参考訳(メタデータ) (2026-02-12T18:28:28Z) - Embodied Long Horizon Manipulation with Closed-loop Code Generation and Incremental Few-shot Adaptation [12.077740860502878]
身体的ロングホライゾン操作では、ロボットシステムが視覚や自然言語などのマルチモーダル入力を処理し、それらを実行可能なアクションに変換する必要がある。
近年,大規模言語モデル (LLM) を自然言語を用いてタスクをサブタスクに分解し,事前訓練した低レベルコントローラを誘導する高レベルプランナとしての利用が検討されている。
我々のフレームワークは,LoHoRavens,CALVIN,Franka Kitchen,および乱雑な現実世界設定をまたいだ,30以上の多様かつ不明瞭なロングホライゾンタスクに対して,最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-03-27T20:32:58Z) - VSP: Assessing the dual challenges of perception and reasoning in spatial planning tasks for VLMs [102.36953558562436]
視覚言語モデル(VLM)は、エキサイティングな言語モデル(LM)のクラスである。
VLMの未調査能力の1つは、視覚空間計画である。
本研究は,これらのモデルにおける空間計画能力を概ね評価するベンチマークを提案する。
論文 参考訳(メタデータ) (2024-07-02T00:24:01Z) - DKPROMPT: Domain Knowledge Prompting Vision-Language Models for Open-World Planning [9.31108717722043]
視覚言語モデル(VLM)はロボットのタスク計画問題に適用されている。
DKPROMPTは、オープンワールドにおける古典的計画のためのPDDLにおけるドメイン知識の利用を促すVLMを自動化する。
論文 参考訳(メタデータ) (2024-06-25T15:49:47Z) - Plan-Seq-Learn: Language Model Guided RL for Solving Long Horizon Robotics Tasks [50.27313829438866]
Plan-Seq-Learn (PSL) は、抽象言語と学習した低レベル制御の間のギャップを埋めるためにモーションプランニングを使用するモジュラーアプローチである。
PSLは85%以上の成功率、言語ベース、古典的、エンドツーエンドのアプローチを達成している。
論文 参考訳(メタデータ) (2024-05-02T17:59:31Z) - Using Left and Right Brains Together: Towards Vision and Language
Planning [95.47128850991815]
本稿では,任意の形態の入力を伴うタスクに対して,視覚と言語を同時に計画する新しい視覚言語計画フレームワークを提案する。
我々は,視覚言語タスク,視覚のみタスク,言語のみタスクにまたがるフレームワークの有効性を評価する。
論文 参考訳(メタデータ) (2024-02-16T09:46:20Z) - Unified Task and Motion Planning using Object-centric Abstractions of
Motion Constraints [56.283944756315066]
本稿では,タスクとモーションプランニングを一つの検索に統一するTAMP手法を提案する。
我々のアプローチは、オフザシェルフAIサーチの計算効率を活用して、物理的に実現可能な計画が得られるような、オブジェクト中心の動作制約の抽象化に基づいている。
論文 参考訳(メタデータ) (2023-12-29T14:00:20Z) - Learning adaptive planning representations with natural language
guidance [90.24449752926866]
本稿では,タスク固有の計画表現を自動構築するフレームワークであるAdaについて述べる。
Adaは、プランナー互換の高レベルアクション抽象化と、特定の計画タスク領域に適応した低レベルコントローラのライブラリを対話的に学習する。
論文 参考訳(メタデータ) (2023-12-13T23:35:31Z) - Planning as In-Painting: A Diffusion-Based Embodied Task Planning
Framework for Environments under Uncertainty [56.30846158280031]
具体的AIのためのタスクプランニングは、最も難しい問題の1つだ。
In-paintingとしての計画」というタスク非依存の手法を提案する。
提案するフレームワークは,様々な具体的AIタスクにおいて,有望なパフォーマンスを実現する。
論文 参考訳(メタデータ) (2023-12-02T10:07:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。